注册并分享邀请链接,可获得视频播放与邀请奖励。

与「PREVIEW」相关的搜索结果

PREVIEW 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 PREVIEW 的内容
阿里把团队内部用了两年的官方 AI Code Review Skills 开源了,采用 “确定性工程 pipeline + AI Agent” 的混合架构,专门解决通用 Agent 做代码审查时 “漏审、定位漂移、质量不稳” 的老问题。 40.5K ✨ 开源项目 OpenCodeReview: # 核心设计:确定性工程 pipeline × Agent 各司其职 确定性工程负责硬约束: · 精确文件选择:用代码决定哪些文件必须审、哪些要过滤,不依赖模型自觉; · 智能文件捆绑:把相关文件合成一个审查单元(例如 message_en.properties 和 message_zh.properties 捆绑),每个单元以上下文隔离的 sub-agent 运行,分治策略让超大变更集也稳,且天然支持并发(默认 8 个文件 worker); · 细粒度规则匹配:内置约 54 个按语言/文件类型的规则文档(Java、Go、TS/JS、Python、Rust、SQL/XML mapper、properties 等),用模板引擎而非自然语言把规则匹配到文件特征上,从源头消除信息噪声; · 外部定位与反思模块:评论的“落点”和“内容”分别由独立的 re-location 和 reflection 模块系统性校正,这正对“位置漂移”痛点。 Agent 负责动态决策: · 深度优化的场景 prompt(内部分为 plan → grouping → main → memory_compression → re_location → review_filter 多个任务模板,可在 internal/config/template/prompts/ 看到); · 从海量生产环境的 tool-call 轨迹(调用频率分布、单工具重复率、新工具对调用链的影响)反向蒸馏出的专用工具集,包括全文件读取、代码搜索、其他变更文件查阅等,比通用 agent 工具箱更小更稳。 # 能力面与生态集成 功能上覆盖:workspace/分支区间/单 commit 审查、断点恢复(ocr session)、全文件 scan(无 git 历史也能审计陌生代码库)、本地 Session Viewer 网页查看与回放、SARIF/JSON 输出、OpenTelemetry 可观测性、MCP Server 扩展。 作为 “Skills 生态” 级项目,它的形态相当完整:既提供 npm 全局 CLI,也提供可移植的 Agent Skill(skills/open-code-review/SKILL.md,带标准 frontmatter,可直接被兼容 skill 的 agent 加载),还有面向 Claude Code、Codex、Cursor、Kimi Code、OpenCode 等平台的插件,每种都封装成斜杠命令或可调用 skill。LLM 侧兼容 OpenAI、Anthropic、AWS Bedrock 三类协议,并可直接复用 Claude Code 的 ANTHROPIC_* 环境变量。 其中一个设计很巧妙:Delegation 模式(ocr delegate preview/rule)。此时 OCR 只做自己擅长的确定性部分(文件选择和规则解析)审查本身交给宿主 coding agent 的 LLM 执行,用户无需给 OCR 配任何 API key。这实际上是把“harness 能力”与“模型能力”彻底解耦。 # 工程质量:超出平均水准的部分 · 安全有正式的 Assurance Case(ASSURANCE_CASE.md):完整的威胁模型、四条信任边界、T1–T7 威胁逐条给出缓解措施,并按 Saltzer & Schroeder 设计原则和 OWASP Top 10 做了映射。细节经得起推敲:所有外部进程调用只限 git 且子命令硬编码、--end-of-options 防 flag 注入;Agent 读文件路径经 pathutil.WithinBase() 在符号链接解析前后双重校验;本地 Viewer 有 Host 白名单防 DNS rebinding + 严格 CSP。这类文档在一般开源项目里非常罕见。 · 贡献规范近乎严苛(AGENTS.md):使用 AI 必须在 issue/PR 中披露工具与模型、必须逐行理解 AI 生成的代码、禁止“AI 生成→反复修复→再修复”的循环、禁止把 commit 署名给 AI。源码强制英文(CI 有 english-check,连全角标点都查)、90% 测试覆盖率门槛、-race 与 govulncheck 每次 push 都跑、SPDX 头与 LF 行尾强制。 # Benchmark:数据情况 官方基准 AACR-Bench(已在 Hugging Face 开放)规模不小:50 个流行开源仓库、200 个真实 PR、10 种语言、80+ 资深工程师交叉验证出 1505 条标注问题。结论是同模型对比 Claude Code:Precision 和 F1 显著更高、token 消耗约为 1/9、速度更快。 需要指出两点:其一,Recall 低于通用 agent,README 自己承认这是“以精度换噪声”的刻意权衡,如果你最怕漏问题而非误报,可能不适合;其二,该基准由阿里自建,虽开放了数据集供社区复核,但独立第三方的复现结论目前还少,可以把它当作“有披露的、方向可信的参考”。
显示更多
0
13
169
39
转发到社区
Cloud sessions are officially available and out of research preview! They let you keep Claude Code working, even when your laptop is closed. Existing subscribers get a one-time credit to try them: $100 on Pro, $250 on Max.
显示更多
0
307
9.3K
654
转发到社区
Today we’re launching Worker Previews. Each Git branch gets a production-like place to run, with its own code, configuration, URL, observability, and state.
0
112
3K
263
转发到社区
一直在等微信开放接口,让我可以处理积累下来的上百 G 聊天数据。试过 Github 上的几个项目都不太成功。 万万没想到,最后这个接口来是被腾讯开放了 :) 感谢 HY4 preview 非常到位 :D 模型太强了!
显示更多
0
125
1.2K
148
转发到社区
这期播客是 The Pragmatic Engineer 对 OpenAI Codex 团队负责人 Thibault(Tibo)的访谈,聊了 Codex 的诞生、技术决策、工程文化以及软件开发方式的变迁。 以下是核心要点: 个人经历与加入 OpenAI Thibault 是比利时人,学应用数学出身,先后做过制药供应链优化的创业公司,在 Google 做过加速移动网页的项目(后被砍掉,让他学到了要时刻审视项目真实影响力的教训),之后在 Google Maps 做评论,再转到 DeepMind。在 DeepMind 期间,他参与了一个内部聊天机器人的开发——本质上就是 ChatGPT,但比 ChatGPT 早了一年。内部传播很快,大家都在分享对话,但 DeepMind 不具备把它作为产品发布的机制,最终没能推出。 后来他得知 ChatGPT 只有大约 20 个人在维护,这让他既震惊又觉得很有吸引力——这意味着极高的个人影响力。于是他加入 OpenAI,进去就赶上了推理模型的冲刺,大约一个月后 o1 preview 就发布了。 为什么用 Rust 写 Codex 这是一个反直觉的决定——当时模型对 Rust 的支持并不好,业界其他 AI 编码工具基本都用 TypeScript 或 Python。但团队从第一性原理出发,认为智能体的核心需要健壮、安全、高效,而 Rust 的编译时验证特性天然适合智能体场景。同时用不同语言也强制建立了产品界面和智能体核心之间的清晰边界,避免代码耦合。事实证明 Rust 确实"很快就变得非常适合智能体开发"。 开源和模型无关的策略 Codex CLI、SDK 都是开源的,而且支持非 OpenAI 模型——这在主要 AI 实验室中是独一无二的。理由很实际:如果不开源,别人只需改十行代码就能 fork 出一个支持其他模型的版本,那还不如自己直接支持。开源的好处包括新员工入职前就已经熟悉代码库、社区贡献、以及逼迫自己靠模型和产品体验赢用户而非靠锁定。 代价也很明显:竞争对手会在你还没发布的时候就抄走你正在公开开发的功能,"确实有点刺痛";还有大量低质量 PR 需要处理。 工程文化与代码审查的变革 新员工入职后听到最多的一句话是"你问过 Codex 了吗?"——因为 Codex 在 OpenAI 内部接入了 Slack、文档、所有代码,几乎任何问题都能给出不错的回答。 代码审查正在发生质变。OpenAI 开发了专门的代码审查模型,能在逻辑推理和安全漏洞检测上达到"超人水平"——可以深入三四层依赖去发现文档错误导致的不变量违反。安全审查已经是强制自动化的,发现安全问题会直接阻止合并。一个 PR 可以当天提交、当天上线到十亿用户的 ChatGPT 上。 代码审查的角色正在从"正确性检查"转向"意图讨论"——你到底想做什么?这件事值不值得做?这种讨论不一定要围绕代码发生。 维护成本和重构的变化 维护一直是软件工程的"税",但现在大量维护工作(依赖升级、安全补丁)可以完全自动化。更重要的是,重新架构的成本也急剧下降——以前可能要花几个月甚至几年的重构,现在快得多。但好的架构设计反而更重要了:设计好"盒子"和不变量,盒子内部随便改都不影响其他部分。 Harness 与模型的关系 一个有趣的洞察:harness(工具/脚手架)总是"走在模型前面"。Codex 团队的工作本质上是为模型搭建拐杖——提醒它跑测试、保持目标一致等。然后下一代模型训练时会把这些能力内化,拐杖就可以去掉,developer message 也会越来越短。最新一代模型已经不再需要 /goal 命令来保持长期任务的专注,"你直接告诉模型去工作一周,它就真的会做到"。 Codex 与 ChatGPT 的合并 这是一个重大工程挑战:Codex 原本完全本地运行,ChatGPT 是托管云服务,两套完全不同的技术栈要统一。目标是让云端版本具备本地版本同样的能力,同时高效到能纳入 20 美元/月的 Plus 计划。ChatGPT Work 模式本质上是在云端虚拟机里运行完整的 Codex harness,机器配置强大到用户可以在里面训练模型、安装 Blender 做 3D 建模。 有趣的是,Codex 在整个合并过程中还充当了"记者"角色,因为它能访问所有 Slack 讨论和文档,记录了团队的辩论和决策过程。 Thibault 的个人用法与建议 他大量使用手机上的 ChatGPT Work,通过语音口述发送任务,定制了专属的技能和指令来生成他能高效消化的报告和幻灯片。任何问题——公众舆情、生产日志、功能使用率分析、团队动态——30 分钟内都能得到答案。周末他还会用 Codex 做代码探索和原型,"一天之内就能把脑子里的想法变成可以展示给人看的东西"。 对工程师的建议:保持深度好奇心,训练自己快速理解系统的能力("五个为什么"不断追问),以及与你服务的用户群体保持同步——如果你无法清晰表达意图,就很难做出好的工作。
显示更多
💥天呐!Tibo刚亲口说:谷歌更早做出过ChatGPT级产品,但不敢发。他听说ChatGPT只有大约20人维护,当场被“规模小到离谱、自主权大到离谱”震住,立刻跳槽,进OpenAI一个月就赶上o1-preview。 更狠的是后面他讲的这些:
🔹Codex核心用Rust写,当时模型根本不会Rust,他们赌Agent很快会需要性能和安全
🔹开源被对手抢先抄功能,“确实有点刺痛”,但他们认了
🔹内部新人第一句话永远是:“你问过Codex了吗?”
🔹代码审查已经超人,安全问题自动拦PR,当天就能推到数亿用户
🔹最新模型不需要脚手架了:“跟它说去干一周,它真的会去干”
🔹把本地Agent和ChatGPT两套完全不同的栈,硬合进20美元套餐 Tibo招人只看三样:快速读懂系统、不停追问Why、有品味。 
“解释不清自己的意图,就做不出真正好的东西。” 这才是真正的产品负责人讲话! #Codex# #OpenAI# #Tibo# #AI编程# #Agent# #PragmaticEngineer#
显示更多
0
25
393
46
转发到社区
Zenless Zone Zero - Velina SFW Preview 2 💕 #ゼンゼロ# #zzzero#
0
3
7.7K
312
转发到社区
🚀 Hy4 preview is here. 770B, 49B active, 1M context. Built for productivity. Open source frontier. Consistent affordable price. Use it. Tell us what breaks. More on Hy blog: HuggingFace: Github:
显示更多
0
95
1.2K
167
转发到社区
Today, we're kicking off the first phase of the research preview for Model Hardware Standard (MHS): a new standard for AI agents to safely operate physical equipment in scientific research and advanced manufacturing. Read more:
显示更多
0
241
5.4K
596
转发到社区
ZERO ALPHA Research Preview | Reframing NVDA NVIDIA’s latest earnings report is the trigger event for a new round of deep research. A company already among the largest in the world just delivered 106% year-over-year revenue growth, with Data Center revenue up 117%. What is striking is not simply that NVIDIA beat expectations again, but that its core business has returned to a doubling growth rate from an already enormous base, even as AMD GPUs, hyperscaler-designed chips, and custom AI accelerators continue to enter the market. That prompted us to go back and re-examine NVIDIA’s full growth trajectory since 2023. When revenue growth, earnings growth, stock-price appreciation, and P/E are viewed together, a very different pattern begins to emerge. The first NVIDIA spring was largely top-down. The market recognized the potential of generative AI first, the stock price moved ahead, and earnings later caught up. The second spring now looks increasingly bottom-up. Revenue growth re-accelerated from: 56% → 62% → 73% → 85% → 106% while valuation multiples moved lower rather than higher. In simple terms: First Spring: P led E. Second Spring: E is beginning to lead P. This earnings report therefore may represent more than another earnings beat. It may be a signal that NVDA itself needs to be reframed. It also raises a broader question: What actually defines a true mega-cap growth stock? A high P/E alone does not define growth. The rarest structure may be a company that is already enormous, still grows its core business near 100%, generates earnings faster than its stock price rises, avoids excessive valuation expansion, and continues to create new TAM. Applying this framework to AMD, MU, SNDK, LITE, ALAB, DELL, and the hyperscalers makes the leadership hierarchy increasingly clear. Many of them have strong growth, but each still carries a weakness in valuation, cyclicality, pricing dependence, platform control, or growth durability. NVDA currently presents a more unusual combination. More importantly, at least four additional growth engines are still developing: Pricing Power Supply Efficiency Open Models Inference Specialization If these continue to develop, today’s NVIDIA may not yet represent the peak of this second growth cycle. And NVIDIA’s second spring may not belong to NVIDIA alone. Memory and storage, optical networking, and AI data-center operators could all benefit if another AI infrastructure expansion cycle is now beginning. ZERO ALPHA will therefore use this earnings report — a mega-cap company returning to 100%+ core growth — as the starting point for a six-part NVDA Research Note series: 1/6. NVDA: The Second Spring — From P Leading E to E Leading P 2/6. NVDA: What Defines a True Mega-Cap Growth Stock? 3/6. NVDA: Why It Is Still in Its Prime, Not Near the Peak 4/6. NVDA: Four New Growth Engines — How Far Can the Second Spring Go? 5/6. NVDA: Why Leaders Lose Leadership — Lessons from Intel, Tesla, and AMD 6/6. NVDA: Will the Second Spring Reignite the Entire AI Infrastructure Chain? Each note will focus on one independent question and can be read on its own. ZERO Insight The most important message from this earnings report may not be that NVIDIA beat expectations again. It may be this: When a company already this large returns to 100%+ core growth while trading at a much lower P/E than during its first AI explosion, what needs to be revalued may not be just NVDA’s stock price — but our entire understanding of mega-cap growth.
显示更多