注册并分享邀请链接,可获得视频播放与邀请奖励。

陈成 的个人资料封面
陈成 的头像

陈成 (@chenchengpro)

@chenchengpro
engineering @qoder_ai_ide, created umijs, dvajs, mako and neovate code.
701 正在关注    12.4K 粉丝
Anthropic 说他们为 Opus 5 删掉了 Claude Code 80% 的系统提示词。 我想验证下是不是。于是把 CLI 指向本地一个小服务器,抓它真正发出去的东西。 第一组数字就不太对。 Opus 4.7:15,225 字符。 Opus 4.8:4,467。 Opus 5:7,694。 他们是在 4.8 上删的,不是 5。Opus 5 的系统提示词比上一代大了 72%。 那 80% 确实是真的。每个版本里都同时带着两套 prompt,一个函数决定发哪套。判定条件是硬编码的子串匹配:model id 含 sonnet、haiku、claude-3-,或者等于 opus-4-0/4-1/4-5/4-6/4-7,走旧的。4.8 不在名单上。 只数手写的那几节策略正文,旧路径 12,443 字符,新路径 2,308。-81%。 删掉的是这几节: # Doing tasks(3,321 字符) # Executing actions with care(3,585) # Text output(1,701) # System(1,627) # Using your tools(752) # Tone and style(557) 换成一节 # Harness,1,702 字符,五条。这五条讲的全是环境长什么样,没有一条在规定该怎么做。markdown 会在终端里渲染,被拒绝的工具调用意味着用户说了不。 整套写注释的规矩,「默认不写注释」「绝不写多段 docstring」,只剩一句: "Write code that reads like the surrounding code: match its comment density, naming, and idiom." 这个开关也支持用户手动控制。CLAUDE_CODE_SIMPLE_SYSTEM_PROMPT=1 能把短 prompt 套到任何模型上。我在 Opus 4.5 上试了一次,拿到的东西和 4.8 实际收到的逐字相同,只差写模型名和知识截止日期的那两行。 没料到的是 Opus 5 又开始往回加。 # Delivering work(2,019 字符)和 # Corrections(1,736),两段新内容,2.1.215 和 2.1.216 里完全没有。它们出现在 2.1.220,挂在一个 capability 上,而这个 capability 只有 claude-opus-5 有。4,467 加这两段,基本就是 Opus 5 的全部差值。 更巧的是 # Corrections 这一段。Anthropic 自己打包了一份 Opus 5 迁移指南,让第三方开发者往自己的 agent 里抄一段进去,抄的就是它,逐字相同。指南给的理由是 Opus 5 "flags and explains its own earlier mistakes at length, which reads as thrash in a user-facing product." Fable 5 走的是第三条路,多一节 # Communicating with the user,8,911 字符。 所以「模型越强越不需要规则」这个说法不太站得住。删是上一代就删完的。换了新模型,翻车的方式也换了,规则就跟着变成一小块补丁,按模型贴。 如果你在这上面做东西,还有两件事。 model id 没被识别,走的又是 Bedrock、Vertex 或者自定义 base URL,就掉回那套 15K 的旧 prompt。它查的是你的 provider,不只是模型。 同一个开关也在分流工具描述。53,328 字符降到 37,167。你的上下文大头根本不在 system prompt 里。 想自己验?可以写个小 HTTP 服务,把 response 存下来,直接返 400。把 ANTHROPIC_BASE_URL 指过去,然后 claude -p "hi" --model 模型id。 Anthropic 删自己的规则我没什么感觉。难受的是我也写过一堆同样的规则,其中不少大概只是在替模型兜底,而它早就不需要人兜了。哪些是,我分不出来,只能一条条删掉看会不会坏。 @trq212 的原帖值得读全文。
显示更多
We removed ~80% of the Claude Code system prompt for our newest models, this is what we've learned about writing system prompts, skills and Claude.MDs for them.
0
26
144
24
转发到社区
入职 qoder 一周,写了 9 个 skill 帮我 onboard。7 个是给这份工作专门写的,2 个通用。 1\ setup-mac:把一台新 mac 变回我的电脑。脚本分 8 段,跑几遍都不会坏。入职前 5 天写的,第一天领到机器就用上了。 2\ qoder-commits:增量读 qodercli 的提交,按分支合并成中文的摘要。上次读到哪它自己记着,重跑只看新的。 3\ qoder-feature-review:按功能拆分然后逐个评审实现。一个 agent 找问题,另一个专门去驳倒它,活下来的才留。 4\ qoder-suggest-from:把 ai 新闻变成能落到代码上的改进清单。每条都得指到具体文件的哪一行,跨次去重后攒了 40 条。 5\ qoder-expert:qoder 产品线的知识库。官方文档镜像一份,官方文档没写的自己喂进去。说实话现在基本还空着。 6\ qoder-onboard:融入助理。工作日志、人物图谱、黑话表、周报、待办都在这。感觉这一周大部分时间都在和他聊天。 7\ qoder-triage:把推特等渠道收来的 bug 和 feature request 去重、跟状态、对着代码库查是哪出的问题。收了 10 条,1 条变成了 pr,还有 1 条查完的结论是「这个不该我们修」。 8\ qoder-resources:采集社区里别人写的 qoder 内容。文章推文视频播客都收,音视频自动转成文字,能全文搜。 9\ me:我的简历和个人事实。写第一人称的东西时不用编,履历和时间线都能翻到出处。llm 知道我是谁才能给更好的 suggest 。 找时间挑一些整理下开源,想看哪个可以说一声哈。
显示更多
0
57
210
15
转发到社区
现在的 AI agent 单兵很能打,可一旦想让团队用起来就散了:强 agent 困在某个人终端里别人看不见,换个 runtime 上下文从头重建,凭据/工具调用/对外动作没地方审,跨天任务没人接力。港大 HKUDS 刚开源的 AgentSpace 给的解法是别把 agent 当工具,当「数字员工」来管。 它是一套「飞书式」的人机协同工作空间,每个 agent 都有 role、owner、技能和权限边界;人类管方向和授权,agent 管协调和执行。四块拼到一起看: 调度靠 AgentRouter,把 Claude Code、Codex、OpenClaw、Hermes 这些 CLI 的事件、session、工具审批、诊断归一成一套执行契约,同一个 agent 不重建,自动给每个任务挑最合适的 runtime(Gemini/OpenCode/NanoBot 走 legacy 模式兜底)。 能力上有「数字员工看板」,把藏在私人账号里的 agent 变成组织资产,role/skills/knowledge/runtime 绑定全可见,能借用、能申请,owner 和 admin 双重审批。协作上 agent 跨 channel、私聊、inbox、文档、任务板干活,高风险动作进 TabTabTab 式人工审批门,人审批的同时 agent 继续推进。治理上有一整套权限控制平面,成员、channel、runtime grant、daemon token、文档、Google Workspace OAuth 委派统一治理,还能诊断「权限漂移」。 工程也很扎实:独立打包的 remote daemon 默认给 12 小时 task timeout 专门扛跨天任务,托管和自托管两种部署零功能差,TypeScript monorepo 约 15.5 万行,Apache 2.0。 说到底它解决的不是「让 agent 更聪明」,而是让一群 agent 在有边界、有记录、有 owner 的操作面上,跟人一起把真实工作做完。
显示更多
最近大家都在聊 agent 的「loop」,但很少人讲清它到底是什么。Warp CEO Zach Lloyd 给了一个能落地的版本:让 Skill 从反馈里自我进化的双层循环,以 GitHub issue 三分类为例。 内循环:每来一个新 issue,GitHub Action 触发云 agent 跑 triage Skill,自动分到 ready-to-implement / needs-info / duplicate 三档,打标签并发一条带隐藏标记 oz-triage v:N 的评论,求 👍/👎。 外循环:每天一个定时 agent 拉取近 14 天所有被分类的 issue,收集三类信号,评论赞踩、人工纠正回复,还有「人把标签从 ready 改成 needs-info」这种标签漂移(最强 ground truth)。然后把信号提炼成可泛化规则,比如别盯着单个 issue 改,而是写成「崩溃报告缺 OS 版本号一律归 needs-info」,再塞进 Skill 的 Learned guidelines 段、版本号 +1,开 PR 让人 review 合并,永不自动改 main。 要点就一句:Skill 就是文件,改进 = 对文件做 diff;反馈天然藏在 issue 标签和评论里,零额外标注成本。同样适用于 code review、bug 修复、事件响应;目标明确时可用自动 grader 替代人工。Warp 已用它管理自家开源仓库并开源了框架(oz-for-oss)。
显示更多
0
13
215
29
转发到社区
@evanyou 分享的间隙,顺手把项目工具链换成了 vite-plus。 演讲还没结束,迁移就完了。
真钱买假模型的事,终于有论文证实了。 研究人员审计了 17 个第三方 LLM 代理 API,发现: • 近 46% 的端点指纹测试不通过 • 声称是 GPT-5 / Gemini-2.5,后台偷偷换成 GLM-4 • 医疗基准准确率从 83% 暴跌到 37% 这些假 API 被引用进了 187 篇学术论文,部分相关项目拿了近 6 万 GitHub Star。 科研结论建立在假模型上,这才是最大的问题。 论文:
显示更多
0
47
994
139
转发到社区