注册并分享邀请链接,可获得视频播放与邀请奖励。

AYi (@AYi_AInotes) “你永远可以相信@deepseek_ai 开源的诚意!!! DeepSeek 竟然把自己内部工程团队吃饭” — TopicDigg

AYi 的个人资料封面
AYi 的头像
AYi
@AYi_AInotes
加入 October 2025
0 正在关注    0 粉丝
你永远可以相信@deepseek_ai 开源的诚意!!! DeepSeek 竟然把自己内部工程团队吃饭的家伙直接开源了🤯。。 就算DeepSeek API价格涨价12倍, 我依然觉得叫一声梁圣他值得! DeepSeek Harness发布的仓库里,把自己内部工程团队怎么干活的11个真实工程级 Skill,也全部拿出来了, 是他们自己每天在用的Code Review标准、质量门禁、PR验收流程,damn!!! 你可以拿来塞进Agent直接跑: 等于让你的Agent按DeepSeek内部的工程标准干活,像资深工程师一样工作——知道什么优先、什么该拦、什么该删、什么该归档, 1️⃣ dsh-code-review — Agent 按仓库自己的标准做语义审查,优先看正确性、安全边界、生命周期,不是堆 nit
2️⃣ dsh-pre-push-checks — 推送前只跑与当前改动相关的最小检查,不是机械全量测试
3️⃣ dsh-find-simplifications — 主动找过度设计、死代码、重复实现,写成正式提案
4️⃣ dsh-merging-stacked-prs — 安全落地一串依赖的 Stacked PR,不再手动改 base 改到崩溃
5️⃣ dsh-doc-site-sync — 文档站永远是源文件的投影,不是两套独立的东西
6️⃣ dsh-doc-standards — 文档层级、字数预算、教程 vs 参考的结构纪律
7️⃣ dsh-prose-standard — 所有 prose 只保留合同(不变量、前后置条件),去掉装饰和推理过程
8️⃣ dsh-translate-docs — 中英双语文档的高质量维护,强制术语一致+验证门禁
9️⃣ dsh-trim-cot-leakage — 清理文档里残留的思维链泄漏、变更叙述、审查痕迹
🔟 dsh-archive-agent-notes — 决策笔记按未来价值归档,解决知识库膨胀问题
1️⃣1️⃣ record-browser-gif — GUI 相关 PR 必须附真实浏览器录制的交互 GIF,验收从看文字变成看行为 我觉得这些skill的真正价值不是教 Agent 写代码,而在于教 Agent 怎么像一个有经验的工程师一样工作——有标准、有优先级、有质量门禁、有归档纪律, 资深工程师脑子里那些隐性的工程纪律,现在变成了可执行、可复用、可审计的 SOP, 做 Coding Agent 或者在搭自己 Harness 的兄弟, 这11个skill值得一个字一个字拆, 每个背后都是踩了无数坑攒出来的工程方法论,比你买多少课都管用。 GitHub 链接放评论区 👇
显示更多
DeepSeek V4 Pro 作为当前最强开源 Agent 模型,有个很离谱的毛病, 或者说是有个真实软肋: 能力高度绑定特定脚手架, 换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91, 也就是说同一个模型,同一套任务,分数能差 7 到 8 分, 区别只在一件事:第一轮你给它用了多少工具, 如果把25 个工具从第一轮全塞进去,91 分,思维链全是 let me,到处乱试, 只给 bash 和 str_replace_editor 两个,稳定 96 到 99, 两阶段锚定——第一轮只给 2 个核心工具,模型真正调用后再解锁完整工具面——连续 98 和 99, 91 和 99,同一个模型,为什么?? V4 Pro 经过强 RL 训练,高能力轨迹被高度条件化在极简接口上,训练时它见的就是这种环境, 你一上来塞 25 个工具加复杂系统提示,等于直接把它推出训练分布, 这时候它除了被干扰了注意力,还相当于被推进了另一个行为模式, 规划者和混乱执行者之间没有过渡,首轮条件直接决定后面整条轨迹, 最讽刺的是官方自己也知道, DeepSeek 跑公开 Agent benchmark 用的就是极简模式,灰测成绩和极简路径高度一致,正式版默认给你 Standard,然后一用就拉, 评测用的脚手架和用户用的脚手架,不是同一个东西, 社区已经出了补丁, dsh-routing-suite 和 dsh-anchored-standard,自动第一轮极简锚定,首次工具调用后挂档解锁, 不想装插件就自己写状态机,第一轮只暴露两个核心工具,模型真调用了再注入剩下的, 最低成本验证:同一个任务,Standard 跑一遍,极简跑一遍,看思维链起手词, let me 开头是混乱模式,we 开头是规划模式,差异肉眼可见, 但补丁能治不代表病好了, 当前最强开源 Agent 模型有个真实软肋:能力高度绑定特定脚手架,换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91, 根本解法是模型自己对更丰富的工具面具备鲁棒性,不是每次靠用户帮它找锚点, 当然不是DeepSeek的模型菜,别一上来就把整套工具箱全放出来,先给两个工具上手再说
显示更多
0
35
388
63
转发到社区