注册并分享邀请链接,可获得视频播放与邀请奖励。

与「skillopt」相关的搜索结果

skillopt 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 skillopt 的内容
微软联合交大、同济、复旦发了一个框架叫 SkillOpt,思路很有意思:像训练神经网络一样训练 AI Agent 的技能文件 它不动模型权重,训练的是 Skill——就是你给 Claude Code 或 Codex 写的那些 prompt 和指导文档 做法是把神经网络训练的那套搬过来:轮次、批量大小、学习率、验证门控,全部套在自然语言上。执行任务 → 记录过程 → 复盘 → 修改 Skill → 验证效果,自动闭环迭代 结果很夸张。7个大模型、6类任务、3种 Agent 环境,总共52组测试,全部第一或并列第一 但最有价值的不是跑分,是它的迁移能力: 在 GPT-5.4 上优化好的技能文件,直接给 GPT-5.4-nano 用,性能提升 5.6 分 在 Claude Code 里优化好的技能,直接搬到 Codex 里用,提升 29.4 分 甚至能从一个数学基准迁移到另一个 一个 best_skill.md 文件,到处能用 对那些天天手动调 prompt 调到头秃的人来说,这个东西等于把调参这件事自动化了
显示更多
0
8
215
41
转发到社区
正式发布 obelisk v0.1.0 你的 Claude Code session 不该躺在文件夹里睡觉,它们很有价值,现在你的 agent 可以通过 obelisk 搭建的检索层快速追溯历史,你也可以在 app 里以各种方式看见它们 Obelisk app 同样使你可以看见 agent 为了减少重复检索的推理而储存的 markdown 格式的记忆,它们存储在什么位置,又是哪些消息产生了它们,并且你可以选择 archive 掉过时的记忆 Obelisk 还提供了一个很有趣的 recap 功能,在你的 agent 里使用 /obelisk recap this week,就可以获得一份 agent 视角为你这周 coding experience 而生成的卡片(图片里展示啦,为了省钱建议使用空对话尝试这个功能!) 你还可以选择将 obelisk app 作为你的 companion,通过 claude code 确定进度,通过 obelisk app 来阅读 cc 的消息,视频里有展示,我认为这会比在 cc 上的体验好上不少! 相较于初版,我们使用 skillOpt 优化了 agent 的检索表现,在 token efficiency 和检索质量上都有了不小的提升 一切 session 数据都储存在本地的 sqlite 当中,我们相信你的数据应当属于你自己——我们也想让它能更好服务于你 repo:
显示更多
0
21
47
2
转发到社区
什么?! skill 也能"训练"了? 以往大家都是凭经验让AI写 skill, 然后调试的时候也是运行几下感觉没bug就完事了. 但 skill 能运行就一定好吗? 于是微软联合上交复旦同济等机构发了一个新框架 SkillOpt, 直接让AI评估skill写的好不好然后不断去优化! 最终, 这个框架写的 skill 让GPT-5.5的直接对话准确率飙升了 23.5分! 这个框架具体是怎么做的也很简单, 让skill迭代过程实现 harness 闭环! 大模型写完 skill 后, 立刻进入跑分流程, 只有得分更高的 skill 变更才会留下来. 跟大模型的强化学习过程如出一辙. 框架的设计也很值得做 Agent 框架的同学借鉴, 比如: 它设计了一个独立的优化器模型, 这个模型是用来写 skill 的, 它会根据 Agent 执行任务的试错表现得分, 对 skill 进行编辑操作(增加、删除、替换文本). 然后就是 harness 流程了:每一次文本编辑都必须在独立的验证集上分数有提升, 才会允许合并. 最后, 也是最精彩的地方, 框架还引入深度学习训练机制, 设计了文本层的学习率预算, 这个的核心就是限制大模型每次只能修改skill的一小部分, 慢慢迭代, 而不是全都重写. 论文中最有价值的数据就在这里, 论文实验发现, 每一步设置 4 到 8 个编辑操作的预算效果最好. 最终的最佳 skill 往往只包含 1 到 4 个被接受的核心修改. 甚至他们还设计了被拒编辑缓冲区, 用来存储训练过程的反面胶材, 以及周期性慢速/元更新, 这个则是跑完一个周期后, 会进行一次盘点, 类似于让框架形成记忆, 能更好的维持后续迭代. 这篇论文的结论十分深刻: skill(prompt) 完全配得上, 也需要一套系统级的训练流程. 原文中的描述直接是: 我们主张, skill 应当作为 Agent 的外部冻结状态来被"训练", 并且训练过程还要"让权重空间优化具有可重复性"! 这是不是意味着, 提示词工程(Prompting)和模型训练(Training) 的界限将逐渐变得模糊? 而提示词工程完全进入了机器学习的领域. 也许很快, 我们再也不需要人类去手动瞎改和调试提示词了! 论文地址: #skillopt# #微软# #提示词工程# #harness#
显示更多
0
17
403
75
转发到社区
Microsoft just released SkillOpt Train agent skills like neural networks — in text space, without touching model weights. Best or tied-best in 52/52 settings across 6 benchmarks and 7 models.
显示更多
0
2
156
25
转发到社区