注册并分享邀请链接,可获得视频播放与邀请奖励。

Xudong Han (@Xudong07452910) “小米最近发表的这篇论文很适合所有在为 Agent 性能头疼、但不想每次都去换模型的工程” — TopicDigg

Xudong Han 的个人资料封面
Xudong Han 的头像
Xudong Han
@Xudong07452910
加入 November 2020
0 正在关注    0 粉丝
小米最近发表的这篇论文很适合所有在为 Agent 性能头疼、但不想每次都去换模型的工程师看,harness 工程值得你认真投入。 核心观点:LLM Agent 的性能,几乎有一半的决定权在那层「运行外壳」里,例如提示词、工具描述、记忆接入方式、控制流设计,而不只是底层模型的能力。HarnessX 把这层外壳变成了一个可以像乐高一样组合、并且能自动进化的系统。 具体来说:HarnessX 用「替换代数」定义运行外壳的基本构件,让 harness 的各个组件可以被系统化地替换和组合。然后用一个叫 AEGIS 的多 Agent 进化引擎,自动分析 Agent 运行轨迹,找出哪个组件拖了后腿,提出改进,在不碰底层模型的前提下迭代优化整个外壳系统。在 ALFWorld、GAIA、WebShop、tau³-Bench、SWE-bench Verified 五个基准测试上,平均提升 14.5%,最高单项提升 44.0%。 我觉得「不改模型、只改外壳,就能在五项 benchmark 平均提升 14.5%」这个数字本身最值得反复想。很多团队在用 Agent 时,遇到性能问题的第一反应是「模型不够强」;但 HarnessX 说的是:你可能还没有用完现有模型在正确外壳设计下的潜力。更重要的是:外壳是工程问题,是可以迭代、可以模块化、可以系统优化的,AEGIS 把这件事变成了一个可以跑起来的自动化流程。 以前我们关注 Agent 用什么模型,以后可能更要关注 Agent 的运行外壳设计得有多好,这一层可能才是真正决定 Agent 系统上限的地方。
显示更多
0
26
180
39
转发到社区