注册并分享邀请链接,可获得视频播放与邀请奖励。

Gorden Sun (@Gorden_Sun) “Every团队发布了对OpenAI新模型GPT-5.6 Sol的深度测评。结论是,Sol是一款出色的日常” — TopicDigg

Gorden Sun 的个人资料封面
Gorden Sun 的头像
Gorden Sun
@Gorden_Sun
加入 August 2013
0 正在关注    0 粉丝
Every团队发布了对OpenAI新模型GPT-5.6 Sol的深度测评。结论是,Sol是一款出色的日常协作模型,但在最复杂、最需要独立判断的任务上,Anthropic的Claude Fable仍然更强大。 Sol的核心特点 1)快、稳、遵循指令。 Sol的最大升级在于速度和可引导性。它响应迅速,能让人在还记得“哪里不对劲”的时候就看到修改结果——一次失败的方向只花几分钟,而以往可能要半小时。团队成员评价它“不会做蠢事”,愿意接受纠正,被指出问题后能快速重试。 2)主动找上下文。 Sol会先阅读可用的文件、项目指令和连接的工具,再决定是否需要向人求助。在一项电子表格测试中,它自己找到邮件、检查了46个CSV文件、发现缺失信息,然后带着七个问题回来——每个问题都附上了自己的建议,让人只需批准或修正,无需重新布置任务。 3)执行力和持久性强。 Sol能追踪陌生生产代码库中的bug,完成GPT-5.5多次失败的任务,并且在测试失败时会修复产品本身的问题,没有偷偷弱化测试标准。 但Fable依然更强 尽管Sol表现亮眼,Every团队明确表示:最大、最模糊的任务仍然交给Fable。 在他们的“高级工程师”基准测试中,Fable得分90/100,Sol只有56/100。差距主要来自Sol的一个特定弱点:不知道何时该停。它在重写任务中新增了约12900行代码,每个改动单独看都有理由,但整体重建了过多的复杂度。Sol理解架构没有问题,问题在于缺乏克制——而“决定不做什么”恰恰是高级工程的核心能力之一。 Dan Shipper的比喻:Sol是保时捷,Fable是曲速引擎。Fable能带你跨越星系,但多数时候你只是在城里转转,Sol让你出行更有风度。可当你真的要去远方时,还得靠Fable。(曲速引擎这个比喻足以说明工程师对Fable的称赞) 于是,有工程师用Fable做编排者、定计划,让Sol负责执行;Mike Taylor的做法是“如果你是Human in the loop,Sol所在的Codex应用体验更好;但如果你想把自己从流程中移出去,你需要Fable”。多位成员估计Sol能做到Fable约80%到90%的工作——但剩下那部分,恰恰是最难、最有价值的部分。 推荐使用场景 选Sol · 正在写作、研究、构建或分析一个需要边做边改的项目 · 项目里已经有充足的素材、示例、指令和先前决策 · 目标明确,只需要模型处理步骤、工具和跟进 · 需要一个快速响应、随叫随改的协作伙伴 选Fable · 任务边界模糊,“决定项目需要什么”本身就是工作的重要部分 · 想把长任务完全交出去,离开,回来验收成果 · 简化、架构设计和克制比快速往返更重要 · 需要“尖锐而有锋芒的智能”来做大的架构决策和品味判断 选Opus · 希望在模型工作时看到更多推理过程和进展(Codex的一个短板正是过程可见性差,用户常常需要反推Sol到底改了什么) 结论 Sol代表了日常知识工作的一次重大升级:快速、机灵、善用上下文,是团队想“留在身边”的协作模型。但当任务足够大、足够模糊、足够需要独立判断时,Fable仍然是无可替代的第一选择。
显示更多