注册并分享邀请链接,可获得视频播放与邀请奖励。

阿良|AI 工作流 (@RealYDT) “Anthropic 放出了 Sonnet 5.5 的完整跑分,最抢眼的一行是 Terminal-Bench 4.0:Sonne” — TopicDigg

阿良|AI 工作流 的个人资料封面
阿良|AI 工作流 的头像
阿良|AI 工作流
@RealYDT
加入 April 2023
0 正在关注    0 粉丝
Anthropic 放出了 Sonnet 5.5 的完整跑分,最抢眼的一行是 Terminal-Bench 4.0:Sonnet 5 是 10.3%,Sonnet 5.5 是 70.6%,一代之内涨了将近七倍,还超过了 Opus 5.5 的 66.4%。 几个关键数字: OSWorld 2.1 电脑操控:57.0% 到 80.1%,Opus 5.5 是 81.8%。 GDPval-AA 职场知识任务:1844,Opus 5.5 是 1846,GPT-6 Sol 是 1487。 图表识别 Chartography:15.6% 到 61.6%,Sol 是 53.6%。 价格 $2/$10,和 Sonnet 5 一样,是 Opus 5.5 的一半。 很多人看这张表最大的误区,是以为 Sonnet 5.5 已经全面追平 Opus 5.5。脚注里有三处要读: Terminal-Bench 上 Sonnet 用的是 max 档,Opus 用的是 xhigh 档,档位不一样。 独立机构 Artificial Analysis 自己跑出来是 64%,比官方低。 FrontierCode 上 Sonnet 是 46.2%,Opus 5.5 是 54.4%,Sol 是 49.3%,Sonnet 在这一项排在两者后面。 这张表真正讲透的一件事是:便宜的 token 不等于便宜的任务。max 档下,Sonnet 5.5 每个任务要输出约 19 万 token,比 Opus 5.5 还多约六成。独立测下来,最高档的单任务成本已经超过 Opus 5.5。而且拉满也不一定更强,FrontierCode 上 xhigh 是 52.1%,max 反而掉到 46.2%。 所以同样用 Sonnet 5.5,一律拉到 max 的人,账单可能比用 Opus 还高;按任务选档的人,才吃到它便宜的那一半。 你上一次选模型,是看跑分表,还是看自己任务的账单?挑一个真实任务,high 和 max 各跑一遍,对比 token 和结果,再决定。
显示更多