Anthropic 放出了 Sonnet 5.5 的完整跑分,最抢眼的一行是
Terminal-Bench 4.0:Sonnet 5 是 10.3%,Sonnet 5.5 是 70.6%,一代之内涨了将近七倍,还超过了 Opus 5.5 的 66.4%。
几个关键数字:
OSWorld 2.1 电脑操控:57.0% 到 80.1%,Opus 5.5 是 81.8%。
GDPval-AA 职场知识任务:1844,Opus 5.5 是 1846,GPT-6 Sol 是 1487。
图表识别 Chartography:15.6% 到 61.6%,Sol 是 53.6%。
价格 $2/$10,和 Sonnet 5 一样,是 Opus 5.5 的一半。
很多人看这张表最大的误区,是以为 Sonnet 5.5 已经全面追平 Opus 5.5。脚注里有三处要读:
Terminal-Bench 上 Sonnet 用的是 max 档,Opus 用的是 xhigh 档,档位不一样。
独立机构 Artificial Analysis 自己跑出来是 64%,比官方低。
FrontierCode 上 Sonnet 是 46.2%,Opus 5.5 是 54.4%,Sol 是 49.3%,Sonnet 在这一项排在两者后面。
这张表真正讲透的一件事是:便宜的 token 不等于便宜的任务。max 档下,Sonnet 5.5 每个任务要输出约 19 万 token,比 Opus 5.5 还多约六成。独立测下来,最高档的单任务成本已经超过 Opus 5.5。而且拉满也不一定更强,FrontierCode 上 xhigh 是 52.1%,max 反而掉到 46.2%。
所以同样用 Sonnet 5.5,一律拉到 max 的人,账单可能比用 Opus 还高;按任务选档的人,才吃到它便宜的那一半。
你上一次选模型,是看跑分表,还是看自己任务的账单?挑一个真实任务,high 和 max 各跑一遍,对比 token 和结果,再决定。
显示更多