Anthropic 放出了 Sonnet 5.5 的完整跑分,最抢眼的一行是
Terminal-Bench 4.0:Sonnet 5 是 10.3%,Sonnet 5.5 是 70.6%,一代之内涨了将近七倍,还超过了 Opus 5.5 的 66.4%。
几个关键数字:
OSWorld 2.1 电脑操控:57.0% 到 80.1%,Opus 5.5 是 81.8%。
GDPval-AA 职场知识任务:1844,Opus 5.5 是 1846,GPT-6 Sol 是 1487。
图表识别 Chartography:15.6% 到 61.6%,Sol 是 53.6%。
价格 $2/$10,和 Sonnet 5 一样,是 Opus 5.5 的一半。
很多人看这张表最大的误区,是以为 Sonnet 5.5 已经全面追平 Opus 5.5。脚注里有三处要读:
Terminal-Bench 上 Sonnet 用的是 max 档,Opus 用的是 xhigh 档,档位不一样。
独立机构 Artificial Analysis 自己跑出来是 64%,比官方低。
FrontierCode 上 Sonnet 是 46.2%,Opus 5.5 是 54.4%,Sol 是 49.3%,Sonnet 在这一项排在两者后面。
这张表真正讲透的一件事是:便宜的 token 不等于便宜的任务。max 档下,Sonnet 5.5 每个任务要输出约 19 万 token,比 Opus 5.5 还多约六成。独立测下来,最高档的单任务成本已经超过 Opus 5.5。而且拉满也不一定更强,FrontierCode 上 xhigh 是 52.1%,max 反而掉到 46.2%。
所以同样用 Sonnet 5.5,一律拉到 max 的人,账单可能比用 Opus 还高;按任务选档的人,才吃到它便宜的那一半。
你上一次选模型,是看跑分表,还是看自己任务的账单?挑一个真实任务,high 和 max 各跑一遍,对比 token 和结果,再决定。
显示更多
Google 这次把本地 RAG 的门槛直接打下来了。
原本要占 31GB 内存的向量索引,现在压到只要 4GB。
1000 万份文档,一台普通电脑就能跑。
更狠的是:
→ 单个向量压缩 16 倍
→ 检索速度比 FAISS 快 10%–19%
→ 不用训练
→ 不用重建索引
→ 不需要 GPU 集群
→ 全程本地运行
这意味着以后做知识库、文档搜索、个人 AI 助手,可能根本不需要昂贵的云服务。
Google 开源的不是一个小优化,而是在重新定义本地向量搜索的成本。
显示更多
这个项目值得关注。
AI Hedge Fund 2.0 正式上线了。
它的运行方式很简单:
1. 选择你想交易的股票
2. AI 投资者负责研究分析
3. 量化模型执行交易
4. 每一次决策都会给出解释
而且这还只是开始,项目 100% 开源。
显示更多
有位父亲为女儿搭建了一套完整的知识图谱,覆盖小学一、二年级的阅读、写作和数学。
里面包含 463 个知识技能点、9,601 项学习内容,以及 155 小时的有效学习时长,全部都被系统梳理了出来。
显示更多
Codex 的子 Agent 调度有个问题—或者更准确地说,是 ChatGPT 的问题。
spawn_agent工具不能选择模型,也不能设置推理强度。
所以,每次 GPT-5.6 Sol Ultra 创建一个子 Agent,跑起来的还是另一个 Sol Ultra 实例。
这就是为什么你的额度掉得这么快。
显示更多
There's a flaw in Codex's (or should I say ChatGPT's?) subagent orchestration.
The spawn_agent tool doesn't let you choose the model or reasoning effort.
Therefore, every time 5.6 Sol Ultra spawns a subagent, you're getting another Sol Ultra instance.
That's why your quota gets drained so fast.
显示更多
GPT-5.6 Sol 在 Blender 里跑到了 750 Token/s。
没有加速,居然完全是实时的。
说真的,这种现场表现比看跑分震撼多了。
我靠,太猛了,NEO 的双手:让 AI 真正接入现实世界的接口