注册并分享邀请链接,可获得视频播放与邀请奖励。

Max For AI (@MaxForAI) “卧槽????tmd这次 @claudeai 把牙膏挤爆了🤯!!! Anthropic刚刚发布Claude Opus” — TopicDigg

Max For AI 的个人资料封面
Max For AI 的头像
Max For AI
@MaxForAI
加入 September 2023
0 正在关注    0 粉丝
卧槽????tmd这次 @claudeai 把牙膏挤爆了🤯!!! Anthropic刚刚发布Claude Opus 5。 以拉爆Claude Fable 5的前沿能力,价格直接来到Fable的一半。 Opus 5的API价格是每百万Token输入5美元、输出25美元,和Opus 4.8完全相同。 Fable 5则是10美元和50美元。 Anthropic直接把它定义为一款可以每天使用的高端模型,并将其设为Claude Max默认模型、Claude Pro最强模型。 跑分方面在CursorBench 3.2中,Opus 5开启最高Effort后,成绩只比Fable 5峰值低0.5%,但单任务成本只有后者一半。 在Frontier-Bench上,它以更低的单任务成本,将Opus 4.8的成绩提升到两倍以上。 Anthropic称,Opus 5目前已经在Frontier-Bench和GDPval-AA等编程、知识工作评测中达到SOTA。 Agent和电脑操作的提升更夸张,同时ARC-AGI 3成绩是第二名的3倍。。。 Zapier AutomationBench中,同等成本下通过率约为第二名的1.5倍,即使使用最低Effort,完成的任务也比其他模型更多。 OSWorld 2.0中,Opus 5只花Fable 5略高于三分之一的成本,就超过了Fable 5的最好成绩。 但这次最值得关注的,可能还不是跑分。 Anthropic反复强调Opus 5更擅长验证自己的工作,并持续迭代到任务真正完成。 一个测试里,模型拿不到机械零件原图,只能访问原始像素。Opus 5自己写了一套计算机视觉管线,提取几何结构,最后在FreeCAD中重建出了完整零件。 另一个任务中,它发现没有实时数据流可以验证代码,于是顺手给自己搭了一套测试框架。 这是一种很关键的Agent能力:发现当前环境缺少完成任务所需的工具,然后自己创造工具。 Opus 5同时加入了Fast Mode,速度大约是默认模式的2.5倍,价格是基础版本的两倍。 API模型名为claude-opus-5,目前已经登陆Claude、Claude Code、Claude Cowork和Claude Platform。 Anthropic现在的模型分层也越来越清楚: Sonnet负责规模和成本; Opus负责绝大部分高难度日常工作; Fable和Mythos继续探索能力与高风险领域的最前沿。 Opus 5真正的场景是大量编程、研究、数据分析和Agent任务,它正在让用户很难继续为Fable 5支付两倍价格。 前沿模型开始主动下放能力、压低价格。 模型战争接下来的重点,会从谁的能力上限最高,逐渐变成谁能用更低成本,把任务稳定地做完。 牛逼,看来前段时间 @OpenAI 和中国开源模型们( @Kimi_Moonshot@Zai_org )真的给A/太多压力了! 继续加油啊家人们!
显示更多