注册并分享邀请链接,可获得视频播放与邀请奖励。

投机实验室 (@LabSpeculation) “Grok 4.6用最低的成本,最优秀的表现,在真实编程测试里拿下了第一。 它的表现和第二” — TopicDigg

投机实验室 的个人资料封面
投机实验室 的头像
投机实验室
@LabSpeculation
加入 January 2022
0 正在关注    0 粉丝
Grok 4.6用最低的成本,最优秀的表现,在真实编程测试里拿下了第一。 它的表现和第二名 Fable 5只差0.3个百分点,但每个任务的成本却只有对方的6分之1。 这套测试是Cursor用真实编程任务做的,主要看AI能不能理解项目,修改多个文件,并完成开发工作。 实际表现中,Grok拿到70.8分,Claude Fable 5是70.5分,Claude Opus 5是70分,GPT-5.6 Sol是67.2分。 最离谱的是成本差距。 Grok完成一个任务平均只花2.81美元,Claude Fable 5高达17.32美元。 Claude Opus 5要8.23美元,GPT-5.6 Sol要5.69美元。
显示更多
0
10
13
1
转发到社区