Grok 4.6用最低的成本,最优秀的表现,在真实编程测试里拿下了第一。
它的表现和第二名 Fable 5只差0.3个百分点,但每个任务的成本却只有对方的6分之1。
这套测试是Cursor用真实编程任务做的,主要看AI能不能理解项目,修改多个文件,并完成开发工作。
实际表现中,Grok拿到70.8分,Claude Fable 5是70.5分,Claude Opus 5是70分,GPT-5.6 Sol是67.2分。
最离谱的是成本差距。
Grok完成一个任务平均只花2.81美元,Claude Fable 5高达17.32美元。
Claude Opus 5要8.23美元,GPT-5.6 Sol要5.69美元。
显示更多