Every团队评价Grok 4.5:快、便宜,终于好用了
Grok 4.5是SpaceX收购Cursor之后双方合作的首个成果,由Cursor与SpaceXAI联合训练,训练数据来自真实的代码库和软件工具交互。
在Every团队的内部评测中,大家的共识是这已经是一个Opus级别的模型。
在Mike Taylor的最新基准测试中,它甚至略微超过了Claude Opus 4.8:Grok完整执行了每一个步骤并交出打磨完善的结果,而Opus中途停止或跳过了部分任务。
Kieran Klaassen用Every的复合工程工作流跑了一遍后,把它定位在Claude Opus 4.5到4.6的区间,评价是“算不上最先进,但很多事情都能做得不错,而且非常快”。
Grok 4.5最大的竞争优势可能在于成本。xAI称它的运行速度约为每秒80个token,token效率约为领先模型的两倍。价格上,输入每百万token收费2美元、输出6美元,远低于Claude Opus 4.8的5美元和25美元,以及GPT-5.6 Sol的5美元和30美元。
在实际测试中,它在vibe coding和生成式交互方面表现稳健,做出了可用的语音访谈表单、社区地图应用,还成功克隆了Mike的写作风格,PPT制作水平约在Opus 4.6到4.7之间。不足之处在于地图应用不如最新前沿模型精致,写作方面Mike仍然更偏爱Sol。
总体结论:你大概不需要更换日常主力模型。但如果你本来就在Cursor里工作,Grok 4.5触手可及,在那些看重速度、价格和执行完整度的长链条多步骤任务上,它已经赢得了一席之地。
显示更多