注册并分享邀请链接,可获得视频播放与邀请奖励。

AstroHan 的个人资料封面
AstroHan 的头像

AstroHan (@AstroHanRay)

@AstroHanRay
0 正在关注    0 粉丝
同一个 DeepSeek V4 Flash,我们进行了 9 个不同 harness 的头对头测试。 Maka 排名第二,通过率 77.5%,官方 DSH 的 Minimal Mode 排名第四,通过率 73.0%。 最高的是 Codex,最糟糕的是 Claude Code,通过率低且成本最高。
显示更多
GPT-5.6-Sol 消耗倍增的真相找到了。 建议在 ~/.codex/config.toml 加上两行: model_context_window = 272000 model_auto_compact_token_limit = 240000 能让你的 Codex 额度耐用 1.5-2 倍。
显示更多
终于知道 Codex 5.6 跑长任务时,额度为什么可能掉得特别快了。 GPT-5.6 Sol 基础价没涨。 但输入一旦超过 272K tokens, 整次请求都会按更高价格计算。 同样一次长任务,成本可能达到 GPT-5.5 的 2.34 倍。👇
显示更多
0
31
1.5K
137
转发到社区
对比了下,Ollama Cloud 的 tokens/s 比 的 Max 套餐高 40%,首字延迟更是低非常多,流式输出几乎秒回。 各家套餐都用下来,我还是觉得 Ollama Cloud 是使用 GLM-5.2 的最佳选择,吞吐快,延迟低,用量大。
显示更多
如果要用 GLM-5.2, Ollama Cloud Pro 个人测试下面是市面上的最佳选择了,量大管饱,20 美金非多并发基本上用不完。 同价位下的 海外套餐性价比完全比不过,而且还有北京时间 14:00-18:00 的三倍消耗,会比较影响效率。 另外,GLM-5.2 是个好模型!
显示更多
0
12
107
4
转发到社区
如果要用 GLM-5.2, Ollama Cloud Pro 个人测试下面是市面上的最佳选择了,量大管饱,20 美金非多并发基本上用不完。 同价位下的 海外套餐性价比完全比不过,而且还有北京时间 14:00-18:00 的三倍消耗,会比较影响效率。 另外,GLM-5.2 是个好模型!
显示更多
0
54
241
24
转发到社区