无上限畅用 GPT-5.6-sol的办法
如果你还在用 5.5 的习惯跑 GPT-5.6(Sol),那你现在大概率天天触碰limit
5.6 是真强,但它有个副作用:
单条消息用量暴涨,高推理下一跳就是 5 小时上限的 15%。
Theo 实测了一套省额度、又不掉质量的用法, 按重要性给你捋一遍。
先说为什么会触顶。
5.6 把 5.5 那个"动不动停下来问你要权限"的毛病治好了, 但它会一路干下去,用量跟着翻翻。
很多人还拿 5.5 的习惯在跑,自然天天顶格。
OpenAI 这边也挺坏,Codex 里有些设计就是在推着你多用。
1、Ultra 尽量别碰。
新功能,特别烧额度,等 Theo 专门那期出来再说,现在就当它不存在。
2、Fast 模式关掉。
它提速 1.5 倍,消耗快 2.5 倍。5.6 本来跑得就久,瓶颈在工具调用和跑测试,不在推理速度,关掉体感几乎没差,用量掉一大截。
3、推理级别默认挂 High。
deep SWE 实测:
Low 45%
Medium 61%
High 69%($3.47)
X-high 71%
Max 73%
过了 High,成本翻倍只换来几个点,不划算。
4、模型选 Sol,别选 Luna 和 Terra。
Luna 适合 API 批处理数据,写代码不行;Terra 在智能和成本上全面落后。
5、最重要的一条,在 prompt 里自己给它设停止点。
5.6 太积极,你不拦它就一路做下去。得明确告诉它做到哪停,比如"先写计划,写完停下来等我反馈",或者"一路做完、提 PR、处理完第一轮 review 就停,剩下的交给我"。
停止点可以放得很远,这个点靠 prompt 定,调推理级别或工具配置都控不住它。
6、子代理谨慎用。
Codex 的 V1/V2 实现都一般,5.6 又爱乱开。
要是发现额度掉得特别快、子代理还乱起,往 AGENTS.md 里加一句:"Only use sub-agents if the user explicitly requests them."
还有两个坑单独拎出来:
别手改 context window 和压缩阈值。
模型是按默认 compaction 训出来的,你手改它会变笨还更费钱。
OpenAI 的 Tebo 确认过,默认 272k 就是给 5.6 调好的。
别盲抄别人的 config。
自己去 .codex / AGENTS.md / CLAUDE.md 里改、看 trace、再调,手感是这么试出来的。
最省的就这三条:
关 Fast、推理挂 High、prompt 里自己设停止点。
建议收藏,配置的时候对着调👇
显示更多