最近 在Codex一个人提了一个issue, 他发现codex 的异常现象:
他统计了约 39 万条使用记录后发现,gpt-5.5 在处理任务时,内部“thinking”消耗的 token 数,经常刚好停在 516,有时也会集中在 1034、1552 附近。
这是什么意思?
你可以把 AI 做复杂任务理解成“先在草稿纸上推理,再给出最终答案”。reasoning tokens 就类似这张“草稿纸”用了多少空间。
正常来说,简单问题用得少,复杂问题用得多,数字应该比较自然地分散。
但现在的问题是,很多结果都刚好卡在几个固定数字上。
这就像很多学生写题时,不管题目难度如何,草稿纸都刚好写到第 516 个字就停了。这个现象不太自然。
这可能说明几种情况:
- 系统给模型设置了固定的“思考额度”;
- 高负载时模型被分配到更省资源的模式;
- 某些复杂任务还没想完就被迫停止;
- 也可能只是统计记录方式本身有问题。
他在issue 中说, 不是在证明 OpenAI 一定“偷偷截断了模型思考”。
更准确地说,这是一个值得调查的信号:
如果 AI 在复杂任务中经常被限制思考长度,
那它的回答质量就可能变差,
尤其是在写代码、排查 bug、做复杂推理这类任务里。
显示更多