省了Token丢了脑子:GPT-5.5 Codex一个优化翻车,GitHub上炸了
省了Token丢了脑子:GPT-5.5 Codex一个优化翻车,GitHub上炸了

GPT-5.5在Codex里"停"在516个推理token。不是偶然——39万条token记录,6个人各自翻了自己的日志,都看到了同一个数字。
而且那516次推理出来的答案,大概率是错的。
快速声明:以下内容基于公开GitHub issue数据和开发者社区复现结果,OpenAI尚未发布官方技术回应。
一、516这个数字不对劲
事情起源于一个GitHub issue[1]。用户vguptaa45翻了自己Codex的token消耗日志,发现一个匪夷所思的规律:
GPT-5.5的推理token数,大量集中在516这个值上——不是差不多,是精准等于516。还有二次峰值在1034和1552,差不多每隔518个token一个台阶。
这不是瞎猜。他分析了39万条token记录,跨越865个会话窗口。
结果:
分析token记录总数:390,195
精确命中516事件数:3,363
GPT-5.5占所有请求:19.3%
GPT-5.5占所有516事件:82.0%
GPT-5.5的516命中率:44.0%
其他模型的516命中率:1.3%
GPT-5.5只占了不到五分之一的请求,但包揽了超过八成的516事件。命中率是其他模型的34倍。
二、不是个例,6个人都翻到了
这个issue发出来后,在Hacker News上炸了[2]。至少6个开发者各自翻了自己的Codex日志,结果一致。
有人扫了1615个JSONL文件(20万条token记录)——GPT-5.5的516命中率31.9%。在cache输入少的场景里,这个比例反而更高。 有人翻了4487个文件(18万条记录)——GPT-5.5的516命中率50.1%,同期GPT-5.3只有0.28%。同一个机器,同一个账号,180倍的差异。 有人只盯着自己的GPT-5.5数据看(5.7万条记录)——516命中率从5月的26.7%涨到7月初的48.1%。
不是个例。不是偶发。而且在恶化。
三、省了推理时间,丢了正确答案
更关键的是数据和准确率的联动。
社区做了一组A/B测试:同一个逻辑谜题,跑5次。命中516token的那几次,答案全是错的。而token数正常变化的那几次,答案对了。
再翻时序数据:
2月份,516命中率几乎为零(0.11%)。平均推理token 268。到了5月份,516命中率飙到53%,平均推理token降到107。
也就是说,GPT-5.5在Codex上的推理时间被压了一大半。而精准卡在516这个阈值的那些请求,错得更多。
目前有三派猜测[3]:
❶ 预算帽子:OpenAI给GPT-5.5的推理设了token上限,516就是那个上限值。超过了直接掐断。 ❷ 批处理残影:推理按512token的固定块生成,516≈512+4是某个chunk对齐的结果。 ❸ 调度器异常:某个路由策略把复杂任务降级到了"快速通道",通道的推理预算就是516。
无论哪种,结果都一样——你花着GPT-5.5的钱,拿到的是被截断的推理。
四、这个账怎么算
2015年,公司把服务器虚拟化了。虚拟化的初衷是省电省机柜,一台物理机跑多个虚拟机,资源弹性调配。听起来很美。结果呢——销售系统跑批的时候,虚拟化平台自动限制了CPU,销售系统慢了一倍。省了电费,丢了午高峰的销售。
GPT-5.5这件事本质上一样:为了省推理token(=省成本),把推理路径压到516以内。但复杂任务需要的推理量不一样,统一压到516必然导致部分任务推理不足,答案准确性断崖下降。
省了一两百个token的钱,丢了核心任务的正确率——这个账,怎么看都不划算。
五、现在的办法
OpenAI还没官方回应。但社区已经总结了几条临时对策[3]:
① 高难度任务切回GPT-5.3-codex或GPT-5.4——这两款的516命中率几乎为零。 ② 提示词里加一句"至少思考60秒,用最大的努力"——有人试了说管用,但没大规模验证。 ③ 重要任务的输出交叉检查——用一个模型出的结果让另一个模型看一眼。
就像便利店当年虚拟化翻车后,我们的办法也很简单:销售跑批时段,把虚拟机CPU上限调高。治不了本,但能扛住午高峰。
话说回来——一个卖推理token的公司,自己在Codex里把推理给截了。这本身就挺黑色幽默的。
👇 关注「亮虾哥」,一起算算AI账 👇
每周不定时更新,篇篇说实话。
#AI编程 #GPT5.5 #Codex #AI工具 #企业IT
参考来源
[1] OpenAI Codex GitHub Issue #30364 — GPT-5.5推理token聚类异常分析 [2] Hacker News 热帖讨论 — 多位独立开发者复现516模式 [3] explainx.ai — GPT-5.5 Codex 516-Token Bug: Evidence and Theories Explained
