省了Token丢了脑子:GPT-5.5 Codex一个优化翻车,GitHub上炸了

2026-07-06 09:28:50 0点赞 0收藏 0评论

省了Token丢了脑子:GPT-5.5 Codex一个优化翻车,GitHub上炸了

省了Token丢了脑子:GPT-5.5 Codex一个优化翻车,GitHub上炸了

GPT-5.5在Codex里"停"在516个推理token。不是偶然——39万条token记录,6个人各自翻了自己的日志,都看到了同一个数字。

而且那516次推理出来的答案,大概率是错的。

快速声明:以下内容基于公开GitHub issue数据和开发者社区复现结果,OpenAI尚未发布官方技术回应。

一、516这个数字不对劲

事情起源于一个GitHub issue[1]。用户vguptaa45翻了自己Codex的token消耗日志,发现一个匪夷所思的规律:

GPT-5.5的推理token数,大量集中在516这个值上——不是差不多,是精准等于516。还有二次峰值在1034和1552,差不多每隔518个token一个台阶。

这不是瞎猜。他分析了39万条token记录,跨越865个会话窗口。

结果:

分析token记录总数:390,195

精确命中516事件数:3,363

GPT-5.5占所有请求:19.3%

GPT-5.5占所有516事件:82.0%

GPT-5.5的516命中率:44.0%

其他模型的516命中率:1.3%

GPT-5.5只占了不到五分之一的请求,但包揽了超过八成的516事件。命中率是其他模型的34倍。

二、不是个例,6个人都翻到了

这个issue发出来后,在Hacker News上炸了[2]。至少6个开发者各自翻了自己的Codex日志,结果一致。

有人扫了1615个JSONL文件(20万条token记录)——GPT-5.5的516命中率31.9%。在cache输入少的场景里,这个比例反而更高。 有人翻了4487个文件(18万条记录)——GPT-5.5的516命中率50.1%,同期GPT-5.3只有0.28%。同一个机器,同一个账号,180倍的差异。 有人只盯着自己的GPT-5.5数据看(5.7万条记录)——516命中率从5月的26.7%涨到7月初的48.1%。

不是个例。不是偶发。而且在恶化。

三、省了推理时间,丢了正确答案

更关键的是数据和准确率的联动。

社区做了一组A/B测试:同一个逻辑谜题,跑5次。命中516token的那几次,答案全是错的。而token数正常变化的那几次,答案对了。

再翻时序数据:

2月份,516命中率几乎为零(0.11%)。平均推理token 268。到了5月份,516命中率飙到53%,平均推理token降到107。

也就是说,GPT-5.5在Codex上的推理时间被压了一大半。而精准卡在516这个阈值的那些请求,错得更多。

目前有三派猜测[3]:

预算帽子:OpenAI给GPT-5.5的推理设了token上限,516就是那个上限值。超过了直接掐断。 ❷ 批处理残影:推理按512token的固定块生成,516≈512+4是某个chunk对齐的结果。 ❸ 调度器异常:某个路由策略把复杂任务降级到了"快速通道",通道的推理预算就是516。

无论哪种,结果都一样——你花着GPT-5.5的钱,拿到的是被截断的推理。

四、这个账怎么算

2015年,公司把服务器虚拟化了。虚拟化的初衷是省电省机柜,一台物理机跑多个虚拟机,资源弹性调配。听起来很美。结果呢——销售系统跑批的时候,虚拟化平台自动限制了CPU,销售系统慢了一倍。省了电费,丢了午高峰的销售。

GPT-5.5这件事本质上一样:为了省推理token(=省成本),把推理路径压到516以内。但复杂任务需要的推理量不一样,统一压到516必然导致部分任务推理不足,答案准确性断崖下降。

省了一两百个token的钱,丢了核心任务的正确率——这个账,怎么看都不划算。

五、现在的办法

OpenAI还没官方回应。但社区已经总结了几条临时对策[3]:

① 高难度任务切回GPT-5.3-codex或GPT-5.4——这两款的516命中率几乎为零。 ② 提示词里加一句"至少思考60秒,用最大的努力"——有人试了说管用,但没大规模验证。 ③ 重要任务的输出交叉检查——用一个模型出的结果让另一个模型看一眼。

就像便利店当年虚拟化翻车后,我们的办法也很简单:销售跑批时段,把虚拟机CPU上限调高。治不了本,但能扛住午高峰。

话说回来——一个卖推理token的公司,自己在Codex里把推理给截了。这本身就挺黑色幽默的。


👇 关注「亮虾哥」,一起算算AI账 👇

每周不定时更新,篇篇说实话。

#AI编程 #GPT5.5 #Codex #AI工具 #企业IT


参考来源

[1] OpenAI Codex GitHub Issue #30364 — GPT-5.5推理token聚类异常分析 [2] Hacker News 热帖讨论 — 多位独立开发者复现516模式 [3] explainx.ai — GPT-5.5 Codex 516-Token Bug: Evidence and Theories Explained

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松