今天AI圈连着出了两件大事,都跟"用AI做数据分析"的人直接相关。
一边,昨天有开发者曝出,Claude Code里选的最高档推理"high",在API端实际跑成了最低档的数值,“Claude暗中降智"一下子吵翻全网,自测帖刷屏。今天上午,Anthropic的工程师下场回应,公开承认Opus 5是"一个表现很不稳定的模型”。
另一边,OpenAI几乎同时官宣降价:旗舰模型GPT-5.6 Sol的输入token从5美元降到4美元每百万,输出直接从30美元砍到20美元——最贵的输出价格,一刀砍掉三分之一。
这类事件,情绪总是跑得比事实快。与其跟着争论要不要"割肉换模型",不如先把确定的事捋清楚:哪些是真的,哪些已经被证伪,你到底该做什么。
先把"降智"这事拆开看
确定的部分有三条。第一,从Claude Code 2.1.236版本开始,Anthropic把Fable 5的会话纳入了一个叫"压缩effort数值刻度"的服务端实验,更新日志里一个字没写。36氪开发者argofowl怀疑自己的代码坏了、怀疑Mac坏了,debug了一整个下午,最后在API请求日志里发现:自己明明选的是high,实际跑的却是最低档对应的数值。
第二,Opus 5最近被集中吐槽:敷衍、频犯低级错误、自己制造bug再花时间修自己的bug,被指出问题就机械地重复道歉。Anthropic工程师Thariq Shihipar公开承认,Opus 5"表现很不稳定",修复它是"最高优先级"。36氪第三,这不是第一次。今年四月份,Claude Code刚经历过一轮"模型整体变笨"的风波,Anthropic事后复盘的结论是产品层三个独立变更叠加,在v2.1.116修复。微博
但传得最广的那句——“high档被偷偷映射成100分里的10分,等于low”——被一位装了三版实测的小红书用户基本推翻了。他让模型逐字引用自己上下文里的effort数值:low=10、medium=20、high=40、xhigh=120,逐档单调递增,根本没有被压平;实验的起点版本是236不是237;Opus 5全程没有这个标签,不在实验里。小红书

那"降智实锤"是哪来的?有人问模型"你现在是什么档位":传high它自称Low,传max它自称High——模型只拿到一个裸数字,没有对照表,自己在瞎猜档位名。大家转疯了的截图,其实是模型自我内省产生的幻觉。所以真正站得住的批评只有一条:服务端A/B实验事前零公告,用户白debug一下午,发现自己是实验对象。

为什么这件事对做数据分析的人更要紧
因为数据分析是所有AI用法里,最怕"不稳定"的一种。写代码有编译器、有测试,错了很快暴露。但分析表格要的是三种准:读格子准、写公式准、结论站得住。写文章错个字叫风格,表格里读错一个数,结论就是反的。
社区里有两个真实案例。年后有位运营把两张AB测试的表丢给AI分析,报告写得像模像样,拿原始数据一对:某个格子AI说67,他说不对,改58,再看,又改成43——每次都坚称"绝对准确"。小红书这个结论要是没核对就交上去,决策方向直接跑偏。上周也有人吐槽,AI写的SUMIF汇总公式出得飞快,但拿去一填充数据全偏,因为AI根本不会替你测试数据。小红书

这次降智风波最大的启示恰好在这里:模型的自我陈述,永远不能当证据。它说"绝对准确",和它说"我在以high档运行",是同一类东西——生成出来的句子,不是事实保证。你做数据分析靠的是数据,数据不能站在生成的句子上。
GPT降价,到底便宜了谁
再看OpenAI这次降价的细节。砍的是按量计费的部分:API价格,以及超出订阅套餐额度后购买的credits。输入5→4美元每百万,输出30→20美元;缓存输入0.5→0.4;长上下文档位同步下调(输入10→8,输出45→30)。36氪没砍的是订阅:Pro、Plus、Business三档,一分没降,套餐里包含的用量也没涨。

所以真正省钱的是API重度用户。按官方给的例子:一个月消耗1亿输入+2000万输出token的大型Agent,原来1100美元,现在800美元,综合降幅约27%。36氪输入占比高的活儿——比如批量读大表、解析文档集——省得接近两成;输出占比高的——让AI写报告、写代码——能省到三成往上。
两条相关信息。其一,Codex的周活跃用户同日宣布突破2000万,不少人反映的"credits消耗过快",官方说"正式调查已启动"。36氪如果你是重度用户,这两天先看看自己的消耗明细。其二,这次降价的时间点很微妙:Anthropic正处在IPO路演窗口期,OpenAI降价挖墙脚的意味很直接。对消费者,这意味着后面大概率还有跟进的优惠,花钱的时候留个心眼。
这周能做的三件事
第一,别再用"问AI"当信任依据。别问它"你是什么档位"“你是不是XX模型”,模型的自我陈述不作数。想确认用的是什么,看API响应的客观标识;想确认分析对不对,回原始数据核对。
第二,给重要分析加一道抽查。AI交付之后,抽3-5个格子对原始表,看一个关键公式的口径,结论要拿去决策之前,换另一个工具跑一遍。五分钟的事,防的是最贵的那种错。
第三,按自己的工具对号:用Claude Code的,看一眼版本(2.1.236及以上、Fable 5会话在实验范围内),重要结论别让Opus 5单独出;用GPT按量的,降价自动生效,别指望订阅档短期跟降;用免费国产模型的,这次风波反而是个提醒——关键分析别让任何一个模型单点背锅。
后面值得盯的两个信号
一是Anthropic到底修不修得好Opus 5。官方说是最高优先级,接下来两周看有没有看得见的变化。二是社区已经有人用统计方法盯这件事了——有站点每天跑一小批SWE-Bench-Pro子集测试,用统计检验判断Claude Code有没有出现"显著的性能下降",还支持订阅邮件提醒。微博这比凭体感吵,靠谱得多。
有句话值得记住:跑分可以用来营销,稳定性只能靠一次次兑现。36氪AI可以替你分析,但结果的责任链条,最后一环必须留在你自己手里——这不是对AI的不信任,是做数据分析的基本功。