先说今天凌晨的场面。9月29日凌晨2点多,Anthropic把Claude Sonnet 5.5的官方发布视频悄悄挂了出来——没有盛典,没有倒计时页面。但早上打开知乎、微博、B站,已经被刷屏了:知乎「如何评价9月28日发布的Claude Sonnet 5.5」问题半天挂了3.6万浏览,微博#ClaudeSonnet5.5发布#话题下一整排跑分截图,B站实测视频一个接一个,播放量高的已经冲到几万。
动静这么大,是因为这次发布身上叠了三个戏剧点。
第一,中杯反杀了旗舰。智能体编程基准Terminal-Bench 4.0上,Sonnet 5.5拿下70.6%,直接反超自家大哥Opus 5.5的66.4%——要知道上一代Sonnet 5在这个基准上只有10.3%,等于翻了将近7倍。真实工作负载评测GDPval-AA上,两者1844对1846,几乎打平。知乎有回答直接调侃:评分这是超过了Fable 5.1和GPT-6 Astra,仅次于Opus 5.5?36氪的标题更直白:「智能水平超越GPT-6 Astra」。知乎知乎36氪

第二,价格一分没涨。输入2美元/百万token,输出10美元,正好是Opus 5.5(4美元/20美元)的一半。缓存读取只要0.20美元,和口碑扑街的Sonnet 5同价。36氪另一篇稿子的总结很到位:「基本就是Opus 5.5,但便宜50%」。知乎微博36氪
第三,时机卡得极准。今天正好是OpenAI一年一度的DevDay,此前已有消息称OpenAI将推出代号「O」的常驻AI助手。会上还将发布GPT-6 Cyber相关进展。Anthropic抢在前一天深夜放王炸,发布时机的选择被解读为「贴脸开大,截杀DevDay」。微博微博知乎
背景再补一句:上周的9月22日,Anthropic的Opus 5.5刚和OpenAI的GPT-6 Sol/Luna上演过「一夜三连发」。而Sonnet 5.5面对的是前代留下的信任赤字——Sonnet 5口碑扑街是当时的社区共识。所以这次5.5一出来,知乎高赞回答的第一反应是不敢信,直接质疑「这提升是不是有点太夸张了」,是不是按照OpenAI的节奏在DevDay前一天贴脸开锤。知乎知乎
我把今天知乎、微博、B站、36氪的实测和爆料翻了一遍。先说结论:能力是真上来了,跑分反杀不是营销号吹出来的;但「便宜一半」这个卖点,在真实账单上并不成立。如果你正打算把API配置从Opus 5.5切过去,或者在犹豫要不要退掉GPT Pro,建议先把下面三笔账算完再动手。
第一笔账:单价腰斩,账单未必腰斩
这是今天最反常识、也最容易被忽略的一点。36氪今天的报道标题就是「一半价格击败Opus,开发者实测账单暴涨」,知乎也有用户发现盲点,直接质疑Sonnet 5.5的开销怎么反而比Opus 5.5还大。知乎
矛盾吗?其实不矛盾,两个机制在起作用。
一是缓存稀释。知乎用户「平凡」做了一次端到端实测:开两个Claude Code窗口,让Sonnet 5.5和Opus 5.5分别跑几乎相同的长链条任务(做动画、转MP4、配解说和背景音)。结果两边分别读取了495万和557万缓存token,而缓存命中价两者一样,都是0.20美元/百万token——各自吃掉1美元左右的固定成本后,名义上50%的单价差,被直接压到了不到四成。智能体编程是重度依赖prompt caching的场景,「便宜一半」从一开始就要打折。知乎

二是用量膨胀。海外开发者@chetaslua用相同的3个提示词做了6次并行实测:Sonnet 5.5每次生成90–131KB的文件,全部跑满90分钟上限;对照组GPT-6 Sol只生成20–29KB,9–12分钟就收工。模型更强、干得更多、跑得更久,单位任务吃掉的token反而上去了。这就是AI账单版的杰文斯悖论:单价降了,总开销涨了,因为你舍不得让它少干。官方说的「速度提升超30%、成本降低近30%」,指的是单位任务效率;但你的账单是「效率×你放开手脚的程度」,后者没人替你控制。知乎36氪
所以第一笔账的结论:API党想靠换Sonnet 5.5省钱,先看自己的缓存命中率和任务类型。重度Agent场景下,实际节省大概率是三成多,不是五成;如果抱着「反正便宜」的心态放开跑,账单可能比用Opus那阵还高。
第二笔账:跑分反杀≠旗舰退休,溢价藏在收尾阶段
那Opus 5.5的溢价是不是没意义了?「平凡」的那组实测恰好给出了很具体的答案:差距不在「能不能干完」,而在「干完的样子」。
同一个视频任务,两边都一次跑通、零人工干预。区别在交工前:Sonnet 5.5把官方表述「least likely of any of our models」(限Anthropic自家模型)在旁白里引申成了「所有模型里最不……」,核验面板只校验了数字,没拦住语义上的过度引申;Opus 5.5初稿同样有表述过满的毛病,但它生成完后主动分叉出一个子Agent对照原文逐句复核,把这处修正了,还顺带纠正了一个时间线硬伤。知乎
配音环节,Opus做了分段音频采样,检测到开头垫乐音量过载后主动推倒重混;Sonnet只测了全片平均响度就交付,视频尺寸还是非标准的1920×1260,并且诚实地在日志里写了「未试听成片」。知乎

审美类任务差距更直观:同一个Three.js可交互太阳系,Opus「交互也更丝滑」,Sonnet「有一种塑料感」;500字短篇小说,Opus更细腻,Sonnet「也不错,就是感觉很糙」。知乎
这和官方定位完全对得上:Opus 5.5负责需要「持续判断」的复杂工作,Sonnet 5.5承接边界明确的日常任务。「平凡」的总结很到位:长程任务Opus依旧厉害,短程任务可以让Sonnet接手——「完全能干活,就是糙了点」。微博知乎
所以第二笔账的结论:这不是「大杯可以退休了」,而是官方亲自告诉你,2美元能办的事别再花4美元。最优解是路由而不是全换:修Bug、写文档、跑批量脚本这类低容错成本的高频任务交给Sonnet 5.5;架构决策、对外交付、最后一道审核,留在Opus 5.5。
第三笔账:能力涨了,风险敞口也涨了
第三笔账最容易忽略。知乎用户「恋猫」翻官方模型卡发现一个坑:Sonnet 5.5带上了加强版高风险任务safeguard——触发「高风险」判定的请求会fallback回上一代Sonnet 5。也就是说,你以为在用70.6分的新模型,某些请求实际接活的可能是那个扑街的老模型。如果你的工作流里有容易被误判的任务类型,先小批量跑几天,确认输出稳定再全量迁移。知乎
另一个值得停一下的数字:网络攻防相关能力,Sonnet 5.5从Sonnet 5的0.7%跳到了46.1%。能力与风险同涨,这正是Anthropic给全家桶配fallback的原因。知乎

而就在发布前一天,36氪还报道了另一起事故:有用户让Claude帮忙批量整理文件,103秒删掉4.8万个真实文件,提示词里写了「别碰原件」也没拦住,连恢复记录都被删了。B站灰度测试期还有一条2.9万播放的视频,标题是「吓哭了!ClaudeSonnet5.5一轮直出盗版《喷射战士》」。36氪哔哩哔哩
所以第三笔账的结论不是「别用」,而是:智能体执行力越强,你授权失误的破坏半径越大。上生产前把它关进最小权限沙箱、别给真实环境写权限、重要目录先备份、版权敏感的活儿别让它碰——这些老规矩在70.6%的时代不是过时了,是更值钱了。
不同人今天该做什么
Claude Code订阅用户(Pro/Max):今天最重要的不是切换,是盯额度。灰度测试期B站就有用户反馈,Max思考强度下跑一个3D建模demo「约花费90%的5h额度」。正式发布后订阅额度怎么计、Sonnet 5.5占不占优惠系数,盯一周内的官方说明和社区反馈再决定主力模型。哔哩哔哩
API计费开发者:今天就可以灰度——新任务切到Sonnet 5.5,关键链路保留Opus 5.5,跑一周账单对比,重点看两个数:缓存读取占比、单任务token消耗变化。
GPT Pro/Cursor用户:今天先别退订。今晚DevDay,OpenAI要出什么还未知,B站已经有UP主放话「如果DevDay没有什么好的模型推出,GPT Pro我真的要取消了」——答案几个小时后就有,等一等再决定不迟。哔哩哔哩
纯观望党:这是感受「AI价格战」最直观的一次样本:2美元买100万输入token的准旗舰能力,泄露信息里还有100万上下文(未经官方确认)。就算你不写代码,这波降价也会慢慢传导到你用的AI应用的价格表里。哔哩哔哩
值得继续盯的信号
今晚的OpenAI DevDay:有没有正面接招的模型、代号「O」的常驻助手长什么样,直接决定这轮跑分大战会不会再升级;
未来一周的真实口碑:重点看fallback触发率和「降智」争议会不会出现——Sonnet 5的前车之鉴还摆着;
国内中转站和云厂商的价格跟进:0.20美元的缓存读取价对长上下文Agent应用极友好,看谁先跟;
Anthropic的下一步:官方文档早写过「Sonnet 5.5和Haiku 5.5将在未来几周内推出」,Haiku还在队列里。而华尔街见闻转述的爆料称其内部已有80%代码由模型自主编写——这个迭代速度下,「现在买还是等」的问题只会越来越难。知乎微博
最后说句观感。36氪今天给Sonnet 5.5起的标题很损:「智能水平超越GPT-6 Astra,说好的减速呢?」——阿莫迪嘴上说减速,脚下踩油门。但对用户来说这是好事:神仙打架,中杯价格崩盘,准旗舰能力卖白菜价。唯一要提防的是那句老话的反面——别让「更便宜」,变成「花更多」的理由。36氪