9月2日这天,AI编程圈发生了一件挺有戏剧性的事:阿里千问放出 Qwen3.8-Max 的 0902 新版本,同一时间 CodeArena 前端编程总榜换了主——1691分,首次亮相直接登顶。被挤到第二的是 Claude Opus 5 Max,1688分,只差3分;季军是 Kimi K3 Max,1674分。前三名里两个中国模型。知乎
更扎眼的是价格。前排三位的百万 token 综合价:第二名20美元,第三名12美元,新科冠军5美元。每日经济新闻同一天,Anthropic 发布 Fable 5.1,登顶另一家机构的智能指数,但每任务成本比上一代贵了20%。知乎一家往贵里走,一家往便宜里走,两条路线同日发车。
而就在9月4日晚上,Qoder 又把夜间折扣加码到了4折。小红书这一套组合拳下来,到底值不值得把你手上的代码迁过去?我把这几天社区里的实测、账单和吐槽都翻了一遍,帮你把明账暗账一起算清。
先说这个"登顶"值几分
CodeArena 的玩法和跑分不一样:用户丢一个需求,两个匿名模型并排开工,各自写出一个能跑的应用,渲染在同一块屏幕上,真人投票选哪个好用。几万张票滚成 Elo 分。跑分是闭卷考试,这张榜是拉出来遛——页面美不美、交互顺不顺,人一眼就能看出来。在真写代码的人群里,这张榜的分量一直不轻。知乎

但公道话也得说:3分在这种竞技计分体系里,统计上约等于平局。而且 Qwen3.8-Max 不是全能王——官方对照表里,SWE-bench Pro 这门硬课它考67.7分,Anthropic 的 Fable 5 是80分。知乎翻译一下:写前端页面、搭工具、做交互,它已经是第一梯队;但啃硬工程、改复杂存量代码,考卷上人家还坐着几把交椅。
真正的爆点是帕累托前沿——把分数和价格画在同一张图上,这次第二名和第三名被挤进了"被支配区":花更多的钱,拿更低的分。API 价目拆开看:输入每百万 token 2美元,输出6美元,显式缓存读取压到0.17美元。知乎编码这种长活,一个来回几十万 token,缓存就是命门,这个价格等于直接掀桌。知乎有人按一天一千万 token 的中型团队估算:跑一个月,贵的那家是6000美元,这边是1500美元,省下的钱够多养一个初级开发。知乎

"错峰电价"来了:夜间4折怎么用
9月4日晚上开始,Qoder 全系产品(中国版、国际版,个人和企业都算)进入夜间折扣时段:每晚22:00到次日08:00(北京时间),Qwen3.8-Max 0902 的 Credit 倍率从0.5x降到0.2x,Qwen3.8-Flash 首次加入,从0.1x降到0.04x,都是4折。小红书9月限时大促也还在:首次订阅 Pro/Pro+ 的 Credits 额度翻倍,老用户续费、升级加赠1000。
同一周,智谱也在9月3日上线了夜间无限畅用活动。知乎AI编程开始像电力一样搞峰谷定价了——白天算力紧张按原价,深夜闲置给你打折。这对个人开发者是个实打实的红利:官方给的用法是"规划设计切 Max,执行切 Flash",定时挂机任务、Goal 模式,下班前把任务派出去,第二天来验收。小红书等于用睡觉时间白嫖了半个工作日。
提醒一句:这类促销变得很快。8月初 Qwen3.8-Max 首发时的口径还是"白天原价、夜间5折",现在已经加码到4折。知乎GLM 那边的 plan 折扣更是能打到92%。知乎下单前以当天页面为准,别拿旧截图当现价。
迁移前,先看清三笔隐藏账单
便宜是明账,这几天社区扒出来的暗账有三笔,每一笔都可能让"省钱"变成"省了个寂寞"。
第一笔:每次请求固定多花38个输入 token。有开发者9月4日用同样的 prompt、同样的参数,只换模型字符串实测对比:0902 快照每次请求的 usage.prompt_tokens 恒定比上一版多38个,三个不同长度的 prompt 都是38,没有浮动——这是加在每次调用前面的固定开销,不是分词器变化。知乎单次算下来只有0.000076美元,几十次调用无所谓,但高频短 prompt 的负载最疼:38个 token 加在一个28个 token 的请求上,输入侧直接翻一倍还多。你的一天十万次调用的小请求服务,这笔底噪就不是零头了。
第二笔:429限流,比你想的复杂。有人上周给内容审核服务换上 0902,跑不到两分钟控制台全是429,切回旧版同样频率却一个都没有。排查下来有三个知识点:一是 DashScope 的限流有 RPM、TPM、并发数三个独立维度,低频高并发照样触发429,批量异步请求建议用信号量把并发压到5-10;二是看到429先读响应体里的 error.code——Throttling.RateQuota 是"你太快了,歇会儿能好",Throttling.AllocationQuota 是"额度用完了,重试一万次也没用,得充值或扩容",无脑 sleep 重试是最常见的坑;三是这位开发者实测 qwen3.8-max 打到50 RPM没限流,0902大约30 RPM就开始429——注意这只是个人观测,官方没说明快照版本的限流桶是否独立,上线前自己压一遍才算数。知乎
第三笔:推理 token 的计费陷阱。两个版本都是推理模型,会出现一种"看起来像失败其实不是"的结果:max_tokens 设成20,回来20个推理 token、content 是空字符串。什么都没坏——预算在吐出第一个可见字符之前就花在思考上了。而推理 token 不管你看不看得见,都按输出费率计费。知乎max_tokens 要同时覆盖推理和回答,把它当答案长度来估,正是一个好模型看起来坏掉的原因。
顺带一个小疑点澄清:0902 快照上报的上下文长度是1,000,000,旧版报的是1,131,072,看着像缩水,其实大概率只是口径变了——后者约等于"输入上限加一点余量",前者是整数营销口径。知乎百万 token 以内两个版本都安全,真要顶到极限,在你准备上线的那个快照上实测。
谁该切,谁再等等
综合这几天的榜单、实测和社区反馈,我的判断是:
写前端、做工具、vibe coding 的个人开发者:值得切,而且优先用夜间4折时段跑重活。竞技场这类"人眼看着好不好用"的活,它现在就是第一,价格还是别人的四分之一。
啃存量代码、复杂工程任务的团队:再等等。SWE-bench Pro 上67.7对80的差距是实打实的,这类活别只看竞技场排名。
高频小请求的生产服务:先算38 token底噪和限流账,拿真实流量画像压测一轮429阈值再迁。
已经订着 Claude/GLM/Kimi 的:不用急着退订。先用夜间时段拿自己的真实任务跑一周对比——知乎上对千问 plan 折扣力度的质疑声不小,"路边一条"这种狠话都有,谁强谁弱,你自己的任务说了算。知乎

接下来值得盯的信号:千问的 plan 折扣会不会跟进 GLM 的92%;0902 的限流问题官方会不会给说法;CodeArena 分数一个月后是站稳还是回落;还有夜间折扣会不会从促销变成常态。有动静值得再算一次账。
你现在手上的活交给哪家模型?一个考卷更强但贵,一个竞技场登顶还便宜四分之三,切换的坑你担不担得起?评论区聊聊。