10月6日,知乎上冒出来一篇35道题的自建测试。博主Rabbit把qwen3.8-max和GLM-5.3丢进同一批TypeScript函数调用链题目里,结论跟两家官方宣传刚好反着来:纯代码生成两家打平,多步调用链GLM反超16.7个百分点,流式稳定性Qwen 105次请求零断流、GLM断了6次。这条测试底下,两边拥趸吵翻了天:有人刚退了GLM max套餐,吐槽"代码库比较大的情况下,让它去改个功能,它能烧一亿token还改不对"。也有人发帖骂"5.3全是乱码幻觉、已经没法用"。知乎知乎小红书
我不打算裁决"国模第一"。你钱包此刻真正的问题也不是这个。我把8月底到现在社区里真跑过的实测、和四套互相打架的价格口径全部摆成表,这个二选一的答案大概率是:各排各的班。
一、先把两家的"尺子"摆出来,给榜单热度降降温
GLM-5.3(8月14日发布):和GLM-5.2共用同一个基座,按智谱官方的说法,所有提升都来自后训练强化学习,编程是开源阵营里最强、但离闭源前沿还有距离。Artificial Analysis竞技场开分60,和Kimi K3并列60,被社区称为"中国唯二挤进T1的模型"。多个编程基准拿下开放权重模型最高分——但TerminalBench 3.0分数翻了近6倍,当天就有博主公开质疑测法。微博微博微博

Qwen3.8-Max-0902(9月2日更新,2.4T参数):Code Arena的WebDev榜首秀1691分,高Claude Opus 5 Max 3分、高Kimi K3 Max 17分,"超越Opus 5"当天刷屏。结果到9月7日,实时榜变成1754分、排第四,前面还有Claude Fable 5.1(1896)、GPT-6 Astra(1860)和Opus 5(1766)。小红书

关于榜单就一句话:Arena实时榜是擂主制,不是奖杯陈列柜。你看到"超越XX"的标题时,先看看这条标题的保质期。
二、社区跑过的实测,结果指向完全不同的方向
# | 谁测的 | 测了什么 | 关键结果 |
|---|---|---|---|
1 | Rabbit(知乎,10/6) | 35道TypeScript真实项目题 | 单步调用87.5%对87.5%打平;12道多步调用链GLM高16.7pp;流式Qwen零断流、GLM断6次 |
2 | stefan_3d_ai(B站,9/24) | Blender/Unity/Godot十项3D硬核任务 | 两家成片"真的能写出切实可用的3D效果",共同短板是稳定性;另拉Grok 4.6做付费标杆 |
3 | CodeWithYousaf(B站译制,9/22) | 单次提示生成HTML物理模拟 | DeepSeek、Qwen、GLM三家同题横评 |
4 | 老AI人冬冬(知乎,10/1) | 规划质量:DS-V4-Flash出规划+GLM-5.3-Flash评审三轮 | 组合分0.229,反而输给qwen3.8-flash单发0.252 |
5 | 歸藏(微博,8/27) | GLM-5.3-Flash(Ox-Alpha)三场景实测 | “远低于V4 Flash的价格,能力完爆V4 Flash Vision”,算上审美、前端、多模态自评强于V4 Pro |
6 | 琦仔/AI产品狙击手(知乎/小红书) | 鹈鹕骑自行车SVG一笔画测试 | Qwen3.8-Max、GLM等四家混测,前端审美分化明显 |
7 | Wagtail核心团队开发者(小红书转述,10/3) | 整月只用GLM-5.3-Flash干活 | 认真干活部分68美元;失误清单没有"模型不行",只有半夜自动化烧掉4.5亿token=150美元、高峰限速被迫临时切DeepSeek/通义 |
8 | LuckyA(小红书,9/21) | qwen3.8-max日常消耗 | “差不多的问题,消耗量是GLM-5.3-Flash的几百倍”(个人体验口径) |
9 | eGaYbXe(知乎,10/6) | GLM编程能力考古 | 2.x/3.x时代在Trae里属"三流梯队",靠agent兼容性突然走红,并提醒"水军很多" |
把正反两边都摆完再说结论:退套餐的golden Jonathan、骂乱码的MLLE游(那条帖子15个赞底下挂了49条评论)、夸"斩杀线"的歸藏、说GLM同价位前后端"没有对手"的难绷——现有证据撑不起"谁第一",撑得起"分工"。多步工具调用链GLM有样本优势,长输出稳定性Qwen有样本优势,样本都小到不足以外推。GLM的编程口碑本身就是这两年才立起来的:早年在Trae里它"只能算是3流的梯队",“后来不知从哪个版本开始,突然就火起来了”,与agent工具的高适配是关键变量。知乎
三、四套价格口径在打架,这里才是钱所在的地方
口径1|官方挂牌价:智谱定价页GLM-5.3-Flash输入0.8元/输出2.8元每百万token(缓存命中0.23元),社区核对口径是"正好是5.3本尊的十分之一",反推5.3约输入8元/输出28元每百万。Qwen3.8-Max按Arena.ai和第三方报道口径,输入2美元/输出6美元每百万token,0902更新没涨价。知乎小红书

口径2|自媒体估算价:Rabbit找不到qwen3.8-max国内单独定价,用Qwen3-235B档(¥0.6/¥2.4)估算出"GLM账单贵4.7倍"。把他的估算和口径1放一起看:若Max真是$2/$6,GLM-5.3每token单价反而更便宜。结论:4.7倍这个数字不能传,别人的账单算不出你的钱。知乎
口径3|平台/聚合器口径:同一模型不同平台差价明显。WorkBuddy用户实测GLM-5.3-Flash的积分消耗是DeepSeek V4.1-Flash的好几倍。有聚合器宣称GLM-5.3官方价6折,属促销口径,以官网为准。另有口径称qwen3.8-max价格约为Kimi K3的一半。知乎知乎知乎
口径4|订阅与额度:智谱Coding Plan 118元/月是编程用户的基本盘;额度换算上,阿汤哥实测qwen3.8-flash周25亿token额度≈GLM-5.3-flash的40-45亿token档位。知乎
真正的大头成本其实藏在你自己的配置里:
GLM-5.3-Flash的reasoning_effort默认是max档。按智谱自家Z.ai Code Bench:low档每任务约4万token、完成率21.5%;high档6.7万、28.1%;max档14万、29.0%——从high挪到max,token翻倍,只换0.9分。知乎
qwen的thinking模式按社区推算会把输出单价抬到约2.5倍,还额外吃token量——Rabbit的评测全程关闭了thinking,“我这次评测全程关了 thinking,不然输出单价约涨至 2.5 倍”。知乎
第三方900次rollout统计:DeepSWE上Flash单次成本0.24美元、GLM-5.3是3.99美元;"Flash先行、失败升级旗舰"的级联方案解决率80.9%、每任务1.70美元,约为全用5.3的四成成本。
四、任务分工表(可以直接截图)
你的任务 | 派谁 | 依据(样本都小,看方向别看绝对值) |
|---|---|---|
3-4层嵌套的函数调用链Agent | GLM-5.3 | Rabbit 12题样本,+16.7pp |
长输出、生产环境SSE流式 | qwen3.8-max | 105:0零断流(断点存疑是模型还是网关,自测一遍) |
ticket级批量编码、日常干粗活 | GLM-5.3-Flash,effort显式降到high | 1/10价格、AA 57分,Toolathlon比5.3本尊还高5.4分 |
前端、审美、多模态小任务 | GLM-5.3-Flash | 歸藏实测;5.3本尊是纯文本,视觉能力在Flash这边 |
仓库级大重构 | 两家旗舰都要配回归门禁 | 5.3的NL2Repo 56.3 vs Opus 4.8的69.7;golden Jonathan"一亿token改不对"个案 |
长上下文+文生图+Agent全家桶 | qwen系 | 一个key凑齐Max/Flash/图像/语音/本地小模型,企业省对接成本 |
通宵自动化 | 任何模型,先设token上限 | 4.5亿token/150美元/晚,事故来自没人盯 |
五、避坑清单(每一条都有人付过钱)
GLM的`tool_choice: auto`有时无视、直接输出纯文本,改用`required`稳——Rabbit实测"zhipu 的 tool_choice 参数行为不一致"。知乎
GLM有时把function call的`arguments`返回成对象而不是字符串,写死`JSON.parse`会炸`[object Object]`,加个类型判断——Rabbit把它记为"与 OpenAI function calling 规范不符"的非标准行为。
GLM-5.3-Flash默认max档思考,批量任务先改effort再跑。
高峰时段会限速变慢:AA发布期实测Flash输出50 tok/s出头,低于同类约67的中位水平;备一个同级模型救急,Wagtail团队的做法是切换"也就是改一行配置的事"。
用qwen3.8-max常开用量统计:thinking既涨价又吞token,"消耗几百倍"的抱怨是提醒不是玩笑。
通宵自动化前,先看清自己选了哪个模型——那位英国开发者选错模式跑了一夜AI智能体,“一觉醒来烧掉四亿五千万 token,一百五十美元,五度电”。知乎
榜单"超越XX"的标题保质期以天计,看一周均值再动钱包。

六、接下来盯什么
GLM-5.3-FlashX(9月18日上线,输入2元/输出7元每百万,200 tok/s):智谱把速度单独拆成新型号卖,它和旗舰5.3之间的定价差,值得你决定要不要为"快"多付钱前先观察。知乎
Qwen国内定价口径:如果阿里哪天单独公布qwen3.8-max的国内价,"4.7倍"之争就终结了,在那之前所有价差结论都是估算。
算力余量:唐杰自己说"其实还是算力短缺",Flash类模型的限流、减速可能贯穿全年。微博
你自己那5道题:两家API都走OpenAI兼容接口,聚合平台上改个model ID就能A/B——把你项目里最真实的5个任务各跑3次,那张账单才是唯一属于你的评测。
一个月前大家问"GLM-5.3值不值得换"。现在更好的问题是:哪些活继续给老模型,哪些活交给新模型。 模型不是信仰题,是排班题。