GLM-5.3还是Qwen3.8-Max?9份实测、4套打架的价格,我把两张国产旗舰拆成了一张任务分工表

源自38位全网作者

09:13

10月6日,知乎上冒出来一篇35道题的自建测试。博主Rabbit把qwen3.8-max和GLM-5.3丢进同一批TypeScript函数调用链题目里,结论跟两家官方宣传刚好反着来:纯代码生成两家打平,多步调用链GLM反超16.7个百分点,流式稳定性Qwen 105次请求零断流、GLM断了6次。这条测试底下,两边拥趸吵翻了天:有人刚退了GLM max套餐,吐槽"代码库比较大的情况下,让它去改个功能,它能烧一亿token还改不对"。也有人发帖骂"5.3全是乱码幻觉、已经没法用"。知乎知乎小红书

我不打算裁决"国模第一"。你钱包此刻真正的问题也不是这个。我把8月底到现在社区里真跑过的实测、和四套互相打架的价格口径全部摆成表,这个二选一的答案大概率是:各排各的班。

一、先把两家的"尺子"摆出来,给榜单热度降降温

GLM-5.3(8月14日发布):和GLM-5.2共用同一个基座,按智谱官方的说法,所有提升都来自后训练强化学习,编程是开源阵营里最强、但离闭源前沿还有距离。Artificial Analysis竞技场开分60,和Kimi K3并列60,被社区称为"中国唯二挤进T1的模型"。多个编程基准拿下开放权重模型最高分——但TerminalBench 3.0分数翻了近6倍,当天就有博主公开质疑测法。微博微博微博

GLM-5.3还是Qwen3.8-Max?9份实测、4套打架的价格,我把两张国产旗舰拆成了一张任务分工表

Qwen3.8-Max-0902(9月2日更新,2.4T参数):Code Arena的WebDev榜首秀1691分,高Claude Opus 5 Max 3分、高Kimi K3 Max 17分,"超越Opus 5"当天刷屏。结果到9月7日,实时榜变成1754分、排第四,前面还有Claude Fable 5.1(1896)、GPT-6 Astra(1860)和Opus 5(1766)。小红书

GLM-5.3还是Qwen3.8-Max?9份实测、4套打架的价格,我把两张国产旗舰拆成了一张任务分工表

关于榜单就一句话:Arena实时榜是擂主制,不是奖杯陈列柜。你看到"超越XX"的标题时,先看看这条标题的保质期。

二、社区跑过的实测,结果指向完全不同的方向

#

谁测的

测了什么

关键结果

1

Rabbit(知乎,10/6)

35道TypeScript真实项目题

单步调用87.5%对87.5%打平;12道多步调用链GLM高16.7pp;流式Qwen零断流、GLM断6次

2

stefan_3d_ai(B站,9/24)

Blender/Unity/Godot十项3D硬核任务

两家成片"真的能写出切实可用的3D效果",共同短板是稳定性;另拉Grok 4.6做付费标杆

3

CodeWithYousaf(B站译制,9/22)

单次提示生成HTML物理模拟

DeepSeek、Qwen、GLM三家同题横评

4

老AI人冬冬(知乎,10/1)

规划质量:DS-V4-Flash出规划+GLM-5.3-Flash评审三轮

组合分0.229,反而输给qwen3.8-flash单发0.252

5

歸藏(微博,8/27)

GLM-5.3-Flash(Ox-Alpha)三场景实测

“远低于V4 Flash的价格,能力完爆V4 Flash Vision”,算上审美、前端、多模态自评强于V4 Pro

6

琦仔/AI产品狙击手(知乎/小红书)

鹈鹕骑自行车SVG一笔画测试

Qwen3.8-Max、GLM等四家混测,前端审美分化明显

7

Wagtail核心团队开发者(小红书转述,10/3)

整月只用GLM-5.3-Flash干活

认真干活部分68美元;失误清单没有"模型不行",只有半夜自动化烧掉4.5亿token=150美元、高峰限速被迫临时切DeepSeek/通义

8

LuckyA(小红书,9/21)

qwen3.8-max日常消耗

“差不多的问题,消耗量是GLM-5.3-Flash的几百倍”(个人体验口径)

9

eGaYbXe(知乎,10/6)

GLM编程能力考古

2.x/3.x时代在Trae里属"三流梯队",靠agent兼容性突然走红,并提醒"水军很多"

把正反两边都摆完再说结论:退套餐的golden Jonathan、骂乱码的MLLE游(那条帖子15个赞底下挂了49条评论)、夸"斩杀线"的歸藏、说GLM同价位前后端"没有对手"的难绷——现有证据撑不起"谁第一",撑得起"分工"。多步工具调用链GLM有样本优势,长输出稳定性Qwen有样本优势,样本都小到不足以外推。GLM的编程口碑本身就是这两年才立起来的:早年在Trae里它"只能算是3流的梯队",“后来不知从哪个版本开始,突然就火起来了”,与agent工具的高适配是关键变量。知乎

三、四套价格口径在打架,这里才是钱所在的地方

口径1|官方挂牌价:智谱定价页GLM-5.3-Flash输入0.8元/输出2.8元每百万token(缓存命中0.23元),社区核对口径是"正好是5.3本尊的十分之一",反推5.3约输入8元/输出28元每百万。Qwen3.8-Max按Arena.ai和第三方报道口径,输入2美元/输出6美元每百万token,0902更新没涨价。知乎小红书

GLM-5.3还是Qwen3.8-Max?9份实测、4套打架的价格,我把两张国产旗舰拆成了一张任务分工表

口径2|自媒体估算价:Rabbit找不到qwen3.8-max国内单独定价,用Qwen3-235B档(¥0.6/¥2.4)估算出"GLM账单贵4.7倍"。把他的估算和口径1放一起看:若Max真是$2/$6,GLM-5.3每token单价反而更便宜。结论:4.7倍这个数字不能传,别人的账单算不出你的钱。知乎

口径3|平台/聚合器口径:同一模型不同平台差价明显。WorkBuddy用户实测GLM-5.3-Flash的积分消耗是DeepSeek V4.1-Flash的好几倍。有聚合器宣称GLM-5.3官方价6折,属促销口径,以官网为准。另有口径称qwen3.8-max价格约为Kimi K3的一半。知乎知乎知乎

口径4|订阅与额度:智谱Coding Plan 118元/月是编程用户的基本盘;额度换算上,阿汤哥实测qwen3.8-flash周25亿token额度≈GLM-5.3-flash的40-45亿token档位。知乎

真正的大头成本其实藏在你自己的配置里:

  • GLM-5.3-Flash的reasoning_effort默认是max档。按智谱自家Z.ai Code Bench:low档每任务约4万token、完成率21.5%;high档6.7万、28.1%;max档14万、29.0%——从high挪到max,token翻倍,只换0.9分。知乎

  • qwen的thinking模式按社区推算会把输出单价抬到约2.5倍,还额外吃token量——Rabbit的评测全程关闭了thinking,“我这次评测全程关了 thinking,不然输出单价约涨至 2.5 倍”。知乎

  • 第三方900次rollout统计:DeepSWE上Flash单次成本0.24美元、GLM-5.3是3.99美元;"Flash先行、失败升级旗舰"的级联方案解决率80.9%、每任务1.70美元,约为全用5.3的四成成本。

四、任务分工表(可以直接截图)

你的任务

派谁

依据(样本都小,看方向别看绝对值)

3-4层嵌套的函数调用链Agent

GLM-5.3

Rabbit 12题样本,+16.7pp

长输出、生产环境SSE流式

qwen3.8-max

105:0零断流(断点存疑是模型还是网关,自测一遍)

ticket级批量编码、日常干粗活

GLM-5.3-Flash,effort显式降到high

1/10价格、AA 57分,Toolathlon比5.3本尊还高5.4分

前端、审美、多模态小任务

GLM-5.3-Flash

歸藏实测;5.3本尊是纯文本,视觉能力在Flash这边

仓库级大重构

两家旗舰都要配回归门禁

5.3的NL2Repo 56.3 vs Opus 4.8的69.7;golden Jonathan"一亿token改不对"个案

长上下文+文生图+Agent全家桶

qwen系

一个key凑齐Max/Flash/图像/语音/本地小模型,企业省对接成本

通宵自动化

任何模型,先设token上限

4.5亿token/150美元/晚,事故来自没人盯

五、避坑清单(每一条都有人付过钱)

  1. GLM的`tool_choice: auto`有时无视、直接输出纯文本,改用`required`稳——Rabbit实测"zhipu 的 tool_choice 参数行为不一致"。知乎

  2. GLM有时把function call的`arguments`返回成对象而不是字符串,写死`JSON.parse`会炸`[object Object]`,加个类型判断——Rabbit把它记为"与 OpenAI function calling 规范不符"的非标准行为。

  3. GLM-5.3-Flash默认max档思考,批量任务先改effort再跑。

  4. 高峰时段会限速变慢:AA发布期实测Flash输出50 tok/s出头,低于同类约67的中位水平;备一个同级模型救急,Wagtail团队的做法是切换"也就是改一行配置的事"。

  5. 用qwen3.8-max常开用量统计:thinking既涨价又吞token,"消耗几百倍"的抱怨是提醒不是玩笑。

  6. 通宵自动化前,先看清自己选了哪个模型——那位英国开发者选错模式跑了一夜AI智能体,“一觉醒来烧掉四亿五千万 token,一百五十美元,五度电”。知乎

  7. 榜单"超越XX"的标题保质期以天计,看一周均值再动钱包。

GLM-5.3还是Qwen3.8-Max?9份实测、4套打架的价格,我把两张国产旗舰拆成了一张任务分工表

六、接下来盯什么

  • GLM-5.3-FlashX(9月18日上线,输入2元/输出7元每百万,200 tok/s):智谱把速度单独拆成新型号卖,它和旗舰5.3之间的定价差,值得你决定要不要为"快"多付钱前先观察。知乎

  • Qwen国内定价口径:如果阿里哪天单独公布qwen3.8-max的国内价,"4.7倍"之争就终结了,在那之前所有价差结论都是估算。

  • 算力余量:唐杰自己说"其实还是算力短缺",Flash类模型的限流、减速可能贯穿全年。微博

  • 你自己那5道题:两家API都走OpenAI兼容接口,聚合平台上改个model ID就能A/B——把你项目里最真实的5个任务各跑3次,那张账单才是唯一属于你的评测。

一个月前大家问"GLM-5.3值不值得换"。现在更好的问题是:哪些活继续给老模型,哪些活交给新模型。 模型不是信仰题,是排班题。

内容由AI生成

精选参考来源

1. 说实话,qwen3.8-max 和 glm-5.3 我用 35 道编程题测了——价格差将近 4.7 倍,有一类带函数调用链的 TypeScript 任务,结果和两家官方宣传完全反过来

2. 如何看待 Anthropic 公开将 GLM-5.3 与 Mythos Preview 相提并论?

3. 别搞了(智谱GLM-5.3乱码幻觉吐槽帖)

4. 智谱AI(Z.ai)发布 GLM-5.3 评测解读

5. 智谱的GLM-5.3 AA竞技场开分(Kimi K3与GLM-5.3并列60分)

6. GLM-5.3的测试分数是怎么翻6倍的?

7. 阿里Qwen3.8-Max在编程榜超越Claude Opus 5

8. 开源AI再次接管3D领域——GLM5.3与Qwen3.8Max硬核实测

9. [中配]DeepSeek、Qwen与GLM物理模拟编码实测:单次提示生成HTML效果对比

10. DeepSeek出规划、GLM评审三轮,分数比两个单发都高,还是输给单发qwen3.8-flash

11. 测了一下Ox-Alpha(GLM-5.3 Flash),太牛了!

12. Qwen 3.8 Max 鹈鹕骑自行车SVG测评报告!

13. 只用GLM一个月,输的不是模型

14. qwen3.8 max消耗量也太恐怖了

15. 智谱GLM-5.3接入Cursor并在海外走红,其编程性能与实际体验究竟如何?

16. 如何看待GLM-5.3-Flash?

17. 为什么workbuddy中Deepseek4.1F的价格达到了GLM5.3F的两倍?

18. AI算力省钱攻略:GLM API批量五折到底藏在哪个平台?

19. Qwen3.8-max新版发布,国模top1

20. DS-V4.1-Flash对比Qwen3.8-Flash,GLM5.3-Flash和GLM-5.3吗?

21. 怎么看 Qwen 3.8 Max 发布 0902 更新?

22. Ox Alpha(GLM-5.3 Flash)OpenRouter周份额近20%排名第一

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章