当前位置:
AIGC文章详情

GLM-5.3-Flash的「一折价」,实际账单只便宜了2.3倍:2700次真实调用测出定价页看不到的坑

源自184位全网作者

13:46

8月26日晚上,智谱认领了"牛来"。在OpenRouter上霸榜一周的匿名模型Ox-Alpha,就是GLM-5.3-Flash。

官方给的成绩单很响:Artificial Analysis智能指数57分,与Claude Opus 4.8持平。知乎 定价是旗舰GLM-5.3的十分之一,输入每百万token 0.8元、输出2.8元。微博

作为GLM系列首个原生多模态模型,它能把文本、图片、视频直接喂进去。知乎 匿名测试期6天吞掉42万亿token,周token份额一度冲到近20%、排名第一。微博

GLM-5.3-Flash的「一折价」,实际账单只便宜了2.3倍:2700次真实调用测出定价页看不到的坑

今天是9月4日,权重已全部放出,第三方实测数据陆续落地,首发两周的半价窗口也快关了。如果你正盘算把手头的截图理解、图文文档解析、视频内容分析链路迁到这个"一折模型"上,这篇能帮你省一笔:纸面价格和真实账单之间的差距,比定价页上显示的大得多。

定价页只告诉你单价,没告诉你一次回答会用多少token

海外开发者团队在DigitalOcean无服务器推理上跑了2700次真实API调用(总花费14.75美元,prompt、脚本、原始日志全部开源可复现),把GLM-5.3-Flash、Qwen3.8-Max、Kimi K3放在同一套题上对打。

最扎心的结论是:账面上Flash的输出单价是Qwen3.8-Max的十二分之一,但默认配置开箱去打,真实成本只便宜2.3倍;把参数配对之后是14.5倍,对比Kimi K3更是拉到106倍。同一个模型、同一批prompt,配置之间的单次成本跨度最大能到106倍。知乎

GLM-5.3-Flash的「一折价」,实际账单只便宜了2.3倍:2700次真实调用测出定价页看不到的坑

钱花在哪了?推理token。问它"SSH默认端口是什么",中位数要烧625个输出token才吐出"22"这两个字符,同一题Qwen只用156个。整套开放式问题跑下来,Flash输出中位数1409 token、平均3111,最长一条回复15006 token,其中94.7%是用户根本看不到的推理内容。粗算下来,账单里大约三分之二到六分之五,付给了模型的"内心戏"。

你以为的"关思考"开关,在Flash上是个反向开关

很多教程会教你传enable_thinking: false,这支团队一开始也这么干。结果在Flash上,reasoning_content字段确实空了,输出token反而多花20.9%、账单涨11.1%——推理并没有停,只是换了个地方跑进你可见的答案里(120条回复里至少103条检测到残留的思考链,简单题40条命中38条)。知乎 同一个参数,三个模型三种命运:Kimi K3上它真实生效,成本降75.5%;Qwen3.8-Max默认就是关的,显式打开思考后成本翻5倍;到Flash这里,它干脆不是正确的参数。

Flash的官方开关叫reasoning_effort,分low/high/max三档。Model Card里写着:不传,默认max。知乎 也就是说,每一个"裸调"的请求,都在用最贵的推理强度干活。加上reasoning_effort: low,成本直降84%,整整6.3倍——而且它是按难度自适应地省:简单题的推理占比从72%压到3%,困难任务仍然保留约40%的思考量,不是无脑砍脑子。

代价也实测出来了。在20道有标准答案的可验证任务上,Flash默认配置全对,low档掉到92%,错的全部集中在Tier 3多步推理题——一道多步成本计算5次错3次,两次把61.22写成0.6122,是最后一步单位换算没人检查。结论很清楚:任务推理密度越低、调用量越大,low档赚得越多;多步推导一多,就该把high或max留回来。

回到"多模态"本身,它到底值不值

这颗模型是30万亿token多模态语料训出来的,GLM系列头一回用稀疏+线性混合注意力,320B总参每token只激活18B,原生吃文本、图片、视频输入。HuggingFace

两场独立实测值得看。国内一个法务团队做了三道真实任务题:在一道"半真半假引用"反幻觉题里(真实存在的文号法释〔2026〕9号,被拼接上一个虚构的司法解释名),Flash不但指出名称造假,还反查出了这个文号真正挂靠的解释,连第3条"好意搭乘"的内容都逐字引对——三款参测模型里唯一识破整层陷阱的;DeepSeek-V4-Flash正确说了"无法核实",但输出里声称"检索了多个法规数据库",在无工具环境下这句声称反而危险。知乎 微博端的实测则反馈,海报复刻、前端审美这类视觉生成理解任务上,它明显压过主打便宜的DeepSeek-V4-Flash-Vision。微博

但别只对着跑分下单。社区的另一面同样真实:有观察者统计它从免费转收费后调用留存明显回落,而DeepSeek涨价后黏性反而更稳。知乎 AA的57分"持平"是几十项测试的均值,法律长尾实测里的分工是Flash单轮细读最强、DeepSeek胜在长跑稳定——"哪款适合你"取决于任务结构,不是排行榜。

GLM-5.3-Flash的「一折价」,实际账单只便宜了2.3倍:2700次真实调用测出定价页看不到的坑

换之前,把三笔账算完

窗口账:8月26日上线后两周半价,也就是说9月9日前后结束。36氪 输入0.8元/输出2.8元是此后的常价,前两周还能再砍一半——要压测就这周,用真实业务prompt跑100条,看你的中位输出长度。

协议账:Flash权重是MIT,商用、二次开发都不拦着;但旗舰GLM-5.3的开源协议从MIT改成了"年营收超100亿美元的厂商需附加安全审查",开源社区争议不小。知乎 小团队用Flash没有障碍,大厂走法务前先把合同读完。

接入账:有开发者实测从5.2升5.3只改了model字段,结果所有请求静默返回403、报错body全空——排查半天发现5.3收紧了Authorization头校验,走网关和聚合平台的要提前验一遍。知乎 顺带一条反坑提醒:拿几家模型"裸调"对比的公开数据,比的其实不是模型,是"模型+默认配置",Qwen默认关思考、Flash默认max,起点就不一样。

想本地跑的:antirez的DwarfStar(ds4)引擎9月1日已把GLM-5.3-Flash支持合进主干,Q2量化约90GiB,128GB内存的Mac就能跑。知乎 但它是快速迭代的Beta,只认项目自带下载脚本列出的量化布局,随便拉一个第三方GGUF塞进去不保证能跑。

按场景给结论

你的情况

建议

高频简单图文:截图提取、票据/文档分类、批量打标

可以迁,但接入第一行就配reasoning_effort: low,否则一折价打成2.3折

多模态+核验型:引用溯源、合同细读、视频内容审核

当前性价比很难找到对手,档别放low,用high

复杂多步Agent链路

别整体搬家,中试跑批用Flash,主干保留旗舰

年营收超百亿美元的大厂

旗舰权重先别碰,看安全审查条款执行细则

继续盯的信号:9日半价结束后的真实留存;各家聚合通道的稳定性差异;以及图片/视频输入按多少token计费——DeepSeek-V4-Flash-Vision刚因为"一张图只给384个token"的取舍被全网拆解过,Flash这套原生多模态的编码成本目前还是黑箱,官方没公布,等有人把单图账单晒出来再All in也不迟。

定价页上的单价只是账单的第一行,第二行藏在你没配的那个参数里。

内容由AI生成

精选参考来源

1. 智谱推出对标DeepSeek的轻量旗舰模型GLM-5.3Flash,性能如何?有哪些核心优势?

2. GLM-5.3 Flash 每百万 token 输入 0.8 元,输出 2.8 元,缓存命中价格 0.23 元,正好为 GLM-5.3 的十分之一。

3. 除了NvidiaGPU,还有在其它硬件上部署GLM5.3flash的吗?

4. 小进展 📊我们的 Ox Alpha(对外名字:GLM-5.3 Flash)这周在 OpenRouter 的周 token 份额冲到了近 20%,排名第一

5. GLM-5.3-Flash 成本优化实战:加一个参数,推理成本直降 6.3 倍

6. GLM-5.3-Flash Model Card

7. 三款“便宜”大模型围剿旗舰:GLM-5.3-Flash、Qwen3.8-Flash、DeepSeek-V4-Flash,我们用三道真实法律任务做了场三方实测

8. 测了一下 Ox-Alpha (GLM-5.3 Flash),太牛了!远低于 V4 Flash 的价格,完爆 V4 Flash Vision 的能力,新的斩杀线来了。

9. AI界的华五是不是GLMDSQWENMINIMAXKIMI?

10. 神秘「牛来」模型果然是智谱,GLM首个原生多模态,还用的国产卡

11. GLM-5.3把开源协议从MIT改成对大厂附加安全审查,算合理的商业化妥协还是偏离开源本意?

12. glm-5.3API接入完整教程:auth_header踩坑+OpenAI兼容+聚合网关配置

13. GLM-5.3 发布不久,antirez 已为它加上专用本地运行引擎,128G机器就能跑

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章