当前位置:
AIGC文章详情

GLM和通义同夜放Flash王牌,DeepSeek已在榜上等着:工作流迁哪边,按场景选这篇说清

源自94位全网作者

05:15

昨晚,AI 编程圈有点热闹。

晚上十点半前后,智谱正式揭晓:匿名霸榜 OpenRouter 一整周、被全网猜身份的 Ox Alpha,就是 GLM-5.3-Flash,随即发布并 MIT 协议开源。知乎几乎同一时间,阿里放出了 Qwen3.8-Flash。而 OpenRouter 周消耗榜上被"牛来"追着打的那个榜二,正是刚结束 56 天统治的 DeepSeek V4 Flash。

三款带"Flash"后缀的模型,挤进同一个时间窗口。这不是巧合——这轮价格战已经不是打"便宜聊天"的市场,而是瞄准了最烧钱的场景:Agent 编程。

GLM和通义同夜放Flash王牌,DeepSeek已在榜上等着:工作流迁哪边,按场景选这篇说清

先把三张牌摆上桌

GLM-5.3-Flash:总参数 320B,每 token 只激活 18B,1M 上下文,原生多模态,MIT 协议开源。这是 GLM-5 系第一个原生多模态的型号——意味着 GLM 用户终于能用自家模型干截图写代码这类活了。智谱给的定位很激进:AA(Artificial Analysis)综合智能指数 57 分,与 Claude Opus 4.8 持平。微博按官方口径,它的定价是 GLM-5.3 的 1/10,限时折扣内 1/20,只有 Opus 4.8 的 1/40。哔哩哔哩具体价格分两个口径。

价格:Z.ai 国际站输入 $0.15、输出 $0.50 每百万 token,缓存命中 $0.03。微博国内 BigModel 牌价输入 ¥0.8、输出 ¥2.8,限时五折后是 ¥0.4 / ¥1.4,缓存命中 ¥0.115。哔哩哔哩

GLM和通义同夜放Flash王牌,DeepSeek已在榜上等着:工作流迁哪边,按场景选这篇说清

Qwen3.8-Flash:多模态 MoE,主模型参数 125B,另有 51B N-gram Embedding,每 token 激活只有 6B——三家里激活参数最小,训练成本相比 Qwen3.7-Plus 骤降近 90%。微博牌价输入 ¥1、输出 ¥3 每百万 token,另有一个更高规格的 Qwen3.8-Flash-Next 版本。

DeepSeek V4 Flash:霸榜最久的一个。有 UP 主整理了三家的国内 API 牌价:空闲时段输入 ¥1.5、输出 ¥4.5,高峰翻倍,但缓存命中输入只要 ¥0.05。哔哩哔哩缓存这一项,比上面两家便宜一个量级。

三家的牌价看起来都省钱。但这轮 Flash 战的第一个教训恰恰是:牌价只是入场券。

牌价和真实成本之间的三个差异

第一个差异:缓存——命中率与保存期。

Agent 工作流里成本大头不是新输入,而是反复命中的前缀缓存。GLM 的缓存牌价最低(折后 ¥0.115),但智谱官方视频下一条高赞评论直接点破:编程的成本大头是缓存,而且 GLM 的命中率还更低,同样的任务 DeepSeek 能用 98%,GLM 只有 95% 不到。哔哩哔哩跟帖里有人把账算得更细:DS 的缓存能保存几个小时到一天,睡一觉起来继续命中——真正便宜的不止是单价。这是用户单方面的实测,不能当严格结论,但它指向一个事实:缓存牌价 × 命中率 × 保存期,三者相乘才是真实成本。只盯单价那一栏,会被骗。

第二个差异:输出冗长度。

Agent 时代,输出 token 才是烧钱主力。知乎有答主提醒:GLM-5.3-Flash 的输出看起来非常冗长,实际使用成本会比预想的高。知乎官方视频评论区也有人直接贴出账单:直连 API、命中率 99%,十分钟烧掉三块钱。哔哩哔哩通义那边则有一位 UP 主实测称 Qwen3.8-Flash 比 GLM-5.3-Flash 更便宜也更快,但该视频样本不大且标注为 AI 生成,仅供参考。

第三个差异:高峰时段。

DS 有高峰时段翻倍的机制;GLM Coding Plan 则是非高峰调用只消耗一半积分,周末全天算非高峰。知乎如果你习惯夜里挂机跑长任务,这个差异比任何单价差异都大。

跑分覆盖不了你的场景

官方跑分方面,CodeBench 全面超过 GLM-5.2、追平 Opus 4.8。微博第三方评测 DeepSWE v1.1 的编程 Agent 实测里,匿名期的 Ox Alpha Pass@1 拿到 80%,比现款旗舰 GLM-5.3 的 66.9%、Claude Fable 5 的 65%、GPT-5.6 Sol 的 52% 都高出一截。知乎

GLM和通义同夜放Flash王牌,DeepSeek已在榜上等着:工作流迁哪边,按场景选这篇说清

匿名那一周,OpenRouter 单周消耗 23.2 万亿 token:榜二 DeepSeek V4 Flash 只有 11.6T,Ox Alpha 是它的整整两倍;GPT-5.6 Luna 不到五分之一。知乎顺带一提,匿名期 OpenCode 和 OpenRouter 上的免费测试请求流量,全部由国产芯片提供算力支持。微博OpenCode 上的更替更直接:ox-alpha 以 44T 登顶,曾经的霸主 deepseek-v4-flash 周环比暴跌 76%,DeepSeek 连续 56 天的霸榜纪录就此终结;平台数据还显示,OpenCode 全平台 96% 的输入 token 走缓存,Ox Alpha 自身缓存命中率 93%,在所有样本量足够的模型里,GLM-5.3 的用户留存率高达 79.1%,全平台第一。

GLM和通义同夜放Flash王牌,DeepSeek已在榜上等着:工作流迁哪边,按场景选这篇说清

但真实用户这两天摸出来的手感更具体:

  • 有编程区 UP 主实测后的整体感受是:以 18B 激活规模来看已经不错,后端表现扎实,前端和深度推理差点意思。哔哩哔哩

  • 有开发者踩了时区坑:已经告知要用服务器的 UTC 时区,模型却按 Mac 的北京时间改代码,差点出事故。哔哩哔哩

  • 有人专门拿它写小游戏,修了一轮鼠标还是无法控制瞄准,最后的结论是可能不太适合做游戏。哔哩哔哩

  • 也有拿"牛来"干活几天的媒体行业用户说,自己更喜欢 flash 多一些,没觉得比 5.3 差。

把这些拼起来,图景是:GLM-5.3-Flash 的上限有跑分和近 70 万亿 token 的真实流量验证,但体验下限取决于你的场景。通义用 6B 激活换极致速度和低成本,适合高频短任务;DeepSeek 则靠缓存机制和长上下文口碑,仍牢牢占住已有工作流的用户——评论区甚至有人替它站台:要是真到了长上下文难 agent 的用途,还得是你 DS 叔叔。哔哩哔哩

按场景的选择建议

  • 主力场景是 Coding Agent(ZCode、Claude Code、OpenCode 等)且多模态需求多:GLM-5.3-Flash 目前是最完整的选择。Coding Plan 有 Lite/Pro/Max 三档,其中 Lite 档周额度大概 1.4 亿 token,价格还是比较贵。知乎非高峰半价、周末全天非高峰。唯一要盯的是输出冗长,prompt 里限好字数、配合缓存用。

  • 高频短任务、批处理、对速度和成本都敏感:Qwen3.8-Flash 值得试。6B 激活,响应延迟有优势,¥1/¥3 的价格没有折扣套路。

  • 已有 DS 工作流、长上下文缓存命中需求大:不急着迁。DS V4 Flash 的缓存保存期是真实优势,避开高峰时段涨价即可。需要视觉能力的话,注意 DS 的视觉版本还带着 -Exp 后缀,而 GLM-5.3-Flash 和 Qwen3.8-Flash 都已是原生多模态。

  • 想先白嫖试水:OpenRouter / OpenCode 仍有试用渠道,但匿名期就有用户登录两天被限流,连 GitHub 账号都被封,而理由只是同时开了两个项目。哔哩哔哩别把工作流押在免费通道上。

值得继续盯的信号

  1. GLM-5.3-Flash 限时五折的截止时间官方没有明说。国内站 ¥0.4/¥1.4 是促销价,到期前是迁移试跑的最佳窗口;

  2. GLM-5.3 旗舰会不会跟着开源权重——社区期待很久了,开源之后本地部署的故事会完全改写;

  3. DS V4 Flash 的 Vision 版本何时去掉 -Exp 转正;

  4. Qwen3.8-Flash-Next 会不会放出完整跑分和开源权重;

  5. MiniMax 还没出 Flash 牌,评论区追问它在哪发财,得到的回复是"和 Seedance 对线去了"。哔哩哔哩价格战里消费者不用急站队。

最后说一句。这轮 Flash 战真正让"前沿智能"变成了日用消费品,但记住:牌价只是入场券,真实成本藏在缓存命中率、输出冗长度和高峰时段里。好消息是三家都足够便宜,试跑一周的成本可能不如一杯咖啡。先试,再迁——这才是这轮价格战的正确节奏。

内容由AI生成

精选参考来源

1. 刚刚,GLM-5.3-FLASH来了

2. #智谱发布GLM5.3Flash#智谱GLM-5.3-Flash正式发布。这个模型有点意思——总参数320B,但每token只激活18B,比前代砍掉近一半。结果呢?AA综合智能指数57分,跟Anthropic最热门的ClaudeOpus4.8打平。定价更狠:每百万tokens输入0.15美元、输出0.50美元,限时折扣后只要0.045美元。算下来,是Opus4.8...全文

3. GLM-5.3-Flash今天上线并开源

4. 智谱正式推出GLM-5.3-Flash(OxAlpha)!不是旗舰缩水版,是新基座+MIT开源:🔹320B-A18BMoE,激活约18B🔹原生多模态,上下文100万tokens🔹API:$0.15输入/$0.50输出/$0.03缓存(每百万tokens)🔹CodeBench全面超过GLM-5.2,追平ClaudeOpus4.8🔹AutomationBe...全文

5. [狼狼测试]Qwen3.8-Flash比GLM-5.3-Flash便宜2.78倍、快1.96倍

6. 今晚,国产大模型还是惊喜不断一是阿里正式发布 Qwen3.8-Flash。这是一个多模态MoE模型,主模型参数量为125B,额外配备51B的N-gramEmbedding,每token激活6B参数。仅6B而且,Qwen3.8-Flash训练成本较Qwen3.7-Plus骤降近90%,推理成本同样大幅下降,每百万Tokens输入仅1元,输出3元,...全文

7. 如何评价新上线开源的智谱GLM-5.3-Flash(Ox-Alpha)?

8. 突发!狂吞23.2万亿token匿名怪物谜底揭晓:GLM-5.3-Flash

9. 智谱刚刚发布了GLM-5.3-Flash(320B-A18B),即之前匿名的OxAlpha。划重点:之前在OpenCode和OpenRouter上的免费测试请求流量全部由国产芯片提供算力支持。名字就能看出来,模型总参数320B,激活18B。智谱表示,GLM-5.3-Flash的架构专为极低成本而设计,总参数量与GLM-4.5相当(355Bvs.320...全文

10. 匿名爆火的「牛来」模型,原来真的是智谱家的!实测GLM-5.3-Flash!

11. 小米性价比位置被夺,GLM5.3FLash大模型降临,两个亮点

12. 趁OX下架前怒蹬写游戏和qwen27B一样这个任务上有些差强人意

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章