这周AI开发社区最刺激眼球的数字,不是哪个榜单分数,而是三行"账单自报":
Prime Intellect 披露:用 GLM-5.3 端点重写自家 Prime Agent 的 Rust 版本,两周内 2000 多个智能体、上万个沙箱,消耗超过 2000 亿 token(艾瑞网 10 月 10 日行业动态)。新浪微博
B站UP主"CC洛洛24"晒出用 GLM-5.3 + Kimi K3 做的网页二战飞行游戏《勇气之翼》:4 关战役 + 自由模式,3 周业余时间,自报 token 消耗 10—15 亿。哔哩哔哩
另一个UP主"老傅1024"做五大国产模型九题横评(Qwen3.8-max、DeepSeek-V4.1-Flash、GLM-5.3、Kimi-K3、MiniMax-M3),一道横评就烧掉 1.56 亿 token。哔哩哔哩
三行数字放在一起,一个平时没人认真算的问题突然变得很具体:用 GLM-5.3(或它的 Flash 档)正经做一个 Agent 项目,账单到底是什么量级? 这篇把一周内能找到的 5 份真实账单样本摆成一张分布表,再把"单价→账单"的换算和几个把账单悄悄放大的坑一次说清。
一、5 份账单摆开:你的项目大概落在哪一档
先把样本列全(全部为当事人自报数据,我们只做搬运和对齐,口径差异见文末边界说明):
账单样本 | 规模 | 自报消耗 | 用途 |
|---|---|---|---|
五模型横评(B站·老傅1024) | 9 道编码题 | 约 1.56 亿 token | 一次性评测 |
35 道 TypeScript 编程题(知乎实测) | 35 题×3 次 | 账单 ¥1.98(glm-5.3) vs ¥0.42(qwen3.8-max) | 选型测试 |
飞行游戏《勇气之翼》(B站·CC洛洛24) | 4 关战役,3 周业余时间 | 约 10—15 亿 token | 独立开发 |
Prime Agent Rust 重写(Prime Intellect 披露) | 2000+ 智能体×2 周 | 超过 2000 亿 token | 企业级多智能体 |
WorkBuddy 积分实测(知乎高赞回答) | 同任务对比 | DeepSeek 十几积分 vs GLM-5.3-Flash"一百打不住" | 聚合订阅日用 |
对号入座比看榜单有用:试模型能力,亿 token 以内够;独立做完一个小游戏,是十亿量级;上多智能体流水线,直接百亿千亿。 中间隔着的不只是两个数量级,是两种计费人生。

二、把 token 换算成钱:一笔最常被算错的乘法
社区口径的 GLM-5.3-Flash 定价:标准 ¥0.8/¥2.8 每百万 token(输入/输出),目前有限时五折约 ¥0.4/¥1.4(以官网最新为准)。 按 agentic 负载常见的输入输出比 7:3 估算,每 10 亿 token 大约 ¥700(五折)到 ¥1400(标准价)。知乎
于是三行新闻数字立刻有了消费含义:
飞行游戏 10—15 亿 token:如果是 Flash 档价,约一顿聚餐到一部手机壳的钱——独立开发者完全负担得起,这也是这类项目这两周集中出现的原因。但作者用的是 GLM-5.3 本体和 Kimi K3,旗舰档单价更高:35 题实测里的实际账单是 glm-5.3 花了 qwen3.8-max 大约 4.7 倍的钱。 真实花费要上浮几倍,且作者自报"细节调整最耗 token"。知乎
2000 亿 token:即使按 Flash 五折价也是七位数人民币,这就是为什么"规划、实现、审查、验证分给不同智能体"这种玩法目前只出现在公司披露里,而不是个人晒单里。
预算公式:项目期总 token ≈(迭代轮数 × 每轮上下文重放)+ 细节调整长尾。 Agent 项目烧钱的大头从来不是"写出代码那一下",而是长上下文一遍遍重放和返工。做立项预算时,按你 demo 消耗 ×5 起步估,不亏。

三、单价之外,四个把账单悄悄放大的坑
从这周的实测帖里能直接挖出四个,全是当事人踩过、报价牌上不写的:
tokenizer 差价。35 题实测作者发现:同一段中英混合 TypeScript,智谱 tokenizer 切出的 token 数约是 dashscope 的 1.1—1.3 倍,中文越多差距越大。两家单价看着接近,实际账单直接乘以这个系数。知乎
档位跳价。多家模型都有"上下文超过某个量级、或开启 thinking 模式后,输出单价跳档"的设置(该实测里 dashscope 开 thinking 后输出价约从 ¥2.40 跳到 ¥6.00/百万,×2.5)。账单失控的第一元凶往往是开关,不是用量。
断流重试。105 次流式请求里 glm-5.3 断了 6 次,其中 4 次断在 1200 token 附近——生产环境每次断流都意味着重试,重试就是重复付费。
积分倍率的隐性账。聚合平台上,GLM-5.3-Flash 名义单价砍半,但社区实测同样的任务 DeepSeek 十几积分就能做完,GLM 没有一百积分打不住——单价减半敌不动消耗倍率,长上下文场景差距进一步拉开。知乎
顺带一个兼容提醒(省时间也是省钱):glm-5.3 的 tool_calls.arguments 有时返回已解析的对象,而非 OpenAI 规范要求的一律字符串,写死 `JSON.parse` 的代码会直接炸;`tool_choice:“auto”` 偶发被无视,换 `required` 才稳。迁移前先在日志里核对这两项,能省一个下午。知乎
四、怎么分工:这篇账单表真正要给的判断
把 5 份样本和各家参数(社区口径:GLM-5.3-Flash 320B 总参/18B 激活、原生 1M 上下文;DeepSeek-V4-Flash 284B 总参/13B 激活、MIT 协议可自行部署;Qwen3.8-Flash 125B/6B、缓存命中价最低、限流最松)叠在一起。 于是适合三种人:知乎
只写文字、跑批量草稿:Flash 档哪家便宜用哪家,GLM 和 DeepSeek 都行——经济舱不装头等舱的活,硬核推理回各家旗舰;
要喂截图/视频/图片的 Agent:GLM-5.3-Flash 是 GLM-5 系列的原生多模态,文字、图片和视频都可以直接喂,这是它相对 DeepSeek-V4-Flash(偏纯文本)的硬差异。知乎
调用链 3 步以上、带函数嵌套的复杂 pipeline:35 题实测里,涉及多步函数调用链的题目 glm-5.3 的工具调用准确率反而比 qwen3.8-max 高 16.7 个百分点——调用链越深,GLM 的溢价越值;2 步以内的简单调用,用便宜的 Flash 就好。知乎
再叠一层:固定长前缀、知识库复用的场景,真实成本看缓存价而不是挂牌输入价——这也是"单价砍半≠账单减半"反复出现的原因。 至于把 GLM-5.3-Flash 量化进本地:社区 oMLX 1400+ 条实测的结论是 4-bit 是当前体量的"日常分辨率",量化损失基本落在统计噪声里,真正的体验杀手是 thinking 开关(同一个 4bit 模型,关闭思考模式 MMLU 只有 65.3%,开启后 92%)和 KV 缓存精度;本地路线能绕过账单,但绕过不了这些配置功课。知乎知乎

五、继续盯什么
限时五折窗口:GLM-5.3-Flash 的 ¥0.4/¥1.4 是促销价,窗口关闭后十亿 token 项目的预算直接上浮一倍以上——立项时间压在近端的,这是最优先要确认的事;
账单样本会不会继续"晒":PrimeAgent 之后,多智能体重金玩法从"没人提"变成"公司抢着披露",说明 token 成本已经成了模型厂商 To B 叙事的一部分,后续降价/分层定价大概率还会动;
聚合平台倍率公示:积分制平台的倍率与官方价差没有对齐机制,用订阅跑重度任务前,先用同一任务实测三家积分消耗,比看任何评测都准。
数据边界说明:本文账单样本全部来自当事人/厂商自报(B站视频简介、知乎实测回答、厂商披露转述),不同 tokenizer、输入输出配比、是否含缓存命中的口径并不一致,换算成钱时用的是社区报价并明示了假设,量级可信、精确值请以官网计费页和自己的实测为准;样本只有 5 个,够对号入座,不够外推所有人。