均价跌了88%,账单翻了10倍:2026年的大模型价格表,得换本账来算

源自115位全网作者

04:32

均价跌了88%,账单翻了10倍:2026年的大模型价格表,得换本账来算

先放两个放在一起很像出了 bug 的数字:2026 年,全球 LLM 推理均价已跌至约 $1.16/百万 Token,较 2023 年下降 88%。知乎同一年,开发者圈流传的另一句话是"Token 单价降了 75%,账单却翻了 10 倍"。知乎一边是微软 9 月 1 日把 GPT-5.6 Sol 的输出价直接砍 33.3%,另一边是 DeepSeek 8 月 17 日正式实施大幅涨价并引入峰谷分时定价,涨价和降价同时发生,说明账已经不和"牌价"挂钩了。微博这才是当下 LLM 推理圈最该聊明白的事:不是哪个模型更聪明,而是这个月谁的账单还活着。

一、钱到底去哪了:三笔账,没有一笔写在牌价上

第一笔是用量斜率。 OpenRouter 的周度 Token 消耗从 2.1T 涨到 24.5T,今年以来的增幅约 280%。知乎 Agent 把计费单位从"一次对话"改成了"一个任务":有用户实测联调 63 次调用烧掉 1083 万 Token,产出的文字不到 2000 字,账户被扣了 20 多块。知乎有人拿 GPT-6 跑专业系统任务,13 小时耗了 2.1 亿 Token、五项任务总分 60/100;做独立游戏的 UP 主晒出来的是"这版累计烧了 109 亿 Token,业余时间做了将近一个月"。哔哩哔哩代价也是真的:有统计援引 Gartner 的说法,企业级 Agent 项目运维成本里 LLM 推理费用占比超过 65%,30% 的项目因为 Token 消耗失控被迫缩减功能甚至下线。

均价跌了88%,账单翻了10倍:2026年的大模型价格表,得换本账来算

第二笔是结构成本。 Datadog 的工程报告给了个扎心的数字:2026 年 3 月,其客户所有输入 Token 里 69% 是每次重复发送的系统提示词——输入的钱每花 10 块,约 7 块在重复发同一段内容。知乎而输出 Token 通常比输入贵 4-8 倍,真正的贵法是模型话太多。藏得最深的是缓存命中价:DeepSeek V4 Flash 的缓存输入谷时 $0.007/百万 Token、峰时 $0.014,Coding Agent 每轮都反复携带旧上下文,缓存价常常比标价更决定账单。知乎阿里云百炼上 Qwen3.8-Flash 的官方原价则是输入 0.8 元、输出 2.7 元、缓存命中 0.1 元。坑在缓存边界上:时间戳、session_id 这类动态字段只要放在缓存前缀里,命中率直接归零;把它们挪到消息最后,有案例把命中率从 0% 拉到 80% 以上,GitHub 靠这个单日省了约 3.2 亿 Token。

均价跌了88%,账单翻了10倍:2026年的大模型价格表,得换本账来算

第三笔是时段与促销日历。 微软这轮 33.3% 的降幅写明了"至少持续到 11 月 30 日",是促销不是转向——而且输出降 33.3%、输入只降 20%,输入密集型任务根本吃不到名义降幅。知乎这个剧本两年前演过一次:2025 年 2 月 DeepSeek V3 优惠期结束,涨幅最高 300%。而 DeepSeek 自己 8 月已经一个月内改了两轮规则:17 日峰谷上线,23 日起周末全天统一按谷时价收费——计费结构正在以周为单位精细化。微博还有个无数账单骂过的暗坑:GLM-5.3-Flash 的 reasoning_effort 不显式传值就默认按 max 跑,拿 max 去改按钮颜色,模型有点冤,账单是真疼。知乎

二、成本在跌、牌价在涨:2026 价格表为什么拧着来

智谱 8 月 31 日的半年报把矛盾摊开了:上半年收入超过去年全年,仍亏 20.72 亿元;但官方口径里单位 Token 推理成本较年初下降 80%,单位算力投入对应的收入提升 14 倍。知乎成本降 80%、牌价却在涨,是因为瓶颈换了:从"跑不跑得起"变成"有没有卡"。中国日均 Token 调用量已突破 140 万亿,较两年前增长超 1000 倍;今年 5 月 DeepSeek 连续崩溃,用户量暴涨 66.7%,算力储备只增了 8.3%。知乎社区高赞的总结就一句:大模型真正的斩杀线是算力。

均价跌了88%,账单翻了10倍:2026年的大模型价格表,得换本账来算

所以涨价和扩产是一件事的两面——9 月 6 日彭博社报道 DeepSeek 向华为订购 16 万颗昇腾 950DT,明确主要投向推理,社区的第一反应正是"刚涨完价,转头就订了这么多芯片"(报道口径,待官宣)。知乎同期另一端也没停:Qwen3.8-27B 配端侧专用 harness 被讨论"零成本推理",腾讯云 6 月 15 日起下调 MiniMax-M3 的 TokenHub 售价。微博轻量档在卷价格,旗舰档在修毛利——价格表不是混乱,是分裂成了"普惠"和"稀缺"两本账。

三、这个月就能动的:按投入产出比排的降本清单

  1. 审计缓存边界(半天工作量,回报最高):把动态字段移出缓存前缀,命中率按倍数涨。

  2. 先压输出,再压输入:有 RAG 案例把 max_tokens 从 2048 降到 512 并加 stop 截断,BLEU 只掉 2.3%,输出消耗降 71%,月账单从 4.2 万变 1.1 万。知乎

  3. 按任务分档路由:复杂推理走旗舰(通常占 5%-15% 调用量),常规走中档,分类抽取走轻量档——旗舰和极轻量模型的单 Token 价差约 25 倍,不挑任务直接上旗舰是最低效的用法。

  4. 错峰与批处理:不赶时间的长文档、批量分类挪到谷时和 Batch 通道,有实测 25 万条数据批量处理花了 7.04 美元。知乎

  5. 订阅和 API 分开算:社区用户直接晒过账——MiniMax 119 元/月的订阅扛 40-60 亿 Token"完全没有压力",涨价后的 DeepSeek Flash 按 API 算未必打得过它。知乎

研究侧的刀已经卷到推理轨迹内部:PyroDash 让小模型生成到一半自主决定要不要交接给大模型,低成本模式下五项数学基准的估算总成本从纯大模型的 $49.36 降到 $1.78,降幅 96.4%,准确率还高于 RouteLLM 等路由基线。知乎但边界也说得直白:论文作者自己标注实验集中在数学推理、单次生成上限 8192 tokens、成本按公开牌价估算而非真实账单,落地前得自己复测。

均价跌了88%,账单翻了10倍:2026年的大模型价格表,得换本账来算

四、谁可以不管,谁要接着盯

轻度用户和免费额度党:峰谷、缓存这些和你无关,端侧模型和订阅档的红利是真的,正常用。生产上跑 Agent/Coding 链路的团队:三笔账全部适用,第一动作是拉真实流量重算成本——用过去 30-90 天的输入输出占比、缓存命中率、峰值并发去套新价,不是按名义跌幅外推。之前"因为太贵被搁置"的项目值得重跑一次 ROI:这轮输出端降幅大于输入端,就是给生成重的任务解锁的。知乎

继续盯三个信号:11 月 30 日微软促销到期后牌价回不回摆;昇腾 950DT 落地后 DeepSeek 的峰谷价差会不会继续收窄——按它本月已经改两轮规则的节奏,这不会是最后一次;智谱 Q3 毛利率能否证明"涨价换服务"这条线走得通。这三个答案,决定 2027 上半年价格表长成"普惠"还是"稀缺"。

一句话收尾:单价崩塌年代,账单的形状不取决于牌价,取决于你怎么用、用什么结构用、什么时间用。推理红利到底进没进你的口袋——把账单拆开看一眼就知道。

内容由AI生成

精选参考来源

1. Token经济学:大模型推理的成本结构与优化技术栈深度剖析

2. 2026年大模型API账单失控:涨价350%、年差45万,开发者如何自救?

3. DeepSeek API开放平台8月23日起调整峰谷计费规则

4. DeepSeek涨价太狠,几分钟就花光我的小金库

5. DeepSeek消耗100亿token制作丧尸射击肉鸽游戏

6. deepseek-v4-flash、glm-5.3-flash、qwen-3.8-flash怎么选择?

7. 模型降价33.3%,企业成本真的会降33.3%吗?

8. DeepSeek宣布8月23日起周末全天执行谷时价格

9. 智谱上半年收入超去年全年,却仍亏损20.72亿元且推理成本下降80%,如何看待其经营状况?

10. 彭博社曝DeepSeek向华为订16万颗昇腾950DT芯片,对国产AI产业意味着什么?

11. 腾讯云:下调MiniMax-M3与Hy-MT2-Pro模型价格

12. 25万条数据只花7.04美元,LLM批量推理到底有多省?

13. 如何看待MiniMax闫俊杰提出「最小化推理成本,最大化智能」?这会改变大模型的「斩杀线」吗?

14. 推理成本降低96%,保持高精度:PyroDash用一次交接重新定义AI推理

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章