你有没有发现,Token这个AI时代曾经最难搞到手的东西,开始像海鲜一样卖了——今天卖不掉,宁可打折清仓。
这周发生了两件事。DeepSeek正式实行峰谷计价:高峰时段是工作日9:00–12:00、14:00–18:00,其余时间全部算低谷,低谷价格是高峰的一半。知乎看看这个时间段——早班加午班,午休给你空出来,周末不算高峰——这是一张定价表,也是一张上班族的作息画像。智谱更直接:周末免费送Token,直接放出3亿,有人拿这份白嫖额度做了个网站,全程开销就是10块钱。小红书

算力不是AI时代最稀缺的资源吗,为什么突然开始清仓?
答案很直白:因为算力不能储存。粮食可以进冷库,电可以存进水库,但一张GPU空转一个小时,这个小时的折旧、电费、散热照常燃烧,而这个小时的算力永远消失了。知乎它不能留到下周一再卖。所以对厂商来说,低谷时段的算力就是当天的海鲜:宁可便宜卖,不能烂在手里。更深的原因藏在那张定价表里:今天的Token需求,大头还在做"上班族生意"——编程、办公、客服、数据分析,消耗完全跟着办公室的时钟走,早上九点爬升,晚上六点回落,周末直接跳水。当厂商开始像分时电价一样卖Token,说明这个市场还在很早期的阶段——而对我们这种自费买Token的人来说,早期市场意味着有便宜可占。
不过别以为"清仓"只是促销噱头。这一周,整条"Token工厂"产业链把账本一次性摊开了:一份招股书、一份财报、一笔收购,三个完全不同的故事。
第一笔账:硅基流动递表港交所——纯倒卖Token不赚钱
这家公司的定位是"AI Token工厂第一股",生意一句话说清:从云厂商租GPU,灌进自己的推理引擎,折算成Token卖给开发者。增长数字吓人:营收从2024年的735万元激增到2025年的5533万元,增速653%;截至今年4月底,平台注册用户突破1028万,日均Token吞吐约5785亿次。36氪
但翻到损益表,故事变了:2025年整体毛利率-24%,其中公有云服务——也就是卖Token这门生意——毛利率低至-119%,越卖越亏。知乎钱烧在哪?三个地方:一是算力全靠租,算力资源成本占营业成本的86.9%;二是送券拉新,2025年免费Token代金券支出5421.3万元,占销售及营销开支的64.7%,换来的用户全年只贡献了约1430万元收入;三是研发费用2.09亿元,接近全年营收的3.8倍。账上的钱按现在的烧钱速度只够18个月,而三年下来,累计净亏损已有4.4亿元。36氪

一句话总结:纯转售型Token工厂,上游(算力)下游(客户)都没有壁垒,量跑得越大,亏得越多。
第二笔账:商汤半年报——模型和算力都是自己的,才能盈利
同样是这周,商汤交出了上市以来首次半年度盈利:国际财务报告准则(IFRS)口径下,期内利润6.2亿元,毛利率升至41.4%。知乎它的Token工厂逻辑和硅基流动完全不同:SenseCore大装置4.8万P算力自建,模型是自研的日日新系列,7月日均Token服务量2.4万亿,同比涨了约22倍,还对外服务了4家外部基础模型厂商。算力、模型、客户全闭环——这正是中国公有云MaaS市场前三走的同一条路:火山引擎49.2%、阿里云27%、百度智能云17%,三家合计约93%。36氪
第三笔账:OpenRouter卖了75亿美元——最值钱的是不碰算力的中间商
这笔最戏剧。OpenRouter一张GPU都没有,一个模型也不训,只做一件事:一个API接通80家供应商的500个模型。今年5月融资时估值13亿美元,三个月后Stripe用75亿美元把它买下,估值翻了5倍。知乎团队90人,日处理Token超10万亿,7月ARR 1.4亿美元。

为什么"中间商"最值钱?因为它卡在模型切换的必经之路上:企业怕被单一模型绑定,今天的最优解三个月后可能就被替代,排行榜、隐身发布、迁移流量全从这一层过——连OpenAI都先在这里隐身首发GPT-4.1。这像证券交易所——不生产股票,但所有交易都从这过,交易所的估值从来不是按手续费算的。
看完这三笔账,Token市场的结构就清楚了:卖算力的最不赚钱,自有闭环的能盈利,卡住交易的赚最多。理解这一层,你面前的各种价格才能看懂。
那么,自费买Token的人,这波怎么薅?三个薅法,三个坑
薅法一:低谷折扣是真的,把能挪的任务挪到低谷。峰谷计价本质是AI版分时电价,同样的模型同样的输出,低谷就是半价——这不是套路,是纯结构性折扣。智谱周末的免费Token已经被个人开发者和学生拿去跑"工作日跑不起的任务"——清数据、打标签、批量生成、非实时微调。你有"可以晚点做、不急着要"的任务,全部排到夜里和周末。
坑一:太便宜的Token大概率是换皮。有人对"1元285万token"的中转站做了一次完整取证,成本3毛5:你买的是"DeepSeek V4 Pro",商家却在系统提示词里写着"You are MiniMax-M3",同时要求模型对外自称DeepSeek。知乎模型还会在思维链里泄露真实身份——这次泄出来的是Kimi;五个不同名字的SKU,对同一探针返回完全一致的token计数——一个后台,五张皮。中转站改的是一行model字段的代码,伪造不了的是模型的思考过程。验证方法很简单:问"你是什么模型"这类身份问题,或让它复述自己的系统提示词;懒人方案是直接用API Detective这类开源工具探测。
坑二:套餐"不限量"大多有隐形天花板。有用户实测:买了109元的GLM套餐,兴致冲冲打开项目,10分钟烧完5小时额度——GLM的并发上限极低,多开一个agent就崩。知乎充98元的MiniMax,模型"流口水",半小时烧掉20%额度,一个问题没解决。评论区里被顶得很高的结论有点扎心但值得记:100元以下的套餐基本没得用;199元的Kimi K2.7勉强能用;GLM要到600元档才可用——付3个不够用的100,不如付1个靠谱的200。买套餐先看额度上限和并发,再看单价。
坑三:别锁长期。模型市场的价格一周一变:DeepSeek 8月17日刚提价,9天后GLM-5.3-Flash就打着MIT开源来了,Qwen3.8-Flash同夜发布更低的标价,一场"精准狙击"。而GLM的促销价只到9月9日,有开发者测算恢复原价后反而比涨价后的DeepSeek贵约46.6%。知乎
海外同期也在降:Google的Gemini 3.7 Flash约打5折,Anthropic取消了Claude Sonnet 5原定9月+50%的涨价,OpenAI则把GPT-5.6 Sol的输出价从每百万30美元降到20美元,降幅33%,且至少维持到今年11月。知乎价格降得这么快,锁年费等于把钱包冻结在时间点最贵的那一刻。
Token价格会走向哪里?一个判断,两个信号
今年的Hot Chips上,英伟达不再谈单卡算力,而是宣布推理加速器Groq 3 LPX全面投产,“Token工厂"贯穿整场发布:推理时代的问题不再是"你的模型多大”,而是"你的工厂每秒产多少Token、每个Token多少钱"。NVIDIA官方博客英伟达的数据还说,智能体系统的Token消耗可达传统AI应用的15倍——这就是为什么单价在降、全行业总量却在爆:截至今年6月,中国日均Token调用量已突破500万亿。知乎央视网英伟达给出的曲线图也很直观——纵轴是每兆瓦功耗每秒产出的Token数,从Hopper、Blackwell到Vera Rubin、LPX,一代一个台阶。

前英伟达工程师、Sail Research联合创始人Neil Movva的判断更激进:推理成本还有1000倍的下降空间——这不是某一块神奇芯片的单点突破,而是整套系统共同改写成本结构。知乎而计价单位最终会从"生成了多少Token"变成"完成了多少工作"——你给目标和预算,Agent自己决定怎么花。当Token便宜到像电,会冒出一批"以前贵得舍不得做"的产品:凌晨重建知识库、提前生成游戏内容、深度研究跑整夜。
所以对大多数人来说,策略不复杂:别囤Token,价格长期会降;能挪的任务挪到低谷;别碰太便宜的中转站;真要付费,选中间档的月套餐,别锁年。
两个信号值得盯着:一是9月9日之后智谱的促销价续不续——促销截止日,就是真实价格现形的日子;二是硅基流动上市后的定价和毛利——纯转售型Token工厂到底能不能赚钱,市场很快会有第一个上市公司样本。
充套餐之前,再问自己一句:这个任务,是不是周末跑一次就够了?