这两天,AI开发者圈子里在转一句话:「你以为买的是 DeepSeek Flash,到手可能是个 1.5 bit 缩水版。」说话的是开源项目 Pi 的核心贡献者 Armin Ronacher,他在播客里吐槽:现在的 token 市场像一种成分不明的商品——量化程度、实际版本、有没有掺别的模型、计费方式,全是黑洞。36氪
这句吐槽出现的时间点不是偶然。8月17日,DeepSeek 刚把峰谷定价推上来,工作日 9-12 点、14-18 点是高峰,价格翻倍。知乎8月23日又改了一次:周末全天不再分峰谷,统一按低谷价收费。36氪而这次涨价幅度有多狠?V4-Pro 新版本的峰时价格最高涨到了原来的 12 倍。36氪
而且这轮涨价不是 DeepSeek 一家的事。2026年以来,智谱、MiniMax、月之暗面都陆续上调了 API 价格,独立模型厂商普遍在从抢市场转向要利润。知乎另一头,token 早就不是只有程序员才买的东西了:国内日均 Token 调用量已经飙到 140 万亿级别,运营商都开始卖 9.9 元的 Token 套餐。36氪所以下面这个问题,跟每一个为 AI 花钱的人都有关:你花的钱买到的 token,到底是什么?
我把这句吐槽、一份海外安全团队对中转市场的调查报告,还有社区里这两周的讨论捋了一遍,坑分三层。第一层有实锤,第二层半实半虚,第三层人人躲不掉——哪怕你只买官方。

第一层:钥匙黑箱——便宜货为什么能这么便宜
先看价差有多夸张。官方定价 15 美元/百万 Token 的 Claude 3.5 Sonnet,在中转站能卖到 1 折甚至更低,最夸张的标价直接打到官方原价的 97.8% off,连 0.5 折都不到。知乎论坛里有中转站运营者算过一笔账:425 元的包月套餐,买家实际刷掉了约 3333 美元的 Anthropic 官方额度,1 美元买到 8 美元的算力。
折扣这么大,钱是从哪里省出来的?安全团队 Vectoral 的调查把这条产业链拆成了四层:最上面是卡商和号商,批量搞虚拟信用卡和注册账号;中间是「账号池」,聚合成百上千个账号,API key 轮询,封一个自动切一个;往下是中转站,把这些 key 包装成中文面板、接上微信支付宝、按倍率计费;最底下是买家——有个人开发者、创业团队,也有商业客户。
这些钥匙的来源,几乎没有正规采购成本。知乎常见路径就三条:
免费试用套利:批量注册新账号,薅平台赠送的初始额度再转卖;
盗刷与恶意拒付:用盗刷的信用卡充值,额度刷完再发起退款;
「血包」劫持:把企业客服机器人、测试页面的后台接口逆向出来,直接白嫖算力。
还有一个很多人没想到的隐藏大客户:模型蒸馏。有团队通过中转站调用顶级模型批量生成训练数据,成本比按官方原价跑低近九成,甚至催生了专门的「蒸馏数据服务」中间商。
所以买打折 token,你赌的不只是「货可能不对」:服务随时可能关停(钥匙本来就是黑来的),你的每一段对话都流经别人的服务器日志,大厂溯源封号时你用的 IP 段还可能被连坐。这一层有调查实锤,不是猜测。
第二层:成分黑箱——「缩水版」半是比喻,但不是空穴来风
回到开头那句刷屏的话。严格说,「1.5 bit 的 DeepSeek 冒充 Flash」是个比喻——没点名、没实测,不必为这一句话恐慌。36氪
但这个比喻能引发共鸣,是因为它在技术上完全可行。量化本身是常见的推理降本手段:把全精度模型压到 8 bit 甚至 4 bit,显卡需求能降一大截,输出看起来「差不多」——问题就出在差不多上。日常闲聊你感觉不出来,数学推理、代码边界情况、长文本一致性上的衰减是温水煮青蛙式的。
更难防的是「调包」:你付的是 Flash 的钱,后台可能把一部分请求路由到更弱的模型。没有固定题库做回归测试,靠直觉基本抓不到。
这一层要诚实说明:目前没有可独立验证的实锤,更接近「结构性可能 + 从业者焦虑」。但结合第一层看,风险是真实的——钥匙来源不明的地方,后台跑的到底是什么模型,同样没人知道。
第三层:计费黑箱——买官方也躲不开
这是那场播客里真正想说的,也是人人中招的部分。最扎眼的两点:OpenAI 的多 agent 编排提示词直接加密,主 agent 发给子 agent 的指令只能在自家平台解密,想跨平台编排?门都没有——这已经不是工作流绑定,是基础设施锁定。36氪
缓存机制同样不透明:缓存怎么匹配、保留多久、命中和未命中怎么计费,全由提供商决定;切换模型时你得从头重建缓存,再烧一遍 token。
订阅制则在悄悄掩盖真实成本:游戏开发者 Steve Yegge 为一个项目开了 12 个订阅,按真实 token 价格折算每月约 9 万美元,一年接近 100 万美元——项目的收入根本覆盖不了。36氪低价订阅让你误判 AI 的真实身价,等厂商开始收费,冲击比想象中大。
峰谷定价的依据,也是真实存在的算力峰谷。DeepSeek 在开源周活动里披露过 24 小时的服务流量、成本和理论收入估算,白天高峰的推理节点数量接近夜间低谷的 4 倍。36氪价格杠杆是真的,优惠也是真的,但杠杆再动的时候,看不懂规则的人就是最先被晃下车的。

那到底怎么办?按人群拆开说
个人用低价中转学习、跑副业项目的:你买的主要是「关停和泄露风险」,认了就行。守住三条:小额充值(关停损失有限)、敏感内容一律不传、留好随时能切换的备用渠道。
准备上生产环境的中小团队:远离来路不明的钥匙。灰产 key 带来的 429 限速、突然关停、法律主体问题,对生产环境都是致命的。想省成本完全可以走正路:DeepSeek 周末已经全天谷价,V4-Pro 输出 13.5 元/百万 Token,正好是工作日高峰 27 元的一半。知乎数据清洗、定时推理这类不着急出结果的批量活儿,丢到周末跑就行。

企业和合规场景:盯紧合同里「零数据保留」和缓存透明度两条,把跨厂商迁移成本认真评估进去——加密和缓存造成的锁定,比价格绑定更牢。
订阅制用户(各种 Coding Plan、会员):定期把自己的用量按量付费折算一遍,看订阅到底值不值。低价补贴期不是永恒的,这个月 DeepSeek、智谱、MiniMax、月之暗面已经一起动手了。
5 项自查清单,建议收藏
固定探针回归:准备十几个有固定答案的问题每周跑一遍,输出波动大,就是「偷换模型/量化」最便宜的检测方法;
记录 token 生成速度,突然掉档大概率是后台换了东西;
小额充值试水,核对倍率换算是否对得上官方价;
警惕关停前兆:频繁 429、速度减半、模型改名、疯狂催充值;
过第三方中转的对话默认「有人在看」,敏感内容永远别传。
Armin 在播客里说了句话,大意是:奥弗顿窗口在扩大,每一次容忍就是多让渡一分控制权。这话听着耸动,但落到每个花钱买 AI 的人身上,道理很朴素——市场越不透明,越要自己把知情权抓在手里。