这周,两条方向相反的价格信号同时砸在大模型推理上。一边是 OpenAI 公布首颗自研推理芯片 Jalapeño 的实测成绩,每瓦性能全面压过英伟达 GB200、GB300,单芯片每小时总成本与 H100 持平;一边是微博和小红书里普通用户在晒账单,DeepSeek 涨价后"一个问题烧了7块钱",“涨价前用力蹬1个月都用不到5块钱,涨价后一眨眼一个下午就没了5块钱”。新浪微博新浪微博
大模型推理没有统一变便宜,也没有统一变贵,它在"分叉"。今天用跨源数据把这笔账算清楚:为什么分叉、你的账单在哪条路线上、哪些钱能省、哪些钱别花。
这周的三张账单
先看 OpenAI 掀的桌子。Jalapeño(墨西哥辣椒)是 OpenAI 第一颗自研芯片,不针对训练,专攻模型上线后"快速回答用户请求"的阶段。在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 三个公开模型上,Jalapeño 在峰值吞吐量下实现了 1.5~1.9 倍的每瓦 AI 工作量,端到端延迟降低至对比系统的 1/1.7~1/3.6。36氪在 GPT-OSS 120B 上,它一秒吐出 1459 个 token,对比系统 GB200 只有 535。

全网疯传的"104.3 倍"要准确理解:它不是全面碾压,而是把 GB300 逼到自己最快的解码速度——每秒 169 个 token——之后,在同样的速度口径下,Jalapeño 的吞吐才是它的 104.3 倍。36氪对手越往极限喘,差距越拉大,三个模型上分别是 53.7 倍、104.3 倍、56.1 倍。

再看美国的价格战。过去 27 天 OpenAI 降了三次:入门款 GPT-5.6 Luna 从每百万 token 7 美元降到 1.4 美元,旗舰款 Sol 的输出端也从 30 美元降到 20 美元,优惠至少持续到 11 月 21 日;Google 也在 8 月 13 日把 Gemini 3.7 Flash 降了 50%,限时到年底。知乎
而 DeepSeek 走了反方向:8 月 17 日执行新价,V4 Pro 高峰输出 6→27 元/百万 Token,部分场景涨了 12 倍。小红书不到一周又放出周末折扣,先涨价是为了在算力吃紧时筛选高净值客户,打折则是为了在低谷期抢夺开发者生态。新浪微博逻辑和峰谷电价一模一样。
为什么分叉:推理成本变成了"分时电价"
先看硬件端,就知道通用推理为什么敢便宜。每芯片每小时的总拥有成本,Jalapeño 是 1.56 美元,跟 H100 的 1.55 美元几乎一样,而 Vera Rubin 是 3.61 美元;按每兆瓦每秒吐出的 token 算,Jalapeño 约 5300 万,GB200 NVL72 只有约 1000 万。36氪注意,这还是一颗连投机解码都没开的一代芯片,SemiAnalysis 估算,光投机解码一项就能把每 Token 成本再压掉 2/3 以上。硬件成本压到这个位置,云厂商之间除了价格战,没有别的路。

但需求端是另一番景象。OpenRouter 平台周 Token 消耗量达到 93.4 万亿,首次突破 90 万亿关口,环比增长 24%,自年初的 6.4 万亿算起八个月增长近 14 倍。知乎Agent 一个任务要连着走几十步,单步延迟差值会被一路乘上去,这正是 Jalapeño 优势最大的场景:对于高度交互式的工作负载,性能优势达到 2.1~4.1 倍。36氪

所以今天的推理成本,不取决于"你用的模型强不强",而取决于"你什么时候用、怎么用":通用轻推理供给过剩、越来越便宜;思考重、高峰时段、高交互的推理算力吃紧、越来越贵;自己在家跑,则是另一套价格体系。
三条路线:你的账单该怎么付
轻度用户(聊天、办公、偶尔调用):安心享受价格战。Luna 每百万 token 1.4 美元,日常使用一天合不到几毛钱;别囤套餐,也别为本地部署冲动买卡,值得观察的是 11 月 21 日旗舰优惠到期后会不会变成常规定价。
重度 / Agent 用户:先砍消耗,再套利峰谷。同一个模型、同样 14 个任务,仅仅外层 harness 配置不同,任务完成率几乎一样,但 token 消耗差 2.7 倍。知乎社区实测 Qwen3.8-27B 默认思考档位 xhigh"不肯收尾",调到 medium,准确率从 73% 回到 93%,Token 还省一半。小红书再往上,用 27B 级"小分队"路由中档任务、只把难题送旗舰,Token 账单只有巨无霸的零头。知乎躲不开 DeepSeek 的,把重活挪去低谷时段吃折扣。
隐私 / 离线 / 重度折腾用户:本地窗口确实开了,但这是"折腾者的自由"。Qwen3.8-27B 4-bit 量化后 15-17GB,16G 显卡能跑,单张 RTX 3090 实测 120 token/秒。小红书但行业侧的反向账也真实:DGX Spark 一年亏 3 万、5090 跑满 24 小时才赚 3 万。只为聊天省钱,别买卡;有隐私、离线或折腾需求,现在入场体验确实好。
接下来盯什么信号
Jalapeño 计划 2026 年底前开始部署到 OpenAI 自己的计算基础设施,量产爬坡要到 2027 年。36氪硬件端的成本下探要传导到定价链,你的账单才会真的降,重点看四季度 API 是否再降一轮;同时 OpenAI 自己也说了仍会继续大规模部署英伟达,"替代"是渐进的。
11 月 21 日 Sol 优惠到期后是否转正;Google、Anthropic 是否跟进旗舰降价。
DeepSeek 的峰谷定价还在细化:8 月 23 日又发公告,周末全天按低谷价算,把批量任务挪到周六周日跑,每百万 Token 输出只要 13.5 元。知乎
开源社区的下一步:伯克利和 MIT 开源的 FreeToken 让单卡 5090 跑满了满血 DeepSeek V4 Flash,后面还有没有下一个 27B 级甜点位模型接棒。小红书
Token 没有统一变便宜,也没有统一变贵,世界正在把它分成三种价格。先弄清自己的账单在哪条路线上,再决定怎么付——轻用户等降价,重用户砍消耗,折腾玩本地,各得其所。