大模型推理成本为何差异巨大?

源自165位全网作者

05-20 17:51

内容由AI生成

精选参考来源

1. 订阅费200,成本5000,大模型入不敷出小米的罗福莉最近发了个贴,算了下Claude上用第三方angent的成本。她说,Claude Pro官方定价20刀/月,换算成API调用量,Token成本是163刀/月。Claude调用龙虾等第三方Agent,上下文管理很粗糙,一个重度用户单次请求会触发多轮工具调用,每次都是10万加的token超长文来推理,这对算力的消耗是惊人的。极端情况下,一个月200刀订阅费,anthropic可能成本能达到5000刀。罗说:真实的API调用成本可能是订阅价格的10-20倍。这完全是一个亏本买卖,除非Anthropic的API利润率有10-20倍(这几乎不可能)。难怪大家都把第三方关了,赔不起了。但是就算不是第三方,coding plan也经不起重度用户薅羊毛啊。订阅费是固定的,用户肯定往死了用,稍微用力一点,大模型厂商就亏了。如果想不亏钱,只能各种限售限购限用,对用户体验有影响啊。

2. #微博声浪计划##听见微博# DeepSeek新模型曝光,其新一代旗舰模型V4核心架构MODEL1因GitHub代码更新意外公开。该架构在KV缓存、FP8量化等方面革新,支持百万Token上下文,推理成本仅为GPT-4 Turbo的1/70,预计2026年春节发布,或推动国产大模型效率革命。 铭科技的微博音频

3. 18个月,中国Token消耗狂飙300倍!别乱烧钱了,清华系AI Infra帮你腰斩API成本

4. 黄仁勋喊出“推理拐点”,边缘推理的机会窗口打开了吗

5. #微博声浪计划##听见微博# Sora突然关停原因曝光:成本收益严重失衡,每10秒视频成本1.3-33美元,日均运维1500万美元,年化超54亿,收入仅140万。用户留存率低,被视为玩具,无法嵌入刚需场景。OpenAI为IPO优化财报,舍弃烧钱业务,原定迪士尼合作告吹。行业转向商业理性,技术需适配场景与成本。 http://t.cn/AXIcKEdd

6. aiX-apply-4B逆袭DeepSeek-V3.2!aiXcoder发布代码变更应用模型,单卡推理提效15倍

7. #国产开源大模型下载量破100亿次# 国产开源大模型的走出去的底气都在这里:我过超大规模市场和完整产业链。10 亿 + 互联网用户、海量场景,让 AI 技术能快速落地验证,迭代速度远超海外。政策持续扶持,算力基建跟上,国产算力集群规模全球领先,成本还低,推理成本差不多只有美国的 1/16。再AI安全合规方面,国产大模型更是走在了美国的巨头的前头,本土算力与安全工具链完善,企业能快速搭建合规体系,无需像海外企业那样承担巨额合规支出。

8. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

9. LLM强化学习不稳定之谜,被Qwen团队从「一阶近似」视角解开

10. DeepSeek-V4:华为昇腾适配、性价比王者、最新底层技术

11. 根据火山引擎2026年4月2日披露的最新数据,豆包大模型日均Token使用量已突破120万亿。按当前国内主流大模型约2-4元/百万Token的推理成本计算,豆包每天120万亿Token的消耗,相当于单日GPU算力支出约3到5亿元人民币。以此推算,一年的算力成本保守估计将超过1000亿元,这相当于网易2025年全年净收入(1126亿元)的规模。按照目前增速,字节全年基本上算力支出在 2000 亿以上了!还只是国内。#东哥笔记#

12. 【大语言模型训练与推理核心优化路径】快速阅读:本文梳理了大语言模型在训练与推理阶段的核心优化路径。通过对内存管理、计算效率、并行策略及推理加速的系统性回顾,揭示了如何在有限的硬件资源下实现模型规模的极限扩张。训练和部署大模型,本质上是在跟硬件的物理极限做交易。当参数量迈向千亿级,传统的管理方式会迅速崩溃。内存是第一个崩塌的层级。Attention 机制的二次方复杂度像一个吞噬资源的黑洞。Flash Attention 的聪明之处在于它不再试图一次性吞下整个矩阵,而是通过 Tiling 技术把任务拆解成小块,利用 Shared Memory 进行局部计算;同时配合 Recomputation,用计算换空间,只存线性长度的归一化因子,把内存压力降了下来。推理阶段的成本则主要卡在 KV Cache 上。为了不让模型在生成每个新 token 时都去重算一遍历史,我们必须把之前的 Key 和 Value 存起来。有网友提到,通过 GQA 或 MQA 这种共享机制,可以大幅削减缓存的体积。如果想更进一步,Speculative Decoding 这种“小模型先探路,大模型再校验”的策略,能让推理速度实现翻倍。而在训练的分布式架构里,并行策略的组合拳才是核心。ZeRO 优化器通过对参数、梯度和优化器状态进行分片,把原本冗余的内存消耗降到了极低。Pipeline Parallelism 试图解决 GPU 闲置的“气泡”问题,像 GPipe 或 PipeDream 都在尝试通过微批次调度来填满流水线。至于 Tensor Parallelism,它通过行列拆分矩阵,把巨大的计算量分摊到不同设备上。如果模型还是太大,MoE(混合专家模型)提供了一种思路:不再让每个 token 都经过整个网络,而是通过 Router 路由到特定的“专家”那里。这虽然带来了负载均衡的挑战,但确实让计算效率有了质的飞跃。优化从来不是单一维度的胜利,而是内存、计算与通信之间的一场精密平衡。x.com/gauri__gupta/status/2051882947758993815

13. AI 推理一文通:从 LLM 全流程到算子革命

14. #微博声浪计划##听见微博# DeepSeek连续两天降价,将大模型API调用成本压至全球新低,首日V4-Pro开启2.5折,次日全系列输入缓存命中价降至原价1/10。此举改写AI行业定价规则,开发者高频场景成本骤降90%以上,推动AI从技术探索向普惠落地过渡。 闫跃龙的微博音频

15. 反直觉:前沿模型虽然贵,但反而更好卖#AI #大模型 #芯片 #ChatGPT #Token

16. 用模型排行榜论输赢?AI竞赛到底在比什么? #大咖观察 #红衣聊AI #AI #大模型

17. 全面涨价!小米高管称手机成本已成鬼故事/中国AI调用量首超美国/苹果2026首款新品下周一发布

18. #为什么AI大厂开始卖Token#Token是大模型处理信息的最小单元,其消耗与算力消耗、电力成本直接挂钩,是按效用付费的最公平口径。AI从对话工具转向Agent与企业系统,工作量呈指数级爆发,按Token计费能精准匹配算力消耗,实现成本可控。同时,价格分层加剧:轻量模型低至135元/亿Token,旗舰模型则达数万元,形成差异化竞争。Token计费将主导通用场景与标准化服务,但并非绝对唯一。对高并发、低门槛的轻量应用,Token模式效率最高;而对复杂行业定制、私有部署或长期订阅场景,包年制/包量制仍有优势。此外,随着算力成本优化与缓存技术普及,部分场景可能出现价格阶梯或免费额度,以平衡普惠与商业化。Token不仅是计费单位,更可能成为AI时代的数字货币,承载价值尺度与流通手段功能。中国凭借绿电与算力基建,正以低成本Token重塑全球AI成本结构。未来,Token计费将与混合模式并存,共同构建AI商业化的多元生态。#how i ai# 为什么ai大厂开始卖token

19. 上交大和辉羲把LLM刻进ROM!推理性能冲2万token/s,GPU时代终结?

20. “2026年,我作为一名工程师是怎么用LLM的”网页链接这篇文章适合推荐给想了解工程师在 2026 年如何实际使用 LLM agents 的读者。作者对比了自己过去一年多使用 AI 的变化:从偶尔让 LLM 做 autocomplete、简单改动和一次性研究代码,转向把完整代码变更、bug 调查、大型代码库研究、测试和本地环境排查都更多交给 agents 处理。这个文章作者sean goedecke写过几篇很火的科普文,比如去年写的为什么 DeepSeek 大规模运行成本低,但本地运行成本高?#AI创造营#

21. #微博声浪计划##听见微博# DeepSeek新模型曝光!V4架构在GitHub意外泄露,春节发布前夕技术细节浮现。新模型采用独立架构,硬件优化使显存降30%以上,支持FP8量化,适配英伟达Blackwell。性能预期百万级上下文处理,API成本或为GPT-4 Turbo的1/70,若兑现将改写国产AI格局。 科技开的微博音频

22. 不同AI的售价差异相当大!MiniMax-M2.5-highspeed输入价格:4.2元/百万 tokens,输出价格:16.8元/百万 tokens;Claude Opus 4.6输入价格:约34.2元/百万 tokens,输出价格:约171元/百万 tokens;旗舰产品,Claude的API价格是MiniMax的10倍,这里面肯定有汇率因素,还有MiniMax是激进的 MoE (Mixture-of-Experts) 混合专家架构,推理时只激活一小部分参数,极大地降低了单次推理的计算量。这是4.0T V8带闭缸,平时就是2.0T的四缸机,推理成本低,Claude追求极致的长上下文逻辑一致性,其模型参数量通常更庞大,推理时的计算开销相对更高。这是美式6.2L 大V8,我就库次库次往里喷油。如果玩一玩的话,了解一下AI发展,感受下Agent是啥,肯定选2.0T;如果真要干活,还是大V8皮实

23. AI时代的Token #为什么AI大厂开始卖Token#一、Token 是什么?(AI 的 “语言积木”)你可以把 Token 理解成:AI 处理文字的最小 “积木块”。人类用汉字、单词说话;AI 只认 Token。它不是一个字,也不是一个词,而是 AI 把文字 “切碎” 后的最小单元。中文大概:1000 Token ≈ 400–500 个汉字。英文大概:1 Token ≈ 0.75 个单词。你给 AI 发一句话,AI 先切成一堆 Token,再去理解、生成回答。一句话记:Token = AI 世界的 “文字原子”。二、为什么流行用 Token 计费?(最公平的 “算力计价器”)因为:Token 数 = 实际算力消耗 = 成本。1. 算力和 Token 直接挂钩处理 1 个 Token,AI 要做大量数学计算(矩阵运算)。Token 越多,计算量越大、越费电、越占 GPU 内存。按 Token 收费,就是按 “AI 实际干了多少活” 收费。2. 比 “按字数 / 按次 / 按时长” 更公平按字数:中文和英文计算量不一样,不公平。按次:一句话和一篇长文,成本天差地别。按时长:简单问答和深度推理,耗时可能一样,但算力差百倍。Token 完美统一了不同语言、不同长度的计算成本。3. 鼓励高效使用你写得越简洁、AI 回答越短,Token 越少、越省钱。一句话记:Token 计费 = 按 “AI 工作量” 付费,最公平。三、Token 和算力的关系?(Token 越多,算力越爆炸)算力 = 机器的计算能力;Token = 计算的工作量。1. 正比关系(基础)处理的 Token 越多,消耗的算力、电力、时间就越多。就像:搬砖越多,花的力气(算力)越多。2. 恐怖的 “平方律”(关键)AI 底层算法(Transformer)决定:算力消耗 ≈ Token 数的平方。比如:4000 Token → 4000×4000 = 1600 万次计算。8000 Token → 8000×8000 = 6400 万次计算。Token 翻 1 倍,算力翻 4 倍。一句话记:Token 越多,算力不是线性涨,是爆炸式涨。四、龙虾(OpenClaw)为什么这么费 Token?(“Token 黑洞”)龙虾 = 自主 AI 智能体,不是普通聊天机器人。它费 Token,是因为工作方式完全不同。1. 它是 “全自动打工仔”,不是 “一问一答”普通 AI:你问一句,它答一句,几百 Token 搞定。龙虾:接到任务 → 自己拆解 → 规划步骤 → 调用工具(搜索、写文件、执行命令)→ 检查结果 → 循环重试。一个简单任务,可能要几十轮后台调用,Token 是普通对话的几十倍。2. 每次都带 “超级长的说明书 + 全量历史”龙虾每次请求,都要把:系统指令(我是谁、能干嘛)工具列表(浏览器、文件、代码)全部历史对话一起发给模型。光系统提示词就1.5 万 Token 起步。聊 5 轮,第 6 轮要把前 5 轮全带上,Token 直接滚雪球。3. 隐形消耗:心跳 + 记忆膨胀心跳:每 30 分钟自动唤醒一次,没任务也耗 Token。记忆:所有交互都存下来,越用越重。一句话记:龙虾是 “全自动 + 全历史 + 循环调用”,Token 自然爆炸。总结:Token:AI 的语言积木,计价单位。Token 计费:按算力干活多少收费,最公平。Token 与算力:Token 越多,算力呈平方级暴涨。龙虾费 Token:全自动 + 全历史 + 多轮循环,是普通对话的几十倍。

24. #微博声浪计划##听见微博# 中国AI出海进行时,依托西部绿电与“东数西算”,Token成本仅为国际1/20,海外API调用占比25%。企业分技术输出与生态服务路径,合规成关键。工业与消费场景双线渗透,面临地缘博弈与技术代差挑战,需以算法优化补硬件短板。 贾敬华的微博音频

25. #微博声浪计划##听见微博# 中国AI出海进行时!依托西部绿电和“东数西算”,Token成本仅为国际竞品1/20,海外API调用占比25%。企业通过技术输出获资本加持,合规成生死线。工业端落地中东,消费端覆盖50种语言,轻量化出海趋势显现,但面临地缘博弈与技术代差挑战。 小田Alice的微博音频

26. LLM 推理是如何工作的?

27. 市值近600亿,大模型公司上市了! #AI #智谱ai

28. 78ms的VLA推理!浪潮信息开源自驾加速计算框架,大幅降低推理时延

29. 【DeepSeek 联合清北发布论文:发力智能体底层基建,突破 Agent 推理 I/O 瓶颈】DeepSeek 与北大、清华在 ArXiv 发布论文,提出全新针对智能体的推理框架 DualPath。其核心是解决 Agent 长文本推理 I/O 瓶颈,通过引入「存储至解码」路径,改变传统单路径加载模式,实现集群存储带宽全局池化与动态负载均衡。在 660B 规模模型实测中,离线推理吞吐量提高 1.87 倍,在线服务吞吐量平均提升 1.96 倍,优化首字延迟且不影响 Token 间生成速度。DualPath 构建双路径模型,由推理引擎、流量管理器和中央调度器组成,还给出以计算网卡为中心的流量管理和自适应请求调度器两套优化方案。实验显示其能有效突破大模型推理 I/O 墙,提升智能体 LLM 推理系统效率。此外,论文第一作者是北大博士生吴永彤,他聚焦系统软件与大模型基础设施研究。

30. #用声音马住中国年##微博声浪计划# 千问3.5成本仅为谷歌大模型5%!除夕夜阿里开源发布Qwen3.5-Plus,架构革新让推理成本大降,API价仅谷歌1/18。春节期间生成1.2亿AI订单,156万老人首用AI服务,多模态能力覆盖办公、创作等场景,推动AI技术平权落地。 晓春哥XCG的微博音频

31. 在AI推理领域,谷歌TPU正以4倍于英伟达GPU的性价比,掀起一场技术革命。曾经主导机器学习训练的英伟达,正面临从训练到推理转型的严峻挑战。训练是一次性重投入,推理却是持续的“马拉松”——2024年OpenAI推理成本高达23亿美元,是训练费用的15倍。预计到2030年,推理将占据75%的AI算力需求,市场规模达2550亿美元。谷歌TPU专为推理优化,采用流水线阵列架构,显著降低延迟和能耗(比GPU节能60%-65%),并且单价低于英伟达H100。在Midjourney切换到TPU后,推理成本降低65%,吞吐量提升3倍。Anthropic计划部署百万TPU,Meta也在推动数十亿美元TPU采购,表明顶级AI公司正加速从GPU向TPU迁移。ASIC(应用专用芯片)如TPU以专精取胜,摆脱了GPU的多功能设计带来的资源浪费,适合海量、稳定的推理服务。尽管TPU生态依赖谷歌云及TensorFlow/JAX,对灵活性有一定限制,但面向推理的高效能和成本优势不可逆转。未来AI基础设施将是GPU负责研究训练,TPU主导大规模推理的混合格局。这场变革对创业公司尤为重要,TPU降低推理门槛,助力中小团队与巨头竞争。对于企业CTO,推理成本的爆发性增长迫使其重新审视硬件策略,提前布局TPU可节省40%-60%预算,同时降低碳排放压力。英伟达虽然推出Blackwell架构试图提升推理效率,但仍难撼动TPU的成本优势,投资者已开始大规模减持英伟达股票,预示其市场统治力将被蚕食。总结来看,AI算力的未来属于针对推理的专用芯片。TPU的强势崛起标志着AI基础设施进入“推理时代”,企业不抓紧转型,势必被成本压力和竞争力拉开差距。合理利用TPU和GPU各自优势,灵活部署混合方案,将是稳健的应对之策。原文:ainewshub.org/post/ai-inference-costs-tpu-vs-gpu-2025

32. #DeepSeek v4 百万上下文# 直接就发布了,这次太炸裂,又是行业重磅!DeepSeek-V4已经正式上线并开源,其核心特点如下:拎几个重点来聊聊:1、百万上下文标配:Pro与Flash双版本均原生支持1M token超长上下文。2、领先性能:Agent能力、世界知识与推理性能达国内与开源领域领先,Agentic Coding性能登顶开源模型。3、架构革新:创新采用基于token维度的动态压缩与DSA稀疏注意力技术,大幅降低算力与显存消耗。4、双版本策略:推出Pro版(1.6T参数,49B激活)与Flash版(284B参数,13B激活)。5、开源生态:同步开源模型权重,并已完成对华为昇腾等国产芯片的深度适配。#DeepSeekV4发布##DeepSeekV4和GPT5.5谁更强#

33. 小米杀疯了!MiMo-V2.5-Pro登顶全球开源大模型综合第一、Agent专项第一,跻身总榜前五。百万上下文、309B参数,推理成本仅闭源旗舰2.5%。手机厂商首次登顶,国产AI从跟跑到领跑,这波真的扬眉吐气!小米#小米##小米首次登顶全球开源大模型第一#

34. Rubin 是首代大规模搭载 HBM4 的架构。在技术层面,训练主要是 Compute-bound(计算受限),Batch比较大,而推理,尤其是长文本和高并发,是极度 Memory-bound(带宽受限) 的,Batch小,延迟要求高,毕竟是服务大量群众的。Rubin 把带宽拉到 20TB/s 以上,本质上就是为了解决推理时的吞吐瓶颈。 Rubin 当然能训练,英伟达的卡从来不偏科。但为什么要强调推理?因为 HBM4。训练吃算力,推理吃带宽。Rubin 把内存带宽拉到 Blackwell 的两倍多,摆明了是要在推理端降维打击,能训练是保底,推理成本降一个数量级才是 Rubin 让大厂掏钱的主要原因。。 现在大厂手里囤了那么多 H100 还没跑满,为什么还要盯着还没出的 Rubin?就是因为推理太贵。训练是研发投入,咬牙也就过了;但推理是日活开支,那是每天都在烧的钱。Rubin 的 HBM4 就是避免长期烧钱,没有谷歌的TPU也就算了,现在有个魔鬼TPU在边上,TPU 推理每 Token 成本比 H100 低 4 倍,不求变是不行的,不买是不行的。。 我厂有很多V100,也有H100,AMD 的MI250,300X 等,现在GB200还太贵,TPU要用谷歌云不方便,Rubin还没发布,我作为厂长,当然要了解和学习这里面的名堂。。当然我肯定没写过实际代码,就像老黄也没写过,不妨碍我们吹牛啊,对不对。

35. 英伟达最新FastDriveCoT!CoT思维链推理加速3-4倍...

36. Google TPU v6e、AMD MI300X 与 NVIDIA H100/B200的推理成本大比拼: 根据Artificial Analysis最新硬件基准测试,NVIDIA在「每百万输入输出token成本」指标上,较TPU v6e(Trillium)优势约5倍,较MI300X优势约2倍。 以Llama 3.3 70B模型配合vLLM在30输出token/s的参考速度测试,NVIDIA H100的成本仅为1.06美元/百万token,MI300X为2.24美元,TPU v6e则高达5.13美元。此成本指标综合考虑了系统吞吐量与云端租用价格,反映了实际推理的经济效率。 值得注意的是,测试基于当前云端可租用硬件,尚未包含即将上市的Google TPU v7和AMD MI355X。TPU v7在算力、内存与带宽上大幅跃升,但定价尚未公布,未来成本结构仍待观察。 此外,TPU仅限Google Cloud生态,使用时需绑定供应商;而NVIDIA GPU更具中立性,支持多云及本地部署,灵活性更高。硬件性能虽关键,实际成本也深受模型输入输出比例、并发策略及批量大小影响,企业需结合自身业务场景做综合评估。 从长远看,硬件只是推理效率的一环,未来真正的竞争力还将来源于跨平台的模型编译器和自动并行化技术,打破厂商壁垒,实现混合云协同。 当前NVIDIA硬件在推理成本和灵活性上领先,不过Google TPU v7和AMD MI355X有望带来新变数。选择硬件时,除了理论性能,更要关注实际应用环境和整体成本效益。AI推理的成本战,远未到尘埃落定的时刻。 详细数据及多模型对比请见: artificialanalysis.ai/benchmarks/hardware?model=llama-3-3-instruct-70b

37. GRPO、GSPO 后,Qwen又提出了一种SAPO的新算法,已被用于训练 Qwen3-VL 系列模型论文:arxiv.org/pdf/2511.20347算法主要期望解决大语言模型 RL 训练中的不稳定性问题,特别是针对 MoE模型。通过引入平滑的门控机制和非对称温度控制,提供了一种比传统硬截断方法(GRPO/GSPO)更可靠、更具扩展性的 LLM 强化学习优化策略 。#科技先锋官#

38. 为什么 AI 需要 GPU 和 TPU:理解大语言模型背后的硬件

39. 无限重建!上交开源InfiniteVGGT:打破长序列3D视觉几何估计显存瓶颈

40. 面向大模型推理的模型与系统协同优化

41. Gemini 3.1 Pro 与 Claude Sonnet 4.6 深度对比:2026 年性价比之王花落谁家

42. 曦望,死磕AI推理成本|甲子光年

43. #微博声浪计划##听见微博# 2026年4月25-26日,DeepSeek连续两天大幅降价,大模型API调用成本全球最低。首日V4-Pro打2.5折,次日全系列输入缓存命中价降至原价1/10,V4-Flash低至0.02元/百万Token。此举改写AI行业定价规则,倒逼竞争转向单位性能成本比,推动AI普惠。#DeepSeek连续两天降价# 科技晓鑫的微博音频

44. 黄仁勋罕见长文:未来10年,AI拼的到底是什么? #黄仁勋 #英伟达 #gtc #科技改变生活

45. 失控的内存:AI为何被困在“内存墙”中?未来四大技术风口深度解析!

46. 用科技行业的黑话说:LLM 的护城河,本质是智商(Intelligence)。“用过了就回不去”的效应非常明显。春节砸钱推广能短暂占据非早期采用者(Late Majority),但回报短暂(聪明的模型可以迅速转移用户),且ROI 可疑(低净值用户潜在回报无法抵消聪明的模型的推理成本,RLHF 价值也可疑)。要知道 Apps 根本不同的地方在于,因为 LLM 的推理成本,用户扩张的边际成本并不是 0 。这种推广的 LTV(用户生命周期价值)> CAC(获客成本)+ 长期推理成本的公式?大概率破产。这波推广本质上是大型互联网公司在 AI 时代的一次‘路径依赖’(Path Dependence)的症状发作。。。而 Apps 时代的 “流量入口逻辑”(Traffic Entry Logic)已经过时,超大规模云端模型的逻辑是 SOTA(State of the Art),能力强就是最大的流量入口。

47. #用声音马住中国年##微博声浪计划# DeepSeek或在春节再扔王炸,测试支持百万Token上下文的V4模型,采用条件记忆机制降低推理成本,编程能力目标突破90%准确率。但发布时间未定,还需应对巨头竞争,若落地将重构AI格局。 闫跃龙的微博音频

48. 小米 MiMo 负责人罗福莉就 Claude Code 封杀龙虾(OpenClaw)发表观点(图 1):全球算力增速已无法填补 Agent 制造的 Token 需求黑洞。未来的唯一解不是无脑降价,而是“更高能效的 Agent 框架 × 更强大的模型”。我个人判断:Claude 封杀不会是个例。“龙虾”确实会发送超长的上下文请求,且多为对模型毫无价值的低质量数据。目前国内部分 Code Plan 包月已开始限制“龙虾”的 API 请求速率,Kimi 和 Qwen 都已动手。对用户来说,未来要么接受按 Token 消耗计费,要么订阅更贵的包月套餐。这波限制必然会让很多人思考:部署个人“龙虾”,真的还有必要吗?

49. ICRA'26开源 | 南洋理工新作SURE:半稠密特征匹配打造SLAM新方向,完虐Superpoint + LightGlue!

50. 一直觉得这轮算力荒被误读了。表面看是供给不够,H100交付要18个月,HBM缺口60%。但火山引擎谭待讲了句特别扎心的话:超过50%的Token消耗在智能体的“无效探索”上。翻译一下就是,我们不是算力不够,是模型太蠢,蠢到要靠反复试错来完成任务,蠢到单token再便宜也扛不住它的浪费。所以这场涨价潮的本质,是全行业在为大模型的智商缺陷买单。英伟达赚的每一分钱里,都有一半是模型“想不明白”交的学费。 #Token消耗激增引发算力涨价# token消耗激增引发算力涨价

51. #DeepSeekV4更新了什么#DeepSeek‑V4:国产AI算力与技术双突破,以双版本架构、百万上下文、全栈国产算力三大突破,重新定义开源大模型上限。V4采用Pro+Flash双路线:Pro版1.6万亿参数、激活49亿,Agent能力超越Claude Sonnet 4.5,接近Opus 4.6非思考模式;Flash版2840亿参数、激活13亿,主打普惠,输入1元/百万tokens、输出2元/百万tokens,成本仅为GPT‑5.5的约1/20。全系标配1M上下文,依托自研DSA稀疏注意力,显存与计算量大幅下降,可一次性处理全书、大型代码库与长文档。最具行业意义的是,V4全面迁移至华为CANN框架,全流程跑在昇腾950PR,推理速度较H20提升2.87倍、能耗降40%,标志国产芯片可支撑万亿级模型训练与推理。当前Pro受产能限制高价限流,下半年量产放量后价格将下调,普惠可期。第三方测评显示,V4知识储备仅次于Gemini 3.1 Pro,与GLM‑5.1整体相当,长文本与成本优势突出;目前暂未开放原生多模态,为后续迭代重点方向。模型已深度适配OpenClaw等主流Agent,企业长文本任务成本可降约90%。从技术攻坚到算力自主,DeepSeek‑V4以长期主义推进技术普惠,不仅拉高国产AI天花板,更加速国产算力产业链商业化,为开源模型树立新标杆。#科技先锋官#

52. [哆啦A梦吃惊]//@宝玉xp:注意这一段:“Cursor 去年估算过,一个每月 200 美元的 Claude Code 订阅可能消耗高达 2000 美元的算力成本,这意味着 Anthropic 在大幅补贴。如今这种补贴力度似乎更加激进——据另一位接触过公司算力开支分析的人士称,这个 200 美元的套餐现在能消耗约 5000 美元的算力。Cursor 的个人订阅利润率为负,但企业套餐的利润率为正。”

53. 两个200亿美元:OpenAI和英伟达在打一场“推理之战”

54. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】

55. 独家|聚焦大模型推理,水下AI芯片公司斩获10亿元Pre-A轮融资

56. DeepSeek以开源、低成本、高效率著称,被英伟达用作新架构性能试金石,推理吞吐量可提升10倍;Kimi采用DeepSeek V3架构优化自身模型,但需平衡性能与成本,其K2.5模型虽支持长文本与智能体任务,却受限于部署资源。因此,就有了这个建议:#Kimi建议网友先用DeepSeek##Kimi好卑微#

57. 《推理型大语言模型的强化学习现状》(State of RL for reasoning LLMs)网页链接 这篇文章系统地总结了 2024 年至 2026 年间,强化学习在提升大语言模型推理能力方面的演进过程。本文是了解 DeepSeek-R1 之后 RL 技术路线的一份高质量技术综述,强调了 GRPO 及其变体在降低成本和提升逻辑推理能力方面的核心地位。#How I AI#

58. 超越ORION!CoT4AD:显式思维链推理VLA模型(北大最新)

59. #用声音马住中国年##微博声浪计划# 千问Qwen3.5-Plus成本仅谷歌大模型5%,API调用0.8元/百万Token。总参数3970亿但推理仅激活170亿,256K上下文吞吐量提升19倍,跨模态能力强。春节赋能年俗,企业端推动AI下沉,消费端加速普惠,关键指标全球领先。 宇思说科技的微博音频

60. OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能

61. 科技巨头集体押注自研芯,AI芯片战场正加速向推理端迁移

62. 在构建RAG Agent时,哪些场景应该用确定性逻辑判断取代LLM的概率推理,具体怎么实现?

63. 能一直20+FPS 跑是最离谱的事情… LLM 上车最大的问题就是长时序数据输出内存开销过大【脑子爆了】导致推理速度大幅度降低.. 地平线@地平线HSD 和华中科技大学的的InfiniteVL 模型能兼顾 感知精度和长时记忆两个维度。为LLM上车做了杰出的探索 @余凯_地平线民工 @谢晨杰xx #地平线hsd#

64. #玩游戏不怕8G显存不够用了# 玩游戏,买显卡,多少显存才够用呢?根据3月份的Steam硬件统计,有27.5%的Steam用户在使用8G显存的显卡,占比第一。但面对游戏画质和硬件需求的稳步提升,如今的8G显卡,确实是难以招架了。难道真要破财才能玩游戏吗?别急,新技术来了。 Steam的母公司Valve的工程师 Vock (pixelcluster) ,提出了一个显存优化方案,可以让游戏在Linux上的 "可用显存" 更多。Vock的办法是:让操作系统知道,目前正在运行的前台游戏,拥有显存的优先使用权。当显存快被占满时,后台任务所占用的显存数据将被强制“溢出”到系统内存中,从而保证游戏数据在显存里。 在此之前,Linux内核并不清楚该优先保留哪个程序的数据。一旦游戏占用显存过高,内核可能会将游戏数据移出显存,转而分配给后台的浏览器窗口等程序,从而导致游戏掉帧、出现卡顿。而这一套优先调度前台游戏的显存使用策略,以 dmemcg-booster 补丁的形式,可以安装在Linux内核中。 Vock用一张8G显存的显卡以及《赛博朋克2077》进行了测试。未应用补丁时,有1.37GB的数据被“溢出”到GTT,而此时游戏实际只占用了约6GB显存。应用补丁后,游戏使用了近7.4GB的显存,GTT中的溢出数据降至仅650MB。 所以本质上,这套方案并非直接减少显存占用,而是优化了有限显存的分配优先级。对于12GB显存的显卡而言,这套方案的效果可能并不明显;但对于8GB显卡,这一优化可以充分释放其潜力。就是目前仅支持Linux,同时只有intel和AMD的GPU能够使用,N卡由于显存管理部分是闭源的,所以无法使用。。。

65. Xiaomi OneVL 自动驾驶模型正式发布并全面开源 不是堆参数,而是把大模型推理延迟压到了0.24 秒,在保证精度的前提下,给量产智驾留了一条能跑起来的路。 统一 VLA、世界模型和潜空间推理三大技术路线,还把模型和代码全开源了,让大模型智驾离量产更近了一步。 小米原文链接:http://t.cn/AXifkdP0 #小米发布自动驾驶模型##小米自动驾驶模型XiaomiOneVL发布#

66. 字节豆包2.0发布:推理成本降一个数量级,正面对标GPT-5和Gemini 3

67. openclaw没思路?多场景分享+官方推荐的成本优化方案

68. #一条音频告别2025##微博声浪计划# 小米发布开源大模型MiMo-V2-Flash,总参数3090亿仅激活150亿实现轻量化,在数学竞赛、科学测试等位列开源前两名,软件工程测试第一,性能媲美DeepSeekV3.2。生成速度达150 tokens/秒,推理成本仅为其1/3,支持深度思考与联网搜索,融入澎湃OS,已开放体验。 科技小焱的微博音频

69. 我几乎可以肯定,Q4 KV 缓存量化会毁掉 Qwen3.5。没有。目前为止,我还没有发现任何明显的准确率下降。也就是说,它可能只对好的 GGUF 版本有效。如果从量化较差的 Qwen3.5(例如 Q2)开始,则 KV 缓存的噪声已经更大,并且更难可靠地量化。注意:再次强调,量化模型的性能高于原始模型并不奇怪。在小规模基准测试中,这种情况可能会发生,而且影响并不显著。更改随机种子也会产生这种效果。明天,我将在我的博客上发布关于 Qwen3.5 GGUF 评估的完整总结(链接在个人简介中),包括评估方法和最新结果。

70. 你爆过显存吗?爆显存的实际表现到底是怎样的呢,其中是什么原理

71. 【#奥特曼解释AI烧钱逻辑#:推理成本终将超过训练成本,算力直接决定了收入上限】当地时间12月19日,奥特曼解释AI“烧钱”逻辑。他表示,推理成本终将超过训练成本,算力直接决定收入上限,公司在训练上投入巨资,同时赚取日益增长的收入。(澎湃新闻) 澎湃新闻的微博视频

72. 【你经常使用AI工具吗?#国产算力需求指数级增长#】#中国模型调用量三周大涨127%# 2月26日,全球最大的AI模型API聚合平台OpenRouter数据显示,9日-15日这周,中国模型以4.12万亿Token的调用量,首次超过同期美国模型的2.94万亿Token。16日-22日这周,中国模型的周调用量进一步冲高至5.16万亿Token,三周大涨127%,而同期美国模型调用量跌至2.7万亿Token。与此同时,全球调用量排名前五的模型中,中国模型占据四席。中国模型厂商,正凭借快速迭代和成本优势占领全球市场,国产算力需求正经历指数级增长。 (每经) 网页链接

73. #微博声浪计划##听见微博# AI决战是卷模型还是卷场景?当前竞争重心转向场景落地深度与成本效率。工业场景提升生产力,本土化适配优势凸显,算力成本成生死线。中国AI通过能源、数据杠杆突围,开源生态反哺技术,端云协同突破体验瓶颈,未来决胜于经济性与普惠性平衡、生态协同及可信可靠验证。 shijin1的微博音频

74. 定位误差暴降23%!MIT新作VGGT-SLAM 2.0:实时密集前馈场景重建,消除15自由度漂移问题

75. 杀疯了!pySLAM v2.10.0 横扫SLAM圈:单目/双目/RGBD相机全支持,特征匹配/回环检测/语义建图/稠密重建/深度估计效果一键拉满

76. DeepSeek发新项目了!但不是v4地址:github.com/deepseek-ai/TileKernelsTileKernels: 为 LLM 操作优化的 GPU 内核,基于 TileLang 构建。TileLang 是一种领域专用语言,用 Python 表达高性能 GPU 内核,具备易于迁移、开发敏捷和自动优化等特点。这个项目中的大多数内核,在计算强度和内存带宽方面都接近硬件性能上限。其中一部分已经用于内部训练和推理场景。不过,这些实现还不代表最佳实践,我们也在持续改进代码质量和文档。从DeepSeek到前几天的Kimi,都还在不断做优化,还是缺卡啊。#AI创造营##How I AI#

77. 攻略|连锁匹配,轻松解锁20+酒店高端会籍

78. 大模型的成本拆解

79. 大模型推理优化关键技术及应用实践研究报告(2026年)

80. 大模型推理优化深度解析

81. 别只盯着大模型训练看!AI推理成本才是那头真正的“吞金兽”

82. 推理成本暴涨 15 倍!大模型规模化落地的核心密码,都在这份信通院 2026 重磅报告里

83. LLM生产推理架构设计与优化实战

84. LLM的训练与推理

85. 推理成本跌了50倍,算力账单怎么反而涨了

86. llm-d

87. 一文看懂《A Survey on Efficient Inference for Large Language Models》

88. 0.02 元 vs 1 元

89. AI大模型的Token经济学

90. 大模型的成本是怎么降下来的

91. 使用大模型提示词缓存节约90%成本

92. 什么是大语言模型推理?

93. 大模型推理为何如此困难?从模型加载到量化方法全解析 | Caleb Writes Code

94. 你每月烧掉的 Token 费用,至少 20% 都是冤枉钱

95. 大模型推理框架——DeepSpeed-Inference

96. 算法专栏

97. LLM 本地部署硬核指南

98. 如何快速评估LLM大模型显存占用情况

99. 不同显寸对应的可运行的模型大小

100. 什么?大模型部署需要多少显存你都不知道?

101. LLM显存革命

102. QWen 3.5 为什么这么省显存?即使上下文长度到了100万,显存基本不怎么变

103. 低延迟·高吞吐·显存带宽敏感

104. 部署70B大模型到底要多大显存?一文算清所有账

105. 阿里RTP-LLM开源

106. 从10元到1元,AI推理成本大跳水,智能体商业化加速

107. 推理成本暴跌280倍,但大多数企业仍然"用不好"AI——问题出在哪?

108. Cloudflare用上Kimi K2.5,每年省下77%推理成本

109. 不止推理提速!DSA机制如何让AI推理成本直降?实测数据来了

110. 蚂蚁集团AI新突破

111. Gartner重磅预测

112. 推理成本太高、算力不够用?单纯堆卡没用,得靠极致的“压缩”与“调度” | AICon

113. 推理慢吞吞,费用又烫手?DeepSeek和Kimi找到一套省钱解法了

114. 推理提速15倍、成本直降95%!北大系创企端出4B模型,叫板DeepSeek-V3.2

115. Groq 的推理芯片成本比 英伟达 的 Blackwell 芯片低 5 倍,速度却快一倍

116. 力争百万 Tokens 推理成本降低百倍!云天励飞首曝 DeepVerse 路线图

117. 大模型推理成本优化

118. 国产长文本模型杀疯了!SubCube实现1200万Token上下文,算力成本直降95%

119. 让长文本推理飞起来

120. Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference

121. 2026 年了,你的 AI 还在"云端裸奔"?本地 LLM 部署全指南

122. 搞定AI自由,成本、效率、顺畅、省心,一个都不能少

123. LLM Shepherding

124. AI编程,谁来付钱?又到底值多少钱?

125. LLM Agent 成本居高不下?斯坦福最新研究!从业者必学的省钱大招 | Agentic Plan Caching

126. 提示词缓存:让 LLM 成本降 10 倍

127. 一个LLM网关需要处理哪些工程问题?多模型路由与成本归因实战 - 哔哩哔哩

128. AI应用使用私有部署大模型与第三方API调用的对比

129. 大模型 API 成本到底怎么算?企业别只看单次调用价格

130. 大模型API成本优化

131. 从月花5万到5千

132. AI API 明明在降价,为什么企业反而花得更多?

133. 大模型算法:大模型微调占用显存

134. 浅谈LLM SFT训练的显存占用预估--同样训练一个7B模型,为什么大家的显存占用不尽相同?

135. 2026实测:算力GPU服务器显存选型指南,从显存容量到位宽全解析

136. 大模型部署全景:从训练到推理的系统架构与算力优化(含企业实践方案)

137. 10 家主流大模型 API 成本表。10 家主流大模型 API,我按输入价从低到高排好了。 最便宜输入是 doubao-seed-1.6(¥0.80/1M),最贵是 claude-opus-4-6(¥34.58/1M)。 输入价差约 43.2 倍,输出价差约 86.5 倍。 前 6 个模型(输入价升序)我给你先列出来: doubao-seed-1.6|输入¥0.80|输出¥2.00|<=256K(分档) grok-4-1-fast-reasoning|输入¥1.38|输出¥3.46|2M deepseek-chat|输入¥1.94|输出¥2.90|128K MiniMax-M2.5|输入¥2.07|输出¥8.30|204.8K glm-5|输入¥4.00|输出¥18.00|<32K(分档) kimi-k2.5|输入¥4.00|输出¥21.00|256K 这版我还把上下文窗口放进去了,做 Agent/长上下文任务时能直接看出性价比差异。 如果你要,我下一条可以直接做“编程场景 / 多轮对话场景 / 高并发场景”三套推荐名单。 #ChatGPT #Anthropic #GLM #豆包 #Grok

138. 中信证券:存算上下文长度激增 显存优化不改存力爆发需求

139. 系统视角下的大模型推理优化技术一览

140. Token 消耗与哪些因素相关?全面解析 AI 模型的成本构成

141. 昆仑芯平台量化生态,构建端到端量化体系

142. 如何评估大模型的推理能力

143. 长文本推理成本爆炸怎么办?ICLR 2026四种推理优化方案让短模型也能玩转长上下文

144. 2025年AI推理市场爆发,AMD携MI350系列与OpenAI等达成百亿级合作,挑战英伟达统治地位

145. 只有 4.5% 的评测成本,却有 97% 的排名相关性?MiniLongBench 揭示长文本评测的“虚胖”真相

146. 月之暗面API调用量大涨,中小企业用大模型成本会降吗?

147. 《电子学报》长摘要论文 | 山东大学戴鸿君教授团队:基于vGPU性能干扰感知的大模型推理负载资源高效配置方法

148. 机器学习研修系列 – 大模型量化AI应用实战 - 哔哩哔哩

149. 推理更从容:RTX PRO 5000 72G大模型推理实测报告

150. 大模型API聚合平台与官方API之间有什么不同?企业适合用哪一个呢?

151. 高并发AI推理场景算力服务推荐,低延迟高稳定性方案

152. LLM 推理优化与部署实战资料 - 哔哩哔哩

153. DMXAPI精选大模型API真实评测,deepseek-v3.1调用成本远低于官方,全场景实测效果依

154. 模型量化(Model Quantization)技术综述

155. LLM部署并行新策略:优化推理速度与吞吐量

156. 【AAAI2026】善始则事半功倍:基于前缀优化的大语言模型推理强化学习

157. LLM推理砍半成本还不降性能?|2026-04-03RL速递

158. 如何理解大模型的量化?

159. 别再瞎猜显存了!Qwen3.5内存公式+速查表

160. 大模型量化是什么?一文讲透

161. 2.3-3|LLM推理与表征优化:推理模型自我生成的安全对齐;推理模型增强嵌入表示;视觉引导压缩表示的变分潜变量推理

162. 百度文心5.1发布——大模型进入"成本效率"时代

163. 你的token花在了哪里——对于编程CLI调用api总费用函数的建模

164. 当大模型学会“犯错”:RL 如何让 LLM 推理能力上一个台阶

165. 论文分享:小规模语言模型推理的强化学习:有效与无效的分析

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章