推理成本远超训练,算力需求爆发才刚刚开始
05-16 01:15
精选参考来源
精选参考来源
1. 从算力到存储,谁能掌握AI时代的“口粮”? #大咖观察 #红衣聊AI #算力 #存储 #硬件
抖音 2026-01-03 00:00:00
2. 伊利亚重磅观点:情绪,是人类智能关键要素 伊利亚回归第一句话:别再迷信算力了,人类之所以聪明,是因为有情绪 #Ilya #伊利亚 #OpenAI #AI趋势 #人工智能
抖音 2025-11-27 00:00:00
3. 如果明天算力不再决定胜负,你觉得你手里的哪张牌能赢? #大咖观察 #红衣聊AI #ChatGPT #算力 #AI
抖音 2025-12-02 00:00:00
4. AI在太空觉醒:人类算力正在离开地球 Al在太空“觉醒”:人类算力走出地球!战略级科技计划发布 #人工智能 #太空算力 #超算 #英伟达 #马斯克
抖音 2025-12-01 00:00:00
5. 每天140万亿算力消耗到底藏着什么机会?这场大会可能有答案#移动云智能新空间
抖音 2026-05-04 00:00:00
6. 芯片大咖访谈:英伟达最怕的不是AMD,而是华为,中国是半导体供应链最全的国家#AI #芯片 #半导体 #英伟达 #黄仁勋
抖音 2026-03-09 00:00:00
7. #国产开源大模型下载量破100亿次# 国产开源大模型的走出去的底气都在这里:我过超大规模市场和完整产业链。10 亿 + 互联网用户、海量场景,让 AI 技术能快速落地验证,迭代速度远超海外。政策持续扶持,算力基建跟上,国产算力集群规模全球领先,成本还低,推理成本差不多只有美国的 1/16。再AI安全合规方面,国产大模型更是走在了美国的巨头的前头,本土算力与安全工具链完善,企业能快速搭建合规体系,无需像海外企业那样承担巨额合规支出。
新浪微博 2026-04-27 00:00:00
8. 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度
知乎 2026-02-21 00:00:00
9. 从「模型」到「部署」,如何理解 AI 技术进步背后的基础设施挑战?
微信公众号 2026-03-21 00:00:00
10. H200是英伟达在2023年底发布2024年上市的产品,用的是HBM3e第五代高带宽内存,这次开放入华,主要是进来抢中小规模AI推理(比如百亿参数模型)这个市场的。中国模型开发公司对价格敏感程度更高,更愿意花比较少的钱办大事,所以H200这种产品还是比较有市场的,在商业上跟国产卡比肯定是更好的选择。在万亿参数的大规模AI训练市场,目前企业还是希望能够使用GB200整机系统,单位能耗和美元情况下算力更便宜,但是目前也是受禁的。总体来说,美国开放H200进来的商业意图就是用英伟达卡和CUDA生态绑定中国AI发展,这一点其实对中国AI产业来讲是不可接受的。其实很多中国企业都在想办法走备选方案,需要一点时间但是假以时日肯定是要摆脱英伟达的依赖的。这个东西搞出来对于美国那边AI硬件打击应该是比较大的。因为一旦中国的AI硬件很便宜,做AI应用就能够降维打击了。你比如中美两家做AI应用的公司,产品类似,但是硬件成本相差10倍,你说它这个AI应用还怎么竞争,没有办法竞争了嘛。
新浪微博 2025-12-09 00:00:00
11. 用模型排行榜论输赢?AI竞赛到底在比什么? #大咖观察 #红衣聊AI #AI #大模型
抖音 2025-12-14 00:00:00
12. 算力集群就应该建在太空里;这个世界500强的物流公司,已经从AI受益了#太空算力集群 #AI #云计算 #算力#马斯克 #SpaceX
抖音 2025-12-24 00:00:00
13. 核心AI场景首超英伟达,一场国产算力的“破局叙事”|甲子光年
微信公众号 2026-01-29 00:00:00
14. 虽然 Scaling Law 依然有效,但随着像 o1 这种强化推理模型的出现,计算量正在从“训练端”向“推理端”转移。。所以内存的需求上涨了,推理数据需求上涨了,推理芯片的需求上涨了。。。这都是AI加速产业化的震撼信号,同志们,努力吧,抓紧挣钱。。
新浪微博 2025-12-28 00:00:00
15. 云计算调价潮来袭!腾讯云宣布AI算力服务等涨价5%!
微信公众号 2026-04-09 00:00:00
16. AI最烧钱的战场:数据中心的真实账单【硅谷101】
哔哩哔哩 2025-12-01 00:00:00
17. 给大家说一个新东西:HBF(High Bandwidth Flash,高带宽闪存)。这东西为什么冒出来?一句话——推理太贵了。现在做 AI 的都知道,HBM 是标配。比如 NVIDIA 的 H100、B200 这一类卡,核心旁边堆着 HBM,带宽极高,专门解决“内存喂不饱算力”的问题。没有它,大模型根本跑不动。但问题也很明显:HBM 贵,而且容量上不去。你想在一台机器上多跑几个模型,或者挂一个超大模型,显存很快就顶满,成本更是夸张。于是存储厂商开始推一个新方向:HBF。简单理解,就是把 3D NAND 往“更高带宽、更近封装”方向改造,试图卡在 HBM 和传统 SSD 之间,做一个中间层。现在在积极推动这个方向的,基本都是存储大厂:三星,海力士,镁光,闪迪他们的逻辑也很清晰:未来 AI 不只是训练,而是大规模推理。推理拼的是成本、功耗和容量。如果什么都靠 HBM,容量上不去,而且也来不及生产。所以市场急需一个东西——比 SSD 快很多,但比 HBM 便宜很多。HBF 就是在这个背景下被推到台前的。它不会取代 HBM。HBM 还是算力核心的“心脏”。但在超大规模推理集群、或者端侧模型场景里,确实可能成为一个缓冲层,让更多模型能“装得下、跑得起”。如果说前两年是“拼训练规模”的时代,那么现在明显进入“拼推理成本”的阶段了。这一波如果启动了,模型的推理成本可能大降,以后大家养虾自由就不是梦了。。
新浪微博 2026-03-02 00:00:00
18. 英伟达(NVDA)CEO 黄仁勋直接否认了“AI 泡沫”的说法。“Blackwell 的销量已经爆炸式增长,云端 GPU 也全部售罄。计算需求在训练和推理两端都持续加速、不断复利——每一部分都在指数级成长。我们已经进入了 AI 的良性循环。AI 生态正在快速扩张——更多新的基础模型开发者、更多 AI 创业公司,覆盖更多产业、更多国家。AI 正在无处不在、无所不做、同时发生。”随着传统工作负载迁移到 CUDA,CPU → GPU 的加速计算正在进入临界点生成式 AI 正在重塑超大规模云厂商的商业模式,并带来真实的营收提升Agentic AI 与实体化 AI 在代码、医疗、自主驾驶与机器人领域全面崛起这三个转变首次同时发生,上一次出现这种情况还是摩尔定律早期Nvidia 的架构为 AI 在云端、企业、边缘与机器人等所有阶段提供动力#美股#
新浪微博 2025-11-20 00:00:00
19. #英伟达发布新一代GPU#英伟达Rubin平台全面量产,第三代Transformer引擎加持的Rubin GPU太能打,NVFP4推理算力达50PFLOPS,是前代5倍!还有Alpamayo1开源模型赋能自动驾驶,机器人赛道要彻底起飞了!而且不止GPU!英伟达Rubin全栈平台携Vera CPU、Rubin GPU等六款芯片亮相,推理算力暴涨,2026下半年落地。黄仁勋直言机器人迎ChatGPT时刻,这次真的要颠覆行业了!
新浪微博 2026-01-06 00:00:00
20. 【DeepSeek V4中文能力测评出炉:重回国内第一!】SuperCLUE团队发布DeepSeek V4系列中文大模型测评结果,DeepSeek-V4-Pro凭借综合表现拿下国内第一,Flash版本紧随其后位居第二,国产开源模型再迎突破。本次测评覆盖数学推理、科学推理、代码生成、智能体任务规划、指令遵循、幻觉控制六大维度,Pro版本得分70.98分,Flash版本68.82分,两项成绩均大幅领先国内其他模型。DeepSeek V4系列采用全新注意力机制,全版本支持百万级长上下文,同时降低算力与显存占用,搭配国产芯片使用,整体效率更高。相比上一代 V3.2,两个版本均实现全面提升。Pro版本智能体能力提升超20分,数学推理提升近10分,指令遵循提升近12分,幻觉控制也有明显优化。Flash版本在保持高效推理的同时,智能体与数学推理同样大幅提升,性价比突出。Pro版本(15元/百万Tokens)侧重高性能,幻觉控制更稳,适合复杂任务与专业场景。Flash 版本速度更快、成本更低,API价格仅1.25元每百万Tokens,日常使用更划算。测评同时指出,模型与海外顶尖模型在代码生成、复杂指令执行等方面仍有差距。整体来看,DeepSeek V4凭借均衡能力与亲民成本,站稳国内第一梯队,成为日常办公、开发创作、长文本处理的优质选择。
新浪微博 2026-04-28 00:00:00
21. 黄仁勋可能真的开始疯狂自救了,AI算力的游戏规则变了! 对中国来说,这反而是一个窗口期。#红衣聊AI #黄仁勋 #英伟达 #芯片 #大有学问
抖音 2026-03-18 00:00:00
22. 失控的内存:AI为何被困在“内存墙”中?未来四大技术风口深度解析!
哔哩哔哩 2026-03-10 00:00:00
23. Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力
微信公众号 2026-03-02 00:00:00
24. #寒武纪预计2025年净利润超18亿#寒武纪2025年预盈18.5亿-21.5亿元,同比扭转上年4.52亿元亏损,营收同比增410%-496%至60亿-70亿元,终结连续八年亏损,成为国产AI芯片商业化标杆。其盈利核心源于AI算力需求爆发与国产替代红利,思元590等芯片获字节跳动等头部客户批量采购,55%以上毛利率印证产品竞争力,全栈自研技术适配多场景需求,实现从政企订单向互联网商用的突破。 此次盈利是行业需求与企业技术积累的共振结果,既体现国产AI芯片摆脱“增收不增利”困境,也折射国内算力自主化进程提速。但需客观看待,公司对单一大客户依赖度较高,且全球算力竞争加剧,新一代芯片迭代、产能爬坡及客户多元化布局,仍是盈利持续性关键。寒武纪的拐点,是国产AI芯片的重要突破,却非终局,行业仍需在技术迭代与生态构建中稳步前行。http://t.cn/AXqnlUlY
新浪微博 2026-01-31 00:00:00
25. #微博声浪计划##听见微博# DeepSeek新模型曝光,其新一代旗舰模型V4核心架构MODEL1因GitHub代码更新意外公开。该架构在KV缓存、FP8量化等方面革新,支持百万Token上下文,推理成本仅为GPT-4 Turbo的1/70,预计2026年春节发布,或推动国产大模型效率革命。 铭科技的微博音频
新浪微博 2026-01-22 00:00:00
26. 谷歌第一次把TPU明确拆成了两条线——训练版和推理版。- TPU 8t:专门负责训练大模型- TPU 8i:专门负责推理和大规模部署这事为什么重要?因为现在 AI 基础设施的矛盾已经变了。前两年大家卷的是:能不能把模型训出来。现在更现实的问题是:能不能把模型更便宜地跑起来、服务更多用户。所以谷歌这次不是只说“芯片更强”,而是在告诉市场:AI 芯片正式进入“训练”和“推理”分工时代。直白点说:以前像是一辆车既想拉货又想跑赛道,什么都干,但不够极致。现在谷歌直接分成两种车:- 一种专门拉重货,狠狠干训练- 一种专门跑运营,狠狠干推理成本这背后其实有三个信号:1、谷歌不想再只是“买 GPU 的云厂”它在走的是完整的 AI 全栈路线:- 自研芯片- 自家模型- 自家云- 自家网络- 自家软件栈意思很明确:不想只租英伟达,也想自己定义下一代 AI 基础设施。2、谷歌开始正面卷“推理成本”这次最值得注意的不是训练芯片,而是 TPU 8i。因为现在真正决定 AI 能不能大规模赚钱的,往往不是训练,而是推理。模型能跑,不代表能便宜地跑。能便宜地跑,才有机会真正落地。3、AI 芯片竞争,已经不只是拼单卡参数了谷歌现在卷的是整套系统:- 芯片- 网络- 存储- 调度- 软件框架- 集群扩展能力它甚至直接提到,配合新网络架构和软件栈,训练集群可以扩到百万级 TPU 芯片规模。这说明什么?现在比的不是一颗芯片有多猛,而是谁能把几万、几十万颗芯片高效组织起来。所以,谷歌第八代 TPU 的真正意义不是“又更新了一代”,而是:谷歌正式把 AI 芯片战略,从单一加速器,升级成了“训练 + 推理双路线”的全栈基础设施平台。对英伟达短期当然谈不上颠覆,但对整个行业是个很明显的信号:未来 AI 芯片不会只有一种最优解。训练一套,推理一套,可能会越来越成为主流。
新浪微博 2026-04-23 00:00:00
27. 《The Big LLM Architecture Comparison》 七年来,GPT架构演进虽有细节改进,但核心仍相似。从GPT-2到近期的DeepSeek V3与Llama 4,模型结构变化有限,更多是细节上的优化,如从绝对位置编码到旋转位置编码(RoPE)、多头注意力向分组查询注意力(GQA)转变,以及激活函数由GELU进化为更高效的SwiGLU。 DeepSeek V3(2024末发布)及其推理版本DeepSeek R1(2025年初)引入了两大关键架构创新:多头潜在注意力(MLA)和专家混合(MoE)层。MLA通过压缩键值张量显著节省KV缓存内存,并在性能上超越GQA。MoE则通过稀疏激活少量专家,极大提升模型容量与推理效率,DeepSeek V3拥有6710亿参数,但推理时仅激活37亿,大幅降低推理资源消耗。 非盈利Allen AI的OLMo系列以高透明度著称,虽非性能最强,但其对训练数据和代码的公开为社区提供了宝贵的蓝图。OLMo 2采用Post-Norm(归一化层置于注意力与前馈模块之后)搭配QK-Norm(针对查询和键的归一化),提升训练稳定性,区别于主流的Pre-Norm设计。 谷歌的Gemma系列(尤其是Gemma 3)强调滑动窗口注意力机制,限制每个查询的上下文范围,大幅降低KV缓存内存,用局部注意力替代全局注意力,保持性能几乎不变。Gemma 3还采用了Pre-Norm与Post-Norm混合归一化,兼顾训练稳定性与效率。此外,Gemma 3n针对移动设备进行了优化,利用分层嵌入(PLE)技术降低内存占用,并引入了Matryoshka Transformer结构,实现模型切片灵活部署。 Mistral Small 3.1以较小KV缓存和更少层数提升推理速度,虽舍弃滑动窗口注意力,但性能在多场景优于Gemma 3,凸显宽模型在推理速度上的优势。 Llama 4 Maverick采用MoE架构但激活专家更少且规模更大,整体与DeepSeek V3类似,体现MoE在2025年的流行趋势。 Qwen3系模型涵盖从0.6B到235B参数的密集和MoE版本,兼顾易用性和推理效率。其小型模型适合本地运行,MoE版本激活参数比例低,提升大规模应用的推理性价比。Qwen3 Next在较小规模下引入更多专家和共享专家,并采用混合门控DeltaNet注意力,实现超长上下文支持(262k tokens)和多步预测,提升训练速度和推理效率。 SmolLM3以3B参数提供优异性能,采用NoPE(无显式位置编码)策略,增强对长序列的泛化能力,减少对位置编码的依赖。 Kimi K2体量达到1万亿参数,基于DeepSeek V3架构扩展,采用Muon优化器替代AdamW,训练损失曲线平滑且下降迅速,性能媲美领先私有模型。最新的Thinking版本将上下文扩展至256k tokens,提升推理能力。 OpenAI最新开源的gpt-oss系列(20B和120B)采用类似Qwen3的MoE设计,结合滑动窗口注意力和注意力偏置,架构更宽而较浅,适合高吞吐量推理。其“注意力汇聚”机制(attention sinks)通过头偏置实现长上下文稳定性。 xAI的Grok 2.5作为去年旗舰模型,采用少量大专家,并引入始终激活的共享专家模块,与近期多专家模型设计呼应。 GLM-4.5通过先密集后稀疏的层序设计提高MoE模型稳定性,性能优于Claude 4 Opus,接近OpenAI和xAI的顶尖水平。 MiniMax-M2在保持高性能的同时回归全注意力,摒弃线性注意力的准确性不足问题,采用每层独立QK-Norm,参数激活比例更低,体现稀疏MoE架构的新趋势。 2025年线性注意力迎来复兴,Qwen3-Next和Kimi Linear将轻量级线性注意力与传统全注意力混合,兼顾效率与性能。Kimi Linear通过通道级门控提升长上下文推理能力,在速度和准确性之间取得平衡。 Allen AI最新的Olmo 3在保持透明度的基础上扩展规模,继续采用Post-Norm和滑动窗口注意力,支持64k上下文,表现稳定。 DeepSeek V3.2引入稀疏注意力机制,与Mistral 3大型MoE模型架构相似,后者增加视觉编码器支持多模态,优化推理速度,体现MoE架构的持续进化。 综观2025年旗舰开源大模型,核心仍是Transformer,但细节创新如多头潜在注意力、Mixture-of-Experts、滑动窗口与线性注意力混合、归一化层位置变换等,推动模型在性能和推理效率间取得更优平衡。MoE架构热度持续攀升,模型规模与激活参数数目被巧妙控制,实现大规模知识整合与高效推理。长上下文支持成为新标准,优化训练稳定性和推理速度的技术层出不穷。 未来,架构创新与训练工艺的协同将持续塑造大语言模型的发展路径,开源社区的透明度和多样化探索为行业注入活力。 magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison
新浪微博 2025-12-14 00:00:00
28. 重磅利好!新主线!阿里、腾讯上调 AI 开支预算预算,利好哪些具体?相关概念股核心有哪些?#AI算力行情##AI算力产业# 一、事件核心解读腾讯、阿里集体宣布下半年加大AI资本开支,本质是国内互联网巨头AI基建进入“加速期”,重点利好三大方向:1. 算力基建(服务器/IDC/液冷):最直接受益,巨头扩产带来硬件订单爆发2. 国产AI芯片/算力国产化:腾讯明确“更多国产芯片投入”,阿里力推平头哥生态3. 云服务与AI应用生态:巨头算力扩张后,将带动大模型、行业AI应用落地二、核心利好板块与标的1. 服务器与IDC(最直接受益)• 浪潮信息(000977):腾讯、阿里双巨头核心服务器供应商,为腾讯元宝提供超50%算力,拿下阿里新增机柜50%以上订单,液冷技术领先。• 华勤技术(603296):腾讯云战略级合作伙伴,提供NVL32架构液冷服务器,占腾讯AI服务器订单30%以上;同时适配阿里平头哥芯片服务器。• 数据港(603881):阿里云定制化IDC核心供应商,营收80%以上来自阿里,独家承建张北、河源两大智算中心,承接腾讯元宝约30%推理算力。• 奥飞数据(300738):国内IDC龙头,深度绑定阿里、腾讯数据中心项目,受益算力需求扩容。2. 液冷与电源配套(算力高密化刚需)• 英维克(002837):阿里数据中心液冷方案市占率超40%,腾讯智算中心核心温控供应商,高功率液冷适配高密度AI集群。• 科华数据(002335):腾讯数据中心液冷与微模块核心供应商,获腾讯“最佳绿色算力平台”认证,为混元模型提供算力支撑。• 中恒电气(002364):阿里HVDC电源主供商,适配平头哥AI服务器,受益数据中心电源升级。3. 国产AI芯片与算力国产化• 海光信息(688041):国产DCU芯片龙头,适配腾讯混元模型训练与推理,腾讯明确增加国产芯片使用,订单弹性大。• 寒武纪(688256):思元系列推理芯片适配阿里、腾讯大模型推理场景,与平头哥生态协同推进。• 平头哥生态伙伴:宝德计算机(002236)首批倚天服务器合作方,深度参与阿里AI服务器推广。4. 云服务与AI应用生态• 腾讯生态:金山办公(688111)WPS AI接入混元大模型、微盟集团(02013.HK)企业微信AI应用、腾讯云生态伙伴• 阿里生态:恒生电子(600570)金融AI、税友股份(603171)财税AI、冷芸科技(688309)工业AI等阿里云行业应用伙伴三、一句话总结与重点跟踪核心主线是“算力基建+国产替代”,优先关注!!#金晨 眼泪把面膜冲没了#
新浪微博 2026-05-13 00:00:00
29. 黄仁勋最新访谈(一):AI商业化拐点来了,Anthropic2030年收入可能达到1万亿美元#黄仁勋 #英伟达 #AI #GTC #AI商业化
抖音 2026-03-24 00:00:00
30. 我国太空算力网建设迈入关键阶段,2800 颗卫星将打造全球太空算力底座,这到底是算力格局的彻底颠覆,还是噱头大于实际? 近地轨道建起太空数据中心,十万 P 级推理算力 + 百万 P 级训练算力实现天数天算,零成本太阳能供电、极寒高效散热,看似破解 AI 能源困局,却又无法替代地面能源,这波突破到底有多少含金量? 更被吹为低空经济救星,号称能让个人飞行从概念落地,真能打破低空算力通信瓶颈,实现全民飞行的未来吗?太空算力 VS 地面算力,谁才是未来算力的核心?#微博超有用视频大赛##上微博涨知识##AI创造营##科技先锋官# http://t.cn/AXqHvkEL
新浪微博 2026-01-30 00:00:00
31. 超90万手封板!600666,强势涨停!算力概念,集体爆发!
微信公众号 2026-03-25 00:00:00
32. 黄仁勋喊出“推理拐点”,边缘推理的机会窗口打开了吗
微信公众号 2026-03-26 00:00:00
33. 华为算力概念爆发,相关概念股集体上涨。华为即将发布的AI技术通过软件统一调度异构算力,提升资源利用率,目标降低AI推理成本。产业链核心环节受益,但需警惕估值泡沫与业绩兑现压力。此次突破有望重构算力格局,推动国产AI转向提效率新范式。 http://t.cn/AX2gTfg0
新浪微博 2025-11-18 00:00:00
34. 算力与版权危机,视频AI的“少年烦恼”
微信公众号 2026-03-05 00:00:00
35. 英伟达最新FastDriveCoT!CoT思维链推理加速3-4倍...
微信公众号 2026-02-05 00:00:00
36. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代
抖音 2026-01-09 00:00:00
37. 英伟达很快会反超谷歌TPU,AI模型的竞争格局会在2026年1季度变天#英伟达 #马斯克 #算力 #Gemini3#TPU #GPU #AI模型#算力集群
抖音 2025-12-22 00:00:00
38. #一条音频告别2025##微博声浪计划# 英伟达发布新一代GPU Rubin平台,算力实现跨越式升级,NVFP4推理算力达50 PFLOPS,是前代5倍,训练算力提升3.5倍。平台为全栈硬件生态,集成多款芯片,扩展能力强大。战略转向物理AI,开启机器人与自动驾驶新赛道,2026下半年交付,同时面临市场竞争与地缘政治挑战。#英伟达发布新一代GPU# http://t.cn/AXbJpSJw
新浪微博 2026-01-06 00:00:00
39. #小米发布最新MiMo大模型#小米在2025年12月16日深夜闪电开源了全新MoE大模型MiMo-V2-Flash,凭借3090亿总参数和150亿活跃参数的“瘦身”设计,一举实现150 token/秒的极速响应和百万token输入0.1美元的超低成本,迅速引发行业热议。小米MiMo-V2-Flash的核心突破在于平衡性能与效率。它采用专家混合架构(MoE),每次推理仅激活150亿参数,通过混合注意力机制(128窗口滑动+全局注意力)支持256K长上下文,适用于多轮复杂任务。实测生成速度达150 token/秒,用户反馈“问题发出即出答案”,延迟低至毫秒级,成本仅为闭源模型的1/10。性能上,该模型在多项基准测试中与头部开源模型DeepSeek-V3.2持平甚至超越。技术负责人罗福莉(前DeepSeek核心研究员)的贡献是关键。她主导的自研R3路由重放技术解决了MoE模型强化学习的稳定性问题,确保训练到150步仍保持平稳。#老张聊科技# 小米发布最新mimo大模型
新浪微博 2025-12-17 00:00:00
40. 算力发展的未来趋势
微信公众号 2026-05-08 00:00:00
41. #DeepSeekV4 尺度#V4抛弃了cuda核心。国产芯片与模型改写成功:DeepSeek-V4 在昇腾芯片上完成全流程训练和推理验证核心代码已完成从英伟达 CUDA 架构向华为 CANN 架构的迁移模型在昇腾芯片上的推理速度得到了显著提升。V4-Flash版本的输出定价为每百万token 2元人民币,同期部分海外模型的定高达30 美元,成本差距显著。匹配国产,解构美产,助催美国泡沫破灭。
新浪微博 2026-04-25 00:00:00
42. 5月初权威算力行业专项分析白皮书正式对外发布,精准锚定2026年全球AI算力底层赛道核心变革拐点,算力市场底层逻辑迎来根本性重构。行业重心全面脱离前期高投入、高能耗、重资本的大模型专项训练单一赛道,全域转向低成本、高适配、规模化落地的AI常态化大规模推理刚需场景。伴随全行业AI智能代理(AI Agents)加速渗透千行百业,政企端、产业端、消费端全链路落地节奏提速,企业算力采购布局逻辑同步务实调整,不再盲目扎堆重金迭代全新底座大模型,核心诉求聚焦轻量化部署、低功耗运维、高效能常态化推理落地,压降算力综合使用成本、提升模型全域适配效率成为核心考核指标。产能端供给侧突发结构性失衡,韩国两大头部半导体巨头集中倾斜核心晶圆产能,全力保障AI算力配套高带宽内存(HBM)订单交付,直接挤压通用存储产能空间,导致民用级普通DRAM内存、NAND固态闪存现货供给持续偏紧,供需错配直接拉动5月初全球服务器专用内存现货价格短期异动上行,全链路硬件配套成本小幅波动。供需倒逼产业链快速迭代补位,英伟达、华为等全球头部核心芯片厂商快速响应市场刚需,敲定2026年二季度集中投产上新计划,专项推出深度适配推理场景、功耗优化拉满、并发算力强化的新一代定制化算力架构,精准承接全域推理算力缺口,稳住全产业链算力供给底盘。
新浪微博 2026-05-02 00:00:00
43. AI大模型现在的一个趋势就是从训练全面走向推理。走向推理后,AI真正的赋能生产生活就铺开了。AI这条链上的相关需求都会有新一轮变化目前可以肯定的是,最直接受益的第一梯队:算力芯片 / ASIC + HBM / 高带宽内存 + 高速网络光互联第二梯队:企业级 SSD / NAND、DDR5、服务器、PCB、液冷、电源第三梯队:IDC、储能、电网、边缘AI芯片、端侧设备光模块,光连接件需求会更大,因为推理阶段需要更低延迟,更快连接存储的需求也会不断增大,HBM,DDR5,企业级的SSD,NAND,因为推理不光吃算力,还需要更多的内存来做数据读写训练的本质是用海量算力把模型做出来,推理阶段,每天有海量用户,海量应用,海量API请求,Token消耗巨大。还怎么操作,买哪些题材,懂得都懂图是我的Hermes做的,用的GPT Image 2
新浪微博 2026-05-07 00:00:00
44. 继续 ! 北京时间2026年3月17日14点-14点50分理想基座模型负责人詹锟将在英伟达GTC 2026上介绍理想汽⻋下⼀代⾃动驾驶基础模型MindVLA-o1基于统⼀VLA的Omni 架构,在单⼀Transformer中联合建模感知、推理与控制。模型通过离散Action Tokens与MoE实现⾼效、稳定的精准控制;采⽤快慢双系统推理,在实时性与复杂场景推理间⾃适应切换;并结合基于模型的强化学习闭环与软硬件协同设计,实现可量产、拟⼈化的端到端⾃动驾驶。这套构架应该会完整的部署在M100 的芯片上啦#懒博小课堂##微博新知##具身智能#理想汽车#理想L9#
新浪微博 2026-03-10 00:00:00
45. 自研才是终极底气! #大咖观察 #红衣聊AI #谷歌 #芯片
抖音 2025-12-02 00:00:00
46. 17000 token/s,比B200快48倍!Taalas AI 芯片能否颠覆英伟达GPU?
哔哩哔哩 2026-02-27 00:00:00
47. 谷歌论文,干崩存储?#谷歌 #存储芯片 #Google #Deepseek #AI推理
抖音 2026-03-27 00:00:00
48. #DeepSeek下个王炸是什么# DeepSeek2026年的王炸大概率聚焦长上下文与效率优化的深度融合,继2026年初灰度测试百万token上下文模型后,DeepSeek将完善相关技术,依托mHC流形约束超连接与Engram条件记忆模块,解决长序列计算的内存开销问题,实现100万token下的高准确率推理。DeepSeekV4完整版模型的发布应该也是DeepSeek的一个重要的更新,新模型将结合混合专家架构优化,延续DeepSeek低成本高性能的优势,让中小企业也能便捷接入顶尖AI能力。推动开发者共建垂直场景应用;贴合2026年AI从会生成向会行动的进化趋势。#HOW I AI#
新浪微博 2026-02-15 00:00:00
49. 算电协同:底层逻辑全解析+核心赛道龙头梳理AI算力爆发式增长,电力供需矛盾凸显,算电协同成为数字经济与新型电力系统融合的核心方向。本文通俗拆解底层逻辑,梳理产业链核心赛道与头部企业,不构成投资建议,仅作行业科普。算电协同的本质是算力与电力双向赋能、时空动态匹配,核心逻辑为“电支撑算、算优化电”。过去是“电跟算走”,算力中心刚性用电;现在通过智能调度、虚拟电厂、源网荷储算一体化,让算力成为柔性负荷,低谷多算、高峰错峰,既保障算力稳定运行,又提升绿电消纳、降低电网压力,同步实现降本与减碳。从技术架构看,算电协同覆盖三大环节:电网智能调度是“大脑”,负责统筹算力与电力匹配;绿电与储能是“底座”,提供清洁稳定能源;算力供电与节能是“终端”,优化数据中心能效。三大环节协同,构成完整产业闭环。产业链核心赛道与头部企业(仅按业务属性分类,非荐股):1. 电网调度龙头:深耕电力AI调度、虚拟电厂,技术壁垒高,是算电协同核心中枢。2. 绿电+算力一体化企业:布局西部算力枢纽,依托绿电直供优势,打造源网荷储算样板。3. 供电与节能解决方案商:专注IDC电源、液冷温控,助力数据中心降低PUE,提升能效。4. 输变电装备龙头:支撑特高压与电网升级,保障跨区域算力电力调配。算电协同是政策支持、产业刚需的新基建方向,长期受益于AI发展与双碳目标。理解其底层逻辑,才能看清产业趋势。投资需结合自身研究,谨慎决策,本文仅为行业知识分享。
新浪微博 2026-04-06 00:00:00
50. 独家|聚焦大模型推理,水下AI芯片公司斩获10亿元Pre-A轮融资
微信公众号 2026-03-09 00:00:00
51. 78ms的VLA推理!浪潮信息开源自驾加速计算框架,大幅降低推理时延
微信公众号 2026-01-05 00:00:00
52. #乔任梁父母被亲戚劝做试管婴儿# 阿里千问登顶全球!算力产业链谁才是真正的“隐形王者”?4月4日,一则重磅消息引爆全球AI大模型领域:发布仅1天的阿里千问Qwen3.6-Plus,强势冲上全球知名大模型API调用平台OpenRouter的日榜榜首,单日调用量突破1.4万亿Token,创下该平台历史纪录。这一耀眼成绩,不仅是阿里大模型的里程碑,更是整个阿里算力产业链的“冲锋号”。当大模型的算力需求呈指数级爆发,究竟谁能真正握住阿里算力生态的核心命脉,成为那匹隐藏在幕后的“隐形王者”?千问登顶背后,是算力产业链的集体狂欢Qwen3.6-Plus的火速爆火,绝非单一产品的偶然成功,而是全球企业级AI市场需求全面觉醒的必然结果。开发者用实际行动投票的背后,是阿里算力生态全链条、无短板的硬核支撑。从数据中心的底层基建布局,到AI芯片、服务器、液冷温控等核心硬件研发,再到垂直行业解决方案的落地应用,产业链每一环都在这场空前的算力竞赛中迎来爆发式增长机遇。在算力基建层面,阿里云正全速推进“东数西算”国家战略布局,京津冀枢纽张家口集群算力基础设施建设进入加速期。亚康股份作为该项目核心运维服务商,深度参与集群从建设、运营到维护的全生命周期管理,直接承接算力需求爆发带来的业务增量,充分享受行业红利。与此同时,杭钢股份与阿里联手斥资158亿元打造的浙江云计算数据中心,作为浙江省新基建标志性重点工程,规划承载20万台服务器运行,是阿里千问大模型的核心算力底座。该项目全面落地后,将直接带动数据港、润建股份等核心生态合作伙伴的业务规模跨越式增长,形成算力基建的产业集群效应。在硬件技术层面,随着大模型算力密度持续提升,传统风冷已无法满足需求,阿里在液冷温控技术上的迭代升级成为关键。高澜股份、申菱环境、英维克等液冷温控头部企业,凭借领先的浸没式液冷技术,成为阿里数据中心核心供应商。其技术可将数据中心PUE值降至1.08以下,大幅降低算力运行能耗与成本,为千问大模型7×24小时高负载稳定运行提供坚实保障,这一技术也顺势成为全球超算数据中心建设的核心发展趋势。产业链核心标的,谁能吃到最大红利?从阿里算力生态产业链图谱来看,核心受益企业已形成清晰的梯队布局,不同环节的龙头企业凭借技术、合作壁垒,抢占AI算力时代的最大红利。第一梯队:算力基建核心载体这一梯队是阿里算力扩张的根基,直接承接大模型算力需求,属于产业链最核心环节。数据港作为阿里云全球20个数据中心的核心运营合作伙伴,深度绑定阿里算力布局,是千问大模型算力需求的直接承接方。杭钢股份依托浙江云计算数据中心项目,成为阿里本土算力基建的核心载体,手握稀缺的数据中心资源。润建股份则凭借“中国-东盟智算云”项目,切入阿里海外算力布局体系,成为其AI算力生态海外扩张的战略伙伴,抢占跨境算力市场先机。第二梯队:硬件技术隐形基石硬件是算力运行的核心支撑,该梯队企业掌握关键技术,是算力基建的“隐形脊梁”。华塑科技、依米康、中恒电气等企业,为阿里数据中心提供电源、空调、HVDC等核心硬件,保障算力系统高效运转。海光信息、芯源股份等国产芯片龙头,为千问大模型提供自主可控的算力芯片,打破海外技术垄断,筑牢国产AI算力的技术安全防线。浪潮信息、中科曙光等头部厂商,凭借成熟的产品体系和产能优势,成为阿里算力硬件供应的核心支柱,支撑大模型海量运算需求。第三梯队:行业落地商业化标杆大模型的价值最终体现在商业化落地,该梯队企业打通技术与场景,实现AI价值变现。恒生电子作为国内金融IT领域绝对龙头,率先将阿里千问大模型深度接入金融核心系统,推动AI技术在智能投研、风险管控、客户服务等金融场景的全流程应用,打造大模型商业化落地的标杆案例,为千问大模型在更多垂直行业的复制推广奠定基础。风险提示与投资思考尽管阿里算力产业链前景广阔,但投资者仍需保持理性,警惕潜在市场风险。当前,算力产业链相关标的普遍迎来大幅上涨,部分个股短期涨幅过大,估值已攀升至历史高位区间,存在阶段性回调的风险。同时,大模型商业化落地进度不及预期、下游算力需求增长放缓、行业同质化竞争加剧等因素,都可能对相关企业的业绩兑现产生直接影响。阿里千问的登顶,不是终点,而是AI算力时代的起点。当大模型成为企业数字化转型的核心引擎,算力产业链的每一个环节,都将迎来前所未有的增长机遇。唯有真正深度绑定阿里生态、拥有核心技术壁垒的企业,才能在这场算力竞赛中笑到最后,成为算力产业链中真正的“隐形王者”。未来,随着阿里算力生态持续完善、千问大模型技术不断迭代,产业链的价值分化将进一步加剧,具备核心竞争力的企业,终将收获AI时代的长期成长红利。
新浪微博 2026-04-06 00:00:00
53. #DeepSeek新模型有多猛# DeepSeek V3.1发布,6850亿参数量仅激活370亿,计算成本降90%。性能超GPT-4o,中文问答准度89.3%。岚图汽车、江苏银行已应用,未来将突破多模态,推理成本再降50%。#微博声浪计划##听见微博# 凯文思考的微博音频
新浪微博 2025-11-28 00:00:00
54. #微博声浪计划##听见微博# 截至2026年3月底,我国智能算力规模达1882EFLOPS,占全球总量52%,超越美国居首。国产芯片驱动超60%智能算力,液冷技术降低能耗,“东数西算”推动算力向西部转移。AI模型调用量增长显著,但高端芯片传输速度待提升,未来算力需求将再增百倍。 种斌Marco的微博音频
新浪微博 2026-04-26 00:00:00
55. #英伟达发布新一代GPU# 英伟达CEO黄仁勋CES上带来了最新的Rubin平台,将芯片的竞争直接带入系统层面。GPU推理算力是Blackwell的5倍,推理成本降低90%。 Rubin平台的发布直接降低大模型落地门槛,今年AI行业要迎来全面爆发了。
新浪微博 2026-01-06 00:00:00
56. #用声音马住中国年##微博声浪计划# 千问3.5成本仅为谷歌大模型5%!除夕夜阿里开源发布Qwen3.5-Plus,架构革新让推理成本大降,API价仅谷歌1/18。春节期间生成1.2亿AI订单,156万老人首用AI服务,多模态能力覆盖办公、创作等场景,推动AI技术平权落地。 晓春哥XCG的微博音频
新浪微博 2026-02-17 00:00:00
57. 算力王冠易主! #零距离看懂财经 #2026经济风向标 #财经 #芯片
抖音 2026-01-22 00:00:00
58. #千问Qwen3.5大模型发布#千问 Qwen3.5 是采用极致稀疏 MoE 架构在保持超强性能的同时,显存占用降低 60%,推理效率大幅提升,部署成本显著下降。模型支持最高 256K 超长上下文,让长文本处理变的更加的轻松有效率了!原生多模态统一也是Qwen3.5的特点之一,也是目前国内外大模型的发展的主要趋势,模型在图文、视频理解能力全面升级,精准解析图表、文档与复杂视觉内容。实现了一个入口实现多种属性。Qwen3.5对于中小企业特别友好, 很大程度上降低了企业运营成本,可以让中小企业得到高效、普惠、全能的运营工具。不再因为高昂的费用而排斥企业去追逐AI。#过个有AI年##HOW I AI#
新浪微博 2026-02-16 00:00:00
59. 【推理效率狂飙19倍!#千问3.5成本仅为谷歌大模型5%#】千问3.5凭什么做到成本仅为谷歌的1/18?答案是底层架构的全面革新。全新MoE架构,3970亿参数仅激活170亿,推理吞吐量最高提升19倍,部署显存降低60%。技术上的“斤斤计较”,才有了价格上的“大大方方”。#有AI的春节有什么不一样# 引力科普的微博视频
新浪微博 2026-02-16 00:00:00
60. 谷歌一篇论文引爆存储芯片崩盘!AI内存需求暴降6倍,推理狂飙8倍
知乎 2026-03-26 00:00:00
61. 推理需求暴增,SRAM 如何解决 GPU 不够用的问题?
微信公众号 2026-05-10 00:00:00
62. 【#存储芯片板块暴跌原因#】 3月26日,谷歌研究院一篇关于AI内存压缩技术TurboQuant的论文,引发全球存储芯片板块暴跌。A股方面,恒烁股份、兆易创新、佰维存储等多只存储股跌幅超5%;美股闪迪、西部数据、美光科技等也大幅下挫,市场出现恐慌性抛售。 TurboQuant是针对大模型推理中键值缓存的压缩算法,可在几乎不损失精度的前提下,将缓存内存占用压缩至原来的六分之一,并在GPU上实现最高8倍性能加速。资本市场担心,内存效率大幅提升会显著降低对DRAM、HBM等存储硬件的需求,从而冲击行业景气度。 不过多家机构认为市场存在明显误读。该技术仅优化推理环节的缓存,不影响模型训练与高带宽内存需求;所谓8倍性能提升,是与较旧的32位模型对比,实际提升幅度被夸大。此外,该技术目前仅在部分开源模型上验证,通用性仍待观察,类似优化思路国内外早已出现。 从长期看,此次事件更符合“杰文斯悖论”:效率提升会降低AI使用成本,反而刺激更多应用场景落地,带动整体算力与存储需求扩大。2026年服务器内存需求仍将高速增长,技术优化带来的影响大概率被行业增长所消化。此次大跌更多是短期情绪与资金避险所致,并不改变存储芯片长期需求逻辑。#安全配置不能从夯到拉##生命安全不分高低配#
新浪微博 2026-03-27 00:00:00
63. 【#英伟达中国份额降至0# 国产芯片、存储集体暴涨:海光、寒武纪等创历史新高】美国芯片管制让英伟达在中国市场份额降直接从66%锐减至0%,而国产芯片也因此受益。在上述消息影响下,国产芯片集体出现了暴涨。今日早盘,科创50指数持续走强,盘中拉升涨超8%,海光信息、寒武纪、澜起科技、佰维存储、中芯国际、华虹公司、中微公司等权重股大幅走强。其中,寒武纪大涨超13%,最新股价报1933.22元/股,而海光信息直接20%涨停,股价双双创新高。按照行业人士的说法,随着国产芯片被中国互联网厂商更广泛的使用,相应的市场份额和营收还会有更大的提醒,以此带来的利润也是可期。更重要的是,国产芯片配合国产AI大模型,形成的国产AI闭环才是最重要的。
新浪微博 2026-05-06 00:00:00
64. 推理成本爆炸,TPU 正在全面反超 GPU
小红书 2025-12-02 00:00:00
65. 大模型成熟=算力需求见顶?算力需求扩张仍有巨大空间
微信公众号 2026-04-02 00:00:00
66. 大模型推理优化关键技术及应用实践研究报告(2026年)
知乎 2026-05-05 00:00:00
67. LLM的训练与推理
微信公众号 2026-04-02 00:00:00
68. 词元单价狂降背后,总推理成本或将不降反升
微信公众号 2026-03-29 00:00:00
69. Gartner预测,到2030年,生成式AI提供商对1万亿参数的大语言模型的推理成本将较2025年降低超过90%
微信公众号 2026-04-18 00:00:00
70. AI泡沫的致命短板!推理成本高昂,数千亿投入难回本
今日头条 2025-12-06 00:00:00
71. 大模型推理优化深度解析
微信公众号 2026-05-08 00:00:00
72. 信建投
微信公众号 2026-04-29 00:00:00
73. 全球AI需求激增刺激产品涨价 机构称算力需求仍有望进一步上行
今日头条 2026-03-18 00:00:00
74. Token调用量大爆发,AI云成了一门好生意
微信公众号 2026-04-01 00:00:00
75. 云服务器代理商
今日头条 2026-05-07 00:00:00
76. 红包大战正酣,算力租赁赚翻?这家厂商全线产品涨价,需求已转为“训练+推理”双轮驱动
今日头条 2026-02-13 00:00:00
77. 推理算力为什么是AI未来需求的爆发点?
今日头条 2026-02-25 00:00:00
78. AI算力
今日头条 2025-12-20 00:00:00
79. 122亿元订单背后
今日头条
80. AI算力需求转向推理主导
今日头条
81. 摩根士丹利
微信公众号
82. 计算机行业AIDC与算力租赁专题
微信公众号
83. 推理拐点已至
微信公众号
84. 一文读懂AI推理工作负载
微信公众号
85. Open AI报告新发现
微信公众号
86. 推理成本暴跌280倍,但大多数企业仍然"用不好"AI——问题出在哪?
知乎
87. AI正在换一种落地方式
微信公众号
88. 告别“云延迟”
微信公众号
89. AI 算力革命下半场
微信公众号 2026-04-03 00:00:00
90. 机构
今日头条 2026-04-21 00:00:00
91. 全球 AI Token 调用量爆发,算力需求持续高增
微信公众号 2026-03-25 00:00:00
92. 中国AI日均调用140万亿Token,两年增长1400倍意味着什么?
今日头条 2026-05-01 00:00:00
93. 全球AI大模型Token调用量逆转
微信公众号 2026-04-22 00:00:00
94. 推理成本暴涨 15 倍!大模型规模化落地的核心密码,都在这份信通院 2026 重磅报告里
知乎 2026-05-03 00:00:00
95. 中国信通院人工智能所联合发布《大模型推理优化关键技术及应用实践研究报告(2026年)》
微信公众号 2026-05-08 00:00:00
96. 信通院
微信公众号 2026-04-17 00:00:00
97. 《大模型推理优化关键技术及应用实践研究报告(2026年)》
微信公众号 2026-04-21 00:00:00
98. DeepSeek MoE背后隐藏的硬核真相
微信公众号
99. 大模型架构革命
今日头条
100. LLM本地部署进阶篇
微信公众号
101. 【大模型】DeepSeek V4震撼发布
微信公众号
102. 推理慢吞吞,费用又烫手?DeepSeek和Kimi找到一套省钱解法了
今日头条
103. 99% 稀疏化
知乎
104. 推理算力需求爆发 七牛智能卡位AI Cloud或迎量价双增
腾讯网
105. 中信建投:在深度推理阶段 模型的未来算力需求依然会呈现爆发式上涨
https://www.nbd.com.cn/articles/2025-02-05/3741062.html
106. Token爆发 AI算力全链涨价 开启“能效竞争”时代
http://scitech.ce.cn/sy/zx/202604/t20260416_2908839.shtml
107. 机构:预计算力需求保持高景气度
网易
108. “算力银行”“算力超市”要来了
https://www.qxn.gov.cn/zwgk/zfjg/zdsjfzglj/bmxxgkml/gzdt/202604/t20260424_90043613.html
109. DeepSeek火到“宕机”!AI算力价值得到确认?
腾讯网
110. 当推理成本降到原来的1/100,AI产品还能怎么活?
回复小菠菜
111. 算力供给、需求迎关键信号 | 投研报告
中国能源网
112. OpenAI o3 AI模型突破推理极限背后:成本飙升,没“钞能力”用不起
TMT观察网
113. 摩根士丹利:市场可能严重低估AI爆发力 算力与电力需求缺口持续扩大
腾讯网
114. AI 推理成本高居不下,如何突破算力垄断?
CSDN
115. 全球科研团队竞逐低成本AI模型研发新范式
新华社
116. “AI算力荒”解困的短、中、长策
人人都是产品经理
117. AI 推理模型的兴起使基准测试成本大幅提升
腾讯网
118. AI交互成本高,用户时间被消耗值吗?
今日头条
119. AI推理计算的可能终局:存算一体芯片!
腾讯网
120. 2026年算力供需分析
121. AI算力需求场景主要那些?有海量GPU算力需求的行业和企业主要有哪些?
知乎
122. Agent(智能体)与大模型爆发,Token消耗呈指数级井喷:国家数据局及相关平台数据显示,2026年3-4月间,国内日均Token调用量突破140万亿,两年内暴增千倍。特别是以“龙虾(OpenClaw)"为代表的Agent复杂智能体广泛应用,其执行复杂推理任务所需消耗的Token是传统对话的数十甚至上百倍。推理端算力需求正面临量级的极速放大,直接驱动算力建设逻辑从“云端训练”向“训练+推理"双轮驱动全面升级。 #算力 #股票#财经#每日分享#每日热点
抖音 2026-04-09 00:00:00
123. 推理芯片:AI普及的关键钥匙,成本决胜未来
微信公众号 2026-02-11 00:00:00
124. 大模型训练和推理哪个更重要
今日头条 2026-03-28 00:00:00
125. AI真正的爆发,不在训练,而在“被使用的成本”
微信公众号 2026-04-28 00:00:00
126. 2026 大模型推理加速技术全景图:200+ 论文 10 大方向
微信公众号 2026-04-28 00:00:00
127. AI计算迎来重大变革,英伟达押注的“推理”是什么?
今日头条 2026-03-17 00:00:00
128. 现在还觉得存储不重要的人,基本没看懂AI推理到底在烧什么成本,因为训练是阶段性的热闹,推理是每天都在发生的日常,推理一上规模,最先被吃光的不是算力,是数据通道和存储带宽,模型要频繁加载、KV cache 要常驻、数据要不停读写,最后企业发现自己买了再多GPU,喂不上数据也没用,所以存储这条原本被当成周期垃圾的赛道,突然变成了硬需求,不是因为故事讲得更好听,而是因为它真的开始卡脖子了,这就是为什么去年到现在你看到部分存储相关资产能走出倍数级涨幅,背后不是情绪,是订单和产能在重新分配。存储需求为什么会暴增到5到10倍,因为推理不是一次性算完就结束,它是持续调用,企业把AI接到搜索、客服、办公、内容、风控、研发之后,每天的请求量会把数据读写量推到以前没见过的水平,尤其是高带宽内存这类关键环节,会把整个供给链条拉紧,而供给这件事短期根本跟不上,扩产不是加几台机器就行,从设备到良率到封装到认证,真正能形成稳定新增产能通常按年算,所以你会看到一个非常现实的现象,2026年的部分产能已经被提前锁定,买方要么提前签长期单,要么接受更贵的现货价,市场从买方市场翻成卖方市场,这种变化对行业最直接的意义就是定价权回来了,谁手里有产能谁说话,谁能交货谁就能谈条件。再往下说公司层面,三星、美光、海力士这三家本质上在吃同一条AI产业链的硬订单,区别不在于故事,而在于各自的产能结构、客户结构和产品,市场上有人会拿估值说事,说三星前瞻市盈率更低更有性价比,美光和海力士相对便宜,这些说法我不直接下结论,因为估值便宜这件事本身没有意义,只有当它叠加了订单可见性、产能可兑现性、以及价格上行的持续性,才会变成机会,换句话说我们真正要盯的不是谁便宜,是谁能把供给交出来,谁能把价格守住。你说这轮是不是超级周期,我反而觉得不需要争论这个词,短期确定性已经足够强了,因为只要供给补不上,价格就容易有支撑,只要价格有支撑,上游利润就会变厚,这种环境下哪怕不是十年大周期,三到六个月的交易窗口也有机会,但前提是我们别把它当成永远涨,它依然是周期行业,只是周期的驱动从传统消费电子库存,切换到了AI推理带来的结构性需求。把视角放到产业链更关键的一层,你会发现现在市场在重新奖惩不同类型公司,产能为王这个阶段,最容易被重估的是上游有硬产能的环节,存储本体、代工、关键设备、先进封装这些,因为它们决定交期,决定谁能出货,决定谁能拿到高毛利订单。而轻资产的设计公司,讲得再漂亮也要面对一个现实,上游如果紧张,它的出货节奏和收入确认就会被卡住,市场会开始对它的估值更苛刻,甚至出现你说的那种杀估值,不是它不优秀,是它没有产能主导权。至于国内的长江存储、长鑫存储,我更愿意用一个不刺激但更真实的判断,它们对国内自给率和产业安全很重要,但在短期全球供需里影响更像是补缺口而不是改价格中枢,你说只能满足10%需求这类说法,本质是在强调它们现在还不足以改变全球三大厂的定价逻辑,所以我们在做全球市场判断时,还是得把重点放在三星、美光、海力士这些能左右供给结构的玩家身上。最后我要提醒一个更容易被忽略的风险点,存储的行情最怕的不是需求没了,而是下游应用端突然算不过账,如果AI应用的盈利能力跟不上成本,客户会延后扩容,会降规格,会优化架构,这会让需求增速放缓,另外技术变革也会带来变量,比如架构调整、缓存策略变化、以及替代方案成熟,都可能改变单位需求的消耗速度,所以我们在做这条线时要盯住两个现实信号,下游的钱还愿不愿意继续砸,上游的扩产什么时候真正变成可交付的新增供给,只要这两件事没有出现明显拐点,存储从垃圾赛道变成高需求赛道这条主线就还在
抖音 2026-03-06 00:00:00
129. 大模型背后的能源真相!推理阶段才是真的电老虎! 模型部署后的推理阶段才是长期电力消耗主体。 以ChatGPT为例,日均处理250亿次查询,每次GPT-4推理耗电约0.3瓦时,日耗电量高达750兆瓦时(MWh),90天累计达67吉瓦时,已超过训练总能耗。 全球AI数据中心2023年耗电176太瓦时,占美国总用电量4.4%,预计2030年将升至8%-10%。考虑数据中心PUE(电源使用效率)约1.2,实际用电进一步增加,若计入散热与辅助设施,真实能耗已逼近210太瓦时。 2024至2025年,随着大模型推理需求爆发式增长和算力集群规模化部署,全球AI年耗电量增速已连续两年超过算力增长,能源约束正从幕后走向台前,成为制约AI发展的关键瓶颈。#核电站
抖音 2026-01-11 00:00:00
130. 智能体全面爆发!多模态长期推理双重加持,AI算力再上一个量级
今日头条 2026-04-17 00:00:00
131. “算力慌”引爆涨价潮:阿里腾讯最高涨50%,H100租赁飙升40%,算力成主线?
微信公众号 2026-04-16 00:00:00
132. 云服务百年变局:AI推理需求引爆全球云涨价潮,定价逻辑彻底重塑!
微信公众号 2026-01-28 00:00:00
133. 精疲力尽的巨人:当大语言模型变得“又慢又贵”,AI算力如何破局提效?
知乎 2026-02-25 00:00:00
134. 推理成本直降75%!英伟达新研究:LLM学会“长话短说”,数学能力还不减
微信公众号 2025-11-27 00:00:00
135. 混合专家模型(MoE)架构:如何实现推理成本降低60%,吞吐量提升19倍的技术突破
微信公众号 2026-03-02 00:00:00
136. AI涨价400%!如何把Token花在刀刃上?
微信公众号 2026-04-09 00:00:00
137. 2026算力新局:推理算力为何正在碾压训练算力
知乎 2026-04-14 00:00:00
138. AI 从训练到推理:为什么 2026 是成本为核心的"落地年"?
微信公众号 2026-04-03 00:00:00
139. LLM推理加速:从180ms到45ms的优化实录
微信公众号 2026-04-23 00:00:00
140. 全球 AI 格局迎来巨变,ChatGPT 带动算力需求从训练转向推理。推理场景极致压缩成本,Kimi、MiniMax 等国产大模型性能拉满,性价比远超海外模型。国产芯片训练稍弱,但推理能力成熟,依托东南亚混合算力组网实现错位超车。国内大厂以云养模内卷严重,独立 AI 企业举步维艰,出海成为核心破局路径。AI 产业来到关键十字路口,国产大模型 + 芯片出海,将重塑全球科技竞争新秩序。 #AI算力 #大模型 #国产芯片 #科技产业 #AI出海
抖音 2026-04-29 00:00:00
141. LLM推理时计算技术详解:四种提升大模型推理能力的方法
知乎 2026-02-06 00:00:00
142. 推理成本优化合集(初学版)
微信公众号 2026-01-19 00:00:00
143. 从训练到推理:大模型算力需求的新拐点已至
微信公众号 2026-02-05 00:00:00
144. AI科普-AI算力服务器训练与推理成本拆解分析
微信公众号 2026-05-11 00:00:00
145. AI算力市场需求分析
微信公众号 2026-03-24 00:00:00
146. 英伟达 Blackwell 架构与开源协同,推动 AI 推理成本降低 10 倍
今日头条 2026-02-14 00:00:00
147. AI推理成本将降低90%!Gartner预测2030年AI时代真的来了
今日头条 2026-04-01 00:00:00
148. 信通院重磅报告:大模型推理优化关键技术及应用实践(2026年)
微信公众号 2026-04-20 00:00:00
149. AI推理成本大揭秘:一次对话到底花多少钱?
微信公众号 2026-05-07 00:00:00
150. Gartner重磅预测:2030年AI推理成本暴降90%,普通人用上「万亿参数大脑」不是梦
微信公众号 2026-04-07 00:00:00
151. 算力租赁:供需失衡持续加剧,商业模式升级打开成长天花板
微信公众号 2026-04-10 00:00:00
152. 大模型推理成本与优化技术全景解析:从显存估算到Continuous Batching
知乎 2026-02-22 00:00:00
153. AIIA全会 | 大模型推理优化技术与产业观察发布
微信公众号 2026-04-14 00:00:00
154. 大模型推理成本与优化技术全景解析
今日头条 2026-02-22 00:00:00
155. 专注推理,放弃训练!一家中国GPU公司要差异化突围
今日头条 2026-02-02 00:00:00
156. 全球AI算力大逆转:中国Token调用量暴跌,美国时隔两月重新登顶
今日头条 2026-04-22 00:00:00
157. 2026 推理优化全景报告 ,技术演进与产业落地双轮驱动(65页报告)
微信公众号 2026-04-20 00:00:00
158. 从训练集群到推理微调,互盟智算中心如何成为大模型Token高效流转的一站式算力基座
微信公众号 2026-04-11 00:00:00
159. 高通AI芯片让推理成本暴降70%,中小企业真能玩转大模型了?
今日头条 2026-03-23 00:00:00
160. 大模型部署全景:从训练到推理的系统架构与算力优化(含企业实践方案)
微信公众号 2026-03-25 00:00:00
161. 2026年大模型推理优化关键技术及应用实践研究报告(附下载)
微信公众号 2026-04-17 00:00:00
162. AI部署成本飙升?这五大王牌手段让你的模型推理又快又省
微信公众号 2025-12-10 00:00:00
163. AI 推理成本失控,CIO如何自救
微信公众号 2026-04-29 00:00:00
164. 推理成本太高、算力不够用?单纯堆卡没用,得靠极致的“压缩”与“调度” | AICon
今日头条 2025-12-16 00:00:00
165. Tokens 提效降本!神州鲲泰×趋境科技推出大模型推理智能算力调度解决方案
微信公众号 2026-03-25 00:00:00
166. AI 推理需求增长之后:六层产业链定价完成度与预期差扫描
知乎 2026-05-07 00:00:00
167. 大模型推理成本优化:30天,成本降了80%的真实故事
今日头条 2026-03-26 00:00:00
168. 大模型训练芯片 vs 推理芯片 想搞懂 AI 芯片,必须分清训练和推理。训练芯片算力超强、精度极高,专门用来从零训练大模型,功耗大、成本高。推理芯片主打低延迟、高吞吐,负责模型上线后实时响应、跑业务,更注重性价比和部署效率。简单说:一个造模型,一个用模型,分工完全不同。#AI芯片 #行业大揭秘 #AI前沿应用研习社
抖音 2026-02-22 00:00:00
169. 一文搞懂不同类型的AI应用场景,算力成本消耗差多少?
微信公众号 2026-04-26 00:00:00
170. 会议核心指出,AI 大模型 token 需求爆发是本轮云服务涨价的核心驱动力,DeepSeek 等应用引爆算力需求,阿里云、腾讯云、百度云等巨头已轮番涨价,该趋势仍将持续。会议明确 AI 云 IAAS 核心由 AIDC、算力租赁、CDN 三大方向构成,英伟达 token 工厂经济学、阿里 token 事业部成立,印证产业向 token 化变现转型,同时梳理出液冷、算力芯片、光通信等配套环节的投资机会,提示相关板块的涨价弹性与布局窗口。#AI大模型 #算力 #液冷 #股民交流 #AI应用
抖音 2026-03-20 00:00:00
171. 【重磅发布】2026版中国AI推理芯片行业市场现状分析及投资前景研究报告
微信公众号 2026-03-16 00:00:00
172. 成本骤降86% AI推理云实测 边缘算力格局生变?
今日头条 2026-01-21 00:00:00
173. LPU:新一代大模型推理专用芯片,量产初期开启成长新周期
微信公众号 2026-03-16 00:00:00
174. 历史性拐点!55%算力烧在「用AI」而非「造AI」 你的AI电费时代来了
微信公众号 2026-04-24 00:00:00
175. 稀疏权重推理优化简介
小红书 2026-03-12 00:00:00
176. 2026年大模型推理加速新趋势:从500ms到80ms的完整优化路径
知乎 2026-04-05 00:00:00
177. 云计算行业深度报告:定价周期迎来历史性反转,AI算力需求爆发驱动行业价值重估
微信公众号 2026-04-03 00:00:00
178. Mixture-of-Experts推理优化新方案:解锁大模型边缘部署新路径
微信公众号 2026-04-22 00:00:00
179. 2026年AI大模型推理优化深度拆解:从原理到落地,架构师必看的实战指南
微信公众号 2026-03-05 00:00:00
180. NVIDIA重磅开源Nemotron 3 Super!120B混合Mamba-MoE架构,推理速度飙升7.5倍!
微信公众号 2026-05-04 00:00:00
181. 专家预取加速:MoE模型推理效率新突破
小红书 2026-03-29 00:00:00
182. 会议纪要 | 地大(北京)王玉柱:破局大模型“算力瓶颈”——面向深地金矿的高效分布式训练与推理加速之道
微信公众号 2026-04-27 00:00:00
已收藏
去我的收藏夹