AI Agent推理速度慢,是注意力机制过时了吗?

源自142位全网作者

05-22 14:55

内容由AI生成

精选参考来源

1. DeepSeek做大→Mega MoE,Tri Dao团队加快→SonicMoE

2. DeepSeek新论文来了!联手清华、北大,优化智能体大模型推理

3. #千问Qwen3.5大模型发布#真正的卷王出现了,就在刚刚,阿里正式发布全新一代大模型千问Qwen3.5-Plus。这次核心更新在于采用了Mamba混合注意力机制(SSM-Transformer) + 稀疏MoE架构,总参数3970亿但仅激活170亿参数,显存占用降低60%,推理吞吐量最高提升19倍。举个例子,传统大模型就像人工翻整墙档案,你每问一个新问题,都要把前面所有档案重新翻一遍核对关系,内容越长,翻得越慢,越到后面越卡。 纯Mamba机制则像只记档案摘要,翻得极快,但细节容易丢,关键信息可能漏看。 而Qwen3.5-Plus的混合注意力,就是摘要+精准抽查一起上:速度跟得上,细节不丢失,长文本、复杂推理又快又准。 这才是真·技术内卷,大模型体验又要上一个台阶了。#how i ai##过个有ai年# 千问qwen3.5大模型发布

4. #DeepSeek新架构意味着什么#DeepSeek Model 1架构聚焦效率突破,通过KV缓存压缩、稀疏性处理与FP8解码组合,将显存占用直接砍半,推理速度提升30%,搭配Engram记忆机制与VVPA技术,长文本处理精度与效率双优,在16K token语境中仍能精准捕捉关键信息。DeepSeek Model 1架构也意味着国内的大模型也开始摆脱堆参数依赖,转向架构优化与硬件适配的高效路线。DeepSeek Model 1架构证明低成本、高性能可并行实现,有利于行业从性能追赶转向范式创新。Model 1作为DeepSeek V4的工程版,同步适配英伟达新芯片与国产昇腾芯片,强化了技术兼容性。其开源基因与效率优势,将吸引更多开发者与企业接入,进一步巩固DeepSeek在开源社区与产业应用中的影响力。

5. #小米发布最新MiMo大模型#小米在2025年12月16日深夜闪电开源了全新MoE大模型MiMo-V2-Flash,凭借3090亿总参数和150亿活跃参数的“瘦身”设计,一举实现150 token/秒的极速响应和百万token输入0.1美元的超低成本,迅速引发行业热议。小米MiMo-V2-Flash的核心突破在于平衡性能与效率。它采用专家混合架构(MoE),每次推理仅激活150亿参数,通过混合注意力机制(128窗口滑动+全局注意力)支持256K长上下文,适用于多轮复杂任务。实测生成速度达150 token/秒,用户反馈“问题发出即出答案”,延迟低至毫秒级,成本仅为闭源模型的1/10。性能上,该模型在多项基准测试中与头部开源模型DeepSeek-V3.2持平甚至超越。技术负责人罗福莉(前DeepSeek核心研究员)的贡献是关键。她主导的自研R3路由重放技术解决了MoE模型强化学习的稳定性问题,确保训练到150步仍保持平稳。#老张聊科技# 小米发布最新mimo大模型

6. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

7. #微博声浪计划##听见微博# DeepSeek新模型曝光,其新一代旗舰模型V4核心架构MODEL1因GitHub代码更新意外公开。该架构在KV缓存、FP8量化等方面革新,支持百万Token上下文,推理成本仅为GPT-4 Turbo的1/70,预计2026年春节发布,或推动国产大模型效率革命。 铭科技的微博音频

8. 【推理效率狂飙19倍!#千问3.5成本仅为谷歌大模型5%#】千问3.5凭什么做到成本仅为谷歌的1/18?答案是底层架构的全面革新。全新MoE架构,3970亿参数仅激活170亿,推理吞吐量最高提升19倍,部署显存降低60%。技术上的“斤斤计较”,才有了价格上的“大大方方”。#有AI的春节有什么不一样# 引力科普的微博视频

9. DeepSeek V4 网页端《原神×我的世界》融合小游戏代码测试:拳打 ChatGPT,脚踢 Gemini,硬刚 Claude

10. 刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

11. 除夕迎「源神」?Qwen3.5以小胜大,捅破性价比天花板,大模型竞赛下半场开始了

12. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

13. 哥们,路子走窄了。强化学习RL是否能增强模型的推理能力?——NeruIPS 2025获奖论文,来自清华大学

14. 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度

15. 13人干翻Transformer!新架构SSA算力暴减千倍,成本仅Opus 5%

16. #DeepSeekV4发布# 这算是千呼万唤始出来,终于发布了。DeepSeek今天正式发布V4系列预览版并同步开源,分为V4-Pro和V4-Flash两个版本,主打100万(1M)超长上下文能力,官网、App及API均已同步更新。V4-Pro在Agent能力、世界知识、数学推理等多项评测中达到开源模型最佳水平,推理性能比肩顶尖闭源模型;V4-Flash则以更小的参数量提供更快速、更经济的API服务,适合轻量场景。技术层面,V4采用全新注意力机制,结合DSA稀疏注意力,在大幅压缩计算和显存需求的同时,实现百万级超长上下文。DeepSeek表示,1M上下文将成为旗下所有官方服务的标配。此外,V4针对多款主流Agent产品进行了专项适配优化。旧版API接口模型名deepseek-chat和deepseek-reasoner将于2026年7月24日正式停用,用户需提前切换至新模型名。#老张聊科技# deepseekv4发布

17. 谷歌最新研究推出了Titans架构与MIRAS理论框架,革新了AI长时记忆能力。传统Transformer虽然引入了注意力机制,但随着序列变长计算成本激增,难以处理超长文本或基因组数据。此前Efficient RNN和状态空间模型虽能线性扩展,却因固定大小记忆压缩丢失丰富信息。 Titans结合了RNN的速度与Transformer的精度,开启了“测试时记忆”能力——模型在运行中实时学习和更新参数,无需离线重训。其创新在于用深层多层感知机作为长时记忆模块,远超传统RNN固定向量的表达力,不仅存储信息更是理解和总结文本全貌。 核心机制“惊喜度”衡量输入与记忆预期差异,低惊喜跳过,保持效率,高惊喜则优先永久记忆,类似人类更记得突发事件。Titans还引入动量机制捕捉上下文连续性和自适应遗忘门控,平衡信息更新与存储,保证性能稳定。 MIRAS理论统一了各种序列模型设计,定义了记忆结构、注意偏向、遗忘调节与记忆算法四大要素,突破传统均方误差限制,探索更丰富的非欧几里得目标和正则化。基于此,衍生出YAAD(鲁棒抗噪)、MONETA(严格数学范数)、MEMORA(概率映射稳定性)等无注意力新模型,进一步提升记忆稳健性和泛化能力。 实验表明,Titans及MIRAS变体在语言建模、零样本推理、基因组和时间序列预测等多任务中均优于Transformer++、Mamba-2等先进模型,且具备高效并行训练和线性推理速度。特别是在BABILong长上下文推理测试中,Titans超越包括GPT-4的大型模型,并能扩展至超过200万token的上下文窗口。 这项工作不仅突破了长序列建模瓶颈,也揭示了在线优化与联想记忆的深层联系,为AI长时记忆和实时适应打开新纪元。未来,结合深度记忆神经网络与非欧几里得优化,AI将在超长文本理解、复杂推理等领域实现质的飞跃。 原文:research.google/blog/titans-miras-helping-ai-have-long-term-memory/

18. 大模型上下文工程指南

19. 【 2026年2月5日 星期四 】全球AI新鲜事,10条内容汇总: 目录 1. 腾讯开源高性能LLM推理算子库HPC-Ops,混元模型QPM提升30%2. 全球首款心智原生双足机器人「小原子」发布,身高45厘米,具备自主感知、实时决策与持续学习能力3. 全国首个AI+电影虚拟拍摄实验室在浙江揭牌,瞄准国产化与国际标准4. 截至2025年12月,中国网民破11.25亿,生成式AI用户超6亿,深度融入生活与生产场景5. 中国首个太空计算中心正式启用!2800颗“计算卫星”将织就全球算力天网6. OpenAI官方宣布推出GPT-5.2及GPT-5.2-Codex两款升级版模型:不改结构参数,推理速度暴增40%!7. 达索系统联手英伟达打造工业AI新基座,虚拟孪生+AI工厂全面落地8. 苹果Xcode重磅接入AI代理编程!支持Claude、Codex,开发者可一键连接自有AI账户9. 黄仁勋在旧金山AI会议上重磅发声:AI不会取代软件,而是深度协同10. 谷歌2025年营收破4000亿!AI投入翻倍、云业务狂飙、Gemini用户超7.5亿 具体内容如下 【 1 . 腾讯开源高性能LLM推理算子库HPC-Ops,混元模型QPM提升30% 】腾讯混元AI基础设施团队正式发布全新开源项目——HPC-Ops,这是一套面向大语言模型推理场景的高性能核心算子库。该库专为生产环境优化,已在多个主流模型上实测验证。在真实业务负载下,搭载HPC-Ops后,混元自研模型的每分钟查询量(QPM)提升达30%,DeepSeek系列模型QPM也实现17%增长。性能突破集中在三大关键算子:Attention计算速度最高达FlashInfer与FlashAttention的2.22倍;GroupGEMM相较DeepGEMM提速1.88倍;FusedMoE模块比TensorRT-LLM快1.49倍。这一成果标志着国产AI底层推理加速能力迈入国际第一梯队。【 2 . 全球首款心智原生双足机器人「小原子」发布,身高45厘米,具备自主感知、实时决策与持续学习能力 】2月4日,科技公司原力无限正式推出其首款面向大众消费者的具身智能产品——「小原子」(YUANZI)。这款机器人被定义为全球首款“心智原生”小尺寸双足机器人,突破传统预设指令模式,具备自主感知、实时决策与持续学习能力。它身高约45厘米,采用高动态双足运动架构,可在家庭、办公等非结构化环境中灵活行走、避障、交互。内置多模态大模型端侧引擎,支持语音、视觉与动作的深度融合,能理解语境、记忆偏好、主动响应需求。不同于工业或服务型机器人,「小原子」定位为陪伴型智能体,强调情感联结与成长性,用户可参与其行为训练与个性养成。产品预计年内开启预售,标志着具身智能从实验室加速迈向日常生活。【 3 . 全国首个AI+电影虚拟拍摄实验室在浙江揭牌,瞄准国产化与国际标准 】2月4日,浙江德清迎来影视科技发展的重要节点——“人工智能+电影虚拟拍摄融合创新实验室”正式揭牌成立。该实验室由浙江省电影局联合中国电影科学技术研究所共同发起,是全国首个聚焦AI与虚拟拍摄协同创新的省级科研平台。实验室将系统布局五大核心任务:突破智能拍摄关键软硬件的国产替代瓶颈;推动虚拟制片技术从中试走向规模化应用;构建覆盖前期预演、实时渲染、后期合成的全链条AI制片平台;牵头研制符合中国产业实际的虚拟拍摄技术标准体系;深化与全球顶尖影视科技机构的对话与协作。未来,这里将成为孵化智能影像人才、验证前沿拍摄范式、输出可复制产业经验的核心引擎,为影视工业迈向高效、低碳、创意驱动的新阶段提供坚实支撑。【 4 . 截至2025年12月,中国网民破11.25亿,生成式AI用户超6亿,深度融入生活与生产场景 】最新发布的第57次《中国互联网络发展状况统计报告》显示,我国数字化进程持续深化。截至2025年12月,全国网民规模攀升至11.25亿,互联网普及率历史性突破80%,城乡、区域、群体间数字鸿沟进一步弥合。与此同时,数字经济展现强劲韧性与活力,核心产业增加值占国内生产总值比重提升至10.5%,成为稳增长、促转型的关键引擎。制造业、农业、服务业数字化转型全面铺开,工业互联网平台连接设备超千万台。尤为引人注目的是,生成式人工智能迎来规模化落地,用户规模达6.02亿,覆盖智能办公、教育辅助、医疗问诊、内容创作、智能制造等多个领域,技术正从‘能用’迈向‘好用’‘爱用’新阶段。【 5 . 中国首个太空计算中心正式启用!2800颗“计算卫星”将织就全球算力天网 】2月2日,国星宇航台州算力卫星创新基地正式启用,成为我国太空算力基础设施建设的重要支点。作为国内率先布局空天智能计算的企业,国星宇航正全力推进“星算”计划——一个宏大的太空计算网络构想:未来将发射2800颗具备在轨计算能力的卫星,组成全球首个规模化、智能化、可持续演进的超级太空计算中心。该网络强调全域覆盖、动态响应、自主安全与能源友好,旨在为人工智能、遥感分析、应急通信、低空经济等场景提供毫秒级响应的分布式算力支持。目前,“星算”01组已成功发射并稳定运行,开创全球太空计算中心先河;02组与03组进入量产交付阶段,预计将于2026年前分批完成星座组网与轨道部署。【 6 . OpenAI官方宣布推出GPT-5.2及GPT-5.2-Codex两款升级版模型:不改结构参数,推理速度暴增40%! 】OpenAI开发者团队正式上线GPT-5.2和GPT-5.2-Codex两款新模型。值得注意的是,此次升级并非通过扩大模型规模或修改底层结构实现,而是聚焦于推理引擎优化、算子融合与内存调度等系统级改进。实测数据显示,两模型在多种典型任务场景下——包括长文本生成、多轮对话与代码补全——平均响应速度提升达40%,同时保持原有准确率与逻辑一致性。GPT-5.2-Codex特别强化了编程语义理解能力,支持更复杂的跨语言代码生成与调试建议。这一突破标志着大模型正从“堆参数”迈向“精调效”的新阶段,为实时交互、边缘部署与高并发服务提供了更强技术支撑。【 7 . 达索系统联手英伟达打造工业AI新基座,虚拟孪生+AI工厂全面落地 】2月3日,达索系统与英伟达正式宣布建立长期战略合作伙伴关系,共同构建面向制造业、能源、航空航天等关键行业的工业AI统一架构。这一合作深度融合达索系统的虚拟孪生建模能力与英伟达的AI计算硬件、开放大模型生态及加速软件栈,目标是打造具备物理一致性与科学可信度的‘行业世界模型’。该模型将部署在升级后的代理式3DEXPERIENCE平台上,以智能虚拟助手形式为工程师、系统架构师等专业人士提供实时决策支持与知识协同。值得注意的是,英伟达已率先应用达索基于模型的系统工程(MBSE)方法,用于AI工厂的全生命周期设计,相关成果已集成至NVIDIA Rubin平台,并成为Omniverse DSX Blueprint的核心组成部分,加速全球AI基础设施规模化落地。【 8 . 苹果Xcode重磅接入AI代理编程!支持Claude、Codex,开发者可一键连接自有AI账户 】苹果公司正式宣布将在其核心开发工具Xcode中引入AI代理编程功能,全面升级开发者生产力。这一更新允许程序员将复杂多步骤任务交由AI代理自主完成,包括项目构建、自动化测试、精准检索苹果官方文档以及智能修复代码缺陷。Xcode作为iOS/macOS应用开发的基石平台,此次升级意义重大——它不再仅是辅助写作的聊天式AI接口,而是真正具备执行闭环能力的编程协作者。用户只需通过API密钥绑定自己的OpenAI或Anthropic账户,即可启用Claude或Codex等模型。苹果强调其采用开放架构,未来可无缝接入更多符合标准的第三方AI代理。当前,业界正兴起‘氛围编程’实践:人类定义目标与边界,AI生成代码,人再审核与迭代。苹果此举,既是技术演进的必然,也是对开发者工作流重构的关键落子。【 9 . 黄仁勋黄仁勋在旧金山AI会议上重磅发声:AI不会取代软件,而是深度协同 】美东时间周二,全球软件股遭遇罕见抛售潮,恐慌情绪迅速从美股蔓延至亚洲市场。伦敦证券交易所集团、汤森路透、CS Disco和LegalZoom等美股软件相关企业单日跌幅达12%—20%。次日,印度Nifty IT指数暴跌超6%,印孚瑟斯盘中下挫7.3%;日本瑞可利与野村综合研究所分别下跌9%和8%;港股金蝶国际跌幅逾13%。在此背景下,英伟达CEO黄仁勋在思科主办的人工智能峰会上作出关键回应。他直言‘AI取代软件’的说法‘不合逻辑’,指出AI系统本质是嵌入并强化现有软件生态,其突破集中于更高效调用已有工具。软件不是被替代的对象,而是AI落地不可或缺的基础设施与协作伙伴。【 10 . 谷歌2025年营收破4000亿!AI投入翻倍、云业务狂飙、Gemini用户超7.5亿 】Alphabet刚刚公布了2025财年全年及第四季度业绩,交出一份亮眼答卷:全年总营收达4028.36亿美元,首次突破4000亿大关,同比增长15%;净利润高达1321.70亿美元,同比跃升32%。更引人注目的是其战略转向——公司明确表示,2026年资本支出将大幅增至1750亿至1850亿美元,几乎是2025年914.5亿美元的两倍,主要用于AI基础设施建设,包括新一代服务器、超大规模数据中心及高速网络设备。谷歌云成为最大增长极,全年运营收入突破700亿美元,单季收入达176.64亿美元,同比激增48%;未履行订单达2400亿美元,同比增长超一倍。Gemini大模型月活跃用户已攀升至7.5亿,单位服务成本较2025年初下降78%,印证AI规模化落地能力。广告业务依然坚挺,谷歌服务板块收入958.62亿美元,占总营收84.2%,其中广告收入823亿美元,增长14%;YouTube全年总收入历史性突破600亿美元。#科技妈咪##科技先锋官##AI##人工智能##腾讯##谷歌##黄仁勋#

20. 520,遇见国产「新模王」Qwen3.7-Max!

21. #微博声浪计划##听见微博# DeepSeek v4 百万上下文实现技术普惠,自研DSA稀疏注意力机制降本增效,双版本适配不同场景,全链路支持国产算力。API定价低于GPT-5.5,应用场景广泛,虽存挑战但未来将开源,推动国产AI生态发展。 种斌Marco的微博音频

22. #小米发布自动驾驶模型##小米自动驾驶模型XiaomiOneVL发布# 小米发布并全面开源自动驾驶模型Xiaomi OneVL:一步式潜空间语言视觉推理框架,将VLA、世界模型和潜空间推理三大技术路线统一到同一框架中,让大模型推理“又快又准”:精度上超越显式思维链,速度上对齐“仅答案”预测,推理延迟最低仅0.24秒,为传统VLA自回归推理的5.4%,为量产车端实时部署提供了可行路径

23. 推理需求暴增,SRAM 如何解决 GPU 不够用的问题?

24. 华人学生立大功!新王Mamba-3直击Transformer死穴,推理效率碾压7倍

25. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文

26. 独家|聚焦大模型推理,水下AI芯片公司斩获10亿元Pre-A轮融资

27. #千问Qwen3.5大模型发布# 刚刚,千问正式官宣发布 Qwen3.5,并推出Qwen3.5系列的第一款模型 Qwen3.5-397B-A17B 的开放权重版本。作为原生视觉-语言模型,Qwen3.5-397B-A17B 在推理、编程、智能体能力与多模态理解等全方位基准评估中表现优异,助力开发者与企业显著提升生产力。该模型采用创新的混合架构,将线性注意力(Gated Delta Networks)与稀疏混合专家(MoE)相结合,实现出色的推理效率:总参数量达 3970 亿,每次前向传播仅激活 170 亿参数,在保持能力的同时优化速度与成本。我们还将语言与方言支持从 119 种扩展至 201 种,为全球用户提供更广泛的可用性与更完善的支持!#HOW I AI##过个有AI年#

28. 如何评价DeepSeek发布梁文锋署名论文,提出「条件记忆」及Engram记忆检索架构?有哪些亮点?

29. 云涨 Token 涨,DeepSeek 偏降价?其他的企业集体上调 AI 算力价格,行业 Token 成本普涨之际,DeepSeek V4 却逆势降价,V4-Flash 输出价低至 2 元 / 百万 Token,仅为竞品的 1/40,上演价格反向操作,DeepSeek的底气在哪里?系统方面,DeepSeek通过稀疏注意力革命,在同样是百万 Token 场景下,推理算力需求降至前代 10%-27%,KV Cache 占用仅 7%-10%,这就让长文本成本不升反降。V4-Pro 1.6T 参数仅激活 49B,V4-Flash 284B 参数仅激活 13B,避免 全参数计算浪费,算力利用率拉满。小模型继承大模型能力,推理成本再降 50%。在硬件方面,DeepSeek 率先全栈适配华为昇腾 950,从 CUDA 迁移至 CANN 框架。国产芯片单卡推理性能为英伟达 H20 的 2.87 倍,采购成本更低。芯模协同优化,训练推理成本较海外方案降低 70%-85%,直接对冲云厂商涨价影响。市场方面,2026 年是AI智能体落地元年,Token 消耗呈指数级增长,低成本是规模化关键。DeepSeek 采用了V4-Flash 低价走量,V4-Pro 走高端市场的市场价格策略。开源吸引开发者,降低企业落地门槛,是能够快速抢占市场份额的。DeepSeek 逆势降价,是国产 AI 摆脱海外依赖、靠技术定义成本的里程碑。这场降价,本质是国产 AI 的成本革命与话语权争夺。

30. 《Continuous batching》本文梳理了大型语言模型(LLM)推理效率的核心技术——连续批量处理(Continuous Batching)。从基础的注意力机制和KV缓存出发,逐步揭示了如何优化计算吞吐量,提升多用户同时服务的性能。首先,LLM是通过预测下一个词元(token)实现文本生成的,但每生成一个词都需大量计算,尤其是注意力机制中计算查询(Q)、键(K)、值(V)三者之间的复杂关系,复杂度随序列长度平方增长。为了高效推理,引入了KV缓存:已计算过的键值对被存储,生成新词时无需重复计算,大幅减少计算量。面对长提示词(prompt)超出显存限制,模型采用分块预填充(Chunked Prefill)策略,分批处理输入,结合KV缓存保持上下文信息完整,解决了显存瓶颈。传统批量处理要求所有输入长度一致,需大量补齐(padding),导致资源浪费和效率下降。连续批处理突破这一限制,将多个请求的词元按序拼接,利用注意力掩码控制不同句子间不互相干扰,实现“锯齿形”批量处理(ragged batching)。结合动态调度,将已完成的请求即时替换为新请求,保持GPU利用率最大化。总结来说,连续批处理整合了KV缓存、分块预填充和锯齿形批处理三大技术,极大提升了模型推理的吞吐量和效率,使得像ChatGPT这样的大规模服务能高效支持成千上万的并发用户。这不仅是对模型计算逻辑的优化,更是架构设计上的创新,体现了在有限资源下满足海量实时请求的智慧。未来,随着缓存管理和调度策略的进一步演进,LLM推理的效率还将持续提升。原文链接:huggingface.co/blog/continuous_batching

31. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

32. 在AI推理领域,谷歌TPU正以4倍于英伟达GPU的性价比,掀起一场技术革命。曾经主导机器学习训练的英伟达,正面临从训练到推理转型的严峻挑战。训练是一次性重投入,推理却是持续的“马拉松”——2024年OpenAI推理成本高达23亿美元,是训练费用的15倍。预计到2030年,推理将占据75%的AI算力需求,市场规模达2550亿美元。谷歌TPU专为推理优化,采用流水线阵列架构,显著降低延迟和能耗(比GPU节能60%-65%),并且单价低于英伟达H100。在Midjourney切换到TPU后,推理成本降低65%,吞吐量提升3倍。Anthropic计划部署百万TPU,Meta也在推动数十亿美元TPU采购,表明顶级AI公司正加速从GPU向TPU迁移。ASIC(应用专用芯片)如TPU以专精取胜,摆脱了GPU的多功能设计带来的资源浪费,适合海量、稳定的推理服务。尽管TPU生态依赖谷歌云及TensorFlow/JAX,对灵活性有一定限制,但面向推理的高效能和成本优势不可逆转。未来AI基础设施将是GPU负责研究训练,TPU主导大规模推理的混合格局。这场变革对创业公司尤为重要,TPU降低推理门槛,助力中小团队与巨头竞争。对于企业CTO,推理成本的爆发性增长迫使其重新审视硬件策略,提前布局TPU可节省40%-60%预算,同时降低碳排放压力。英伟达虽然推出Blackwell架构试图提升推理效率,但仍难撼动TPU的成本优势,投资者已开始大规模减持英伟达股票,预示其市场统治力将被蚕食。总结来看,AI算力的未来属于针对推理的专用芯片。TPU的强势崛起标志着AI基础设施进入“推理时代”,企业不抓紧转型,势必被成本压力和竞争力拉开差距。合理利用TPU和GPU各自优势,灵活部署混合方案,将是稳健的应对之策。原文:ainewshub.org/post/ai-inference-costs-tpu-vs-gpu-2025

33. AI的未来,也许不在于模型规模的无限扩大。 #大咖观察 #红衣聊AI #transformer神经网络架构 #人工智能

34. 将注意力旋转 90 度!今天,Kimi 的「注意力残差」火了

35. Transformer与RNN合体,谷歌打下显存门槛,解锁超长上下文

36. 超DeepEP两倍!无问芯穹FUSCO以「空中变阵」突破MoE通信瓶颈,专为Agent爆发设计

37. 华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」

38. Transformer架构是否已触及天花板?光靠Transformer能走通AGI吗?

39. WWW 2026|让MoE路由拥有「记忆」:RMS-MoE用检索记忆协同实现更高效专家调度

40. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?

41. 78ms的VLA推理!浪潮信息开源自驾加速计算框架,大幅降低推理时延

42. DeepSeek v4全面支持百万上下文 token,这意味着什么?到底有多厉害?

43. #DeepSeek新模型有多猛#大模型的优秀与否,重点的看的是推理的过程中是死记硬背还是举一反三,DeepSeekMath-V2通过验证器与生成器的协同循环和元验证机制,实现了举一反三的的能力,通过逐步检查证明过程,确保推理的严谨性和完整性。改变了过去大模型只能通过强化学习和调用结果这个死记硬背的方式。DeepSeekMath-V2生成器通过高质量证明和有缺陷的证明来推理一个定理的严谨性,并利用这种自我认知系统地改进DeepSeekMath-V2的数学推理能力,提高定理的推理能力,让模型可以做到知其然知其所以然。大模型的幻觉问题一直都是大模型无法避免的问题,减少大模型的幻觉也就成了衡量大模型的一个重要指标,因为解决了幻觉问题就可以在推理领域能够提供更准确、更可靠的结果。DeepSeekMath-V2大幅减少了大模型幻觉,就避免了通用大模型可能出现的错误推理和不准确答案,提高了模型在实际应用中的可信度和可用性。#科技先锋官##AI创造营#

44. 昨天存储芯片都跌,都说谷歌发布了一个TQ算法论文,把缓存利用率大幅提升了,存储危险了。是怎么回事呢。这么说吧,AI大模型推理的时候,要记住你之前的对话,就会把记忆存在KV缓存里面,你聊天回合越多,存的记忆就越多。TQ算法什么创新呢,它完全不改模型,不用重新训练,就能把KV缓存的内存占用压缩至少6倍。有了它,再H100 GPU上注意力计算能提升8倍,还不影响模型精度。真的太香了。所以市场一顿跌,算法改进对存储的利用率一下子提高那么多,那存储需要那么多吗,都在担心这个事儿。其实没必要,毕竟这个只是针对缓存,还没针对硬盘,HBM。不过话说回来,既然现在有TQ算法,将来会不会有什么XX算法,把其他领域的存储利用率大幅提升呢?完全是有这个可能的嘛!存储也不要指望一直这么赚钱,太贵的东西,别人研发优化算法的意愿就很强烈。两者互相对冲。

45. 清华大学教授汪玉解读了理想马赫M100芯片的独特数据流架构,新的数据流架构对于Transformer运算更友好效率更高,数据可在计算单元间直接流转,不用反复存取内存,大幅提升计算效率且不浪费算力。数据流架构和VLA 大模型结合的尝试属于前沿探索领域。核心难点在于几乎要重写编译器,无法利用CUDA生态的成熟算子,这对于理想芯片算法团队是巨大挑战。网页链接理想在第一代自研芯片上就上创新数据流架构,这个不容易,但是风险和收益是成正比的。前段时间英特尔计划以16 亿美元收购数据流架构芯片公司 SambaNova,其主打可重构数据流单元,就是定位替代 GPU 的 AI 系统;去年年底英伟达创纪录的200 亿美元收购 Groq 核心资产,也是看中Groq主打的LPU语言处理单元,采用软件定义硬件的可重构数据流架构,可以消除AI时代的内存带宽瓶颈。

46. 英伟达最新FastDriveCoT!CoT思维链推理加速3-4倍...

47. 谷歌近日发布 TurboQuant AI 内存压缩算法,直接将大模型推理阶段的键值缓存(KV Cache)内存占用压缩至原来的 1/6。市场担心 AI 服务器不再需要海量内存,导致存储芯片逻辑重估随后,存储公司股价暴跌:美光、SK 海力士、三星等存储巨头市值单日蒸发超 900 亿美元;内存降价:DDR5 内存条价格结束暴涨。以海盗船 32GB (6400MHz) 为例,美国亚马逊价格从约 490 美元回落至 380 美元左右,国内渠道商也开始恐慌性抛售去库存不过,目前TurboQuant 仅优化推理缓存,未触及训练阶段的 HBM 需求,效率提升甚至可能刺激更多 AI 应用爆发,长期看内存需求未必减少

48. transformer架构的核心公式其实类似于数学期望,理解起来也不复杂,但为什么这个模型这么强呢?

49. “源神”的新年贺礼!深度实测Qwen3.5,原生多模态表现如何

50. 当海外开发者还在为Gemini3 Flash惊叹时,小米开源大模型MiMo-V2-Flash横空出世,直接被老外吹成“Gemini平替”!它以309B参数实现2.6倍推理加速,延迟仅为DeepSeek-V3.2的一小部分,却在通用基准测试中性能相当。最让开发者疯狂的是,它不仅免费开源,推理成本还低至闭源竞品的2.5%,中国开源大模型的实力,这次真的让海外刮目相看

51. #DeepSeekV4发布# DeepSeekV4终于发布了,简单总结下:1、双版本发布:推出 DeepSeek-V4-Pro(高性能)和 DeepSeek-V4-Flash(高性价比)两个版本,可按需选择。2、超长上下文:支持 1M token(约百万字) 的上下文长度,能一次性处理海量信息。3、核心能力领先:在 Agent能力、世界知识和推理性能 三方面均达到国内及开源模型的领先水平。4、具体任务表现:V4-Pro版本的代理编码能力接近顶尖闭源模型,在数学、编程等推理任务上超越所有已开源评测的模型。5、技术创新与迁移提醒:采用 DSA稀疏注意力机制 降低长上下文计算成本;原有 deepseek-chat 等模型名3个月后停止使用,需迁移到新名称。

52. 理解DeepSeek-V3.2中的稀疏注意力(DSA)LLM普遍的一个问题是如何处理更长的上下文。随着需要处理的文本越来越长(即“上下文窗口”越来越大),计算成本和推理速度成了难以逾越的障碍。这个问题的根源在于,传统的注意力机制(Vanilla Attention)具有 O(L²) 的计算复杂度。简单来说,这意味着如果文本长度(L)增加一倍,计算量和所需时间就会增长到原来的四倍。这种指数级的成本增长,让真正意义上的“无限上下文”变得遥不可及。DeepSeek-AI 团队推出的 DeepSeek-V3.2 模型,其核心创新正是为了解决长文本处理瓶颈而设计的——DeepSeek 稀疏注意力(DeepSeek Sparse Attention, DSA)。1. 核心:DSA如何巧妙地“偷懒”?从本质上讲,DSA 是一种智能的筛选机制。它彻底改变了模型处理信息的方式:不再强迫模型关注上下文中的每一个词元(token),而是教会它只聚焦于那些真正重要的部分,从而巧妙地“偷懒”。这一过程主要依赖两个关键组件:1) 闪电索引器 (Lightning Indexer): 我们可以将其比作一个高效的“相关性扫描仪”。当模型处理一个新的词元时,这个索引器会快速扫描之前出现过的所有词元,并为它们计算一个“索引分数”。这个分数代表了每个旧词元与当前词元的相关性高低,判断哪些是值得关注的。2) 细粒度令牌选择机制 (Fine-grained token selection): 这就像一个“Top-K选择器”。在索引器完成打分后,该机制会立即介入,只挑选出得分最高的 k 个词元,然后将它们的信息传递给核心的注意力计算部分进行处理。通过这种“扫描-筛选-聚焦”的两步走策略,DSA 成功地将注意力计算的复杂度从 O(L²) 降低到了 O(Lk)。由于被选中的 k 值通常远小于总长度 L,因此在处理长序列时,这种方法实现了巨大的效率提升。2. 性能没有下降,成本大幅降低DeepSeek-V3.2 与其前代采用密集注意力的 DeepSeek-V3.1-Terminus 对比,性能基本持平。推理成本大幅降低(约70%)3. 如何“教会”模型变得稀疏?DeepSeek-V3.2 的训练并非从零开始,而是在性能强大的 DeepSeek-V3.1-Terminus 模型基础上,进行了一套精心设计的“持续预训练”(Continued Pre-Training)。这个过程分为两个核心阶段:1)密集预热阶段 (Dense Warm-up Stage): 这是一个短暂的初始化阶段。在此期间,模型仍然使用传统的密集注意力,但团队会“冻结”主模型的所有参数,只专注于训练“闪电索引器”。这一步至关重要,它相当于让闪电索引器这位“学徒”去模仿并学习主模型这位“大师”的完整注意力模式。正是因为索引器学会了如何做出有根据的判断,模型在后续切换到稀疏模式时,才能精准地筛选出关键信息,从而在不牺牲性能的前提下实现效率飞跃。2)稀疏训练阶段 (Sparse Training Stage): 一旦索引器“学成出师”,能够准确地识别关键信息后,训练就进入了第二阶段。此时,Top-k 选择机制被正式引入,整个模型(包括主模型和索引器)都会被一同进行微调。这个阶段的目标是让模型完全适应在新的稀疏注意力模式下高效工作。这套独特的训练流程,是确保 DSA 在大幅提升效率的同时,不损失模型推理和理解能力的关键所在。它保证了模型是在“理解”的基础上进行“稀疏”,而不是盲目地丢弃信息。4. 潜力如何?这项技术路线的巨大潜力,在一个名为 DeepSeek-V3.2-Speciale 的高性能实验变体上得到了有力证明。该模型在 DeepSeek-V3.2 的坚实架构基础上,通过在推理数据上进行专门的、高强度的持续训练,最终在国际奥林匹克数学竞赛(IMO)和信息学竞赛(IOI)中取得了金牌级别的成就。#ai创造营# #科技# #DeepSeek发布2款新模型#

53. 【DeepSeek 联合清北发布论文:发力智能体底层基建,突破 Agent 推理 I/O 瓶颈】DeepSeek 与北大、清华在 ArXiv 发布论文,提出全新针对智能体的推理框架 DualPath。其核心是解决 Agent 长文本推理 I/O 瓶颈,通过引入「存储至解码」路径,改变传统单路径加载模式,实现集群存储带宽全局池化与动态负载均衡。在 660B 规模模型实测中,离线推理吞吐量提高 1.87 倍,在线服务吞吐量平均提升 1.96 倍,优化首字延迟且不影响 Token 间生成速度。DualPath 构建双路径模型,由推理引擎、流量管理器和中央调度器组成,还给出以计算网卡为中心的流量管理和自适应请求调度器两套优化方案。实验显示其能有效突破大模型推理 I/O 墙,提升智能体 LLM 推理系统效率。此外,论文第一作者是北大博士生吴永彤,他聚焦系统软件与大模型基础设施研究。

54. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

55. 谷歌开源Gemma4 MTP 草稿模型,推理速度提升3倍

56. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称自注意力机制中的QKV作用知识点讲解在自注意力机制中,每个输入都会被映射为三个向量:Query(查询)、Key(键)和Value(值)。通过计算Query与Key的相似度(通常是点积),得到注意力权重,然后用这些权重对Value进行加权求和,从而得到输出。在Transformer的严格定义中,Q和K的点积首先得到的是“注意力得分”(Attention Scores),这个得分还需要经过缩放(Scale)和 Softmax 激活函数处理后,最终输出的概率分布才被称为“注意力权重”(Attention Weights)。举例说明:在一句话中,每个词都会生成Q、K、V三个向量。比如词A的Query会与所有词的Key计算相似度,得到权重分布,然后加权所有词的Value,从而得到词A的上下文表示。这使模型能够关注句子中与当前词最相关的部分。这种机制使模型能够捕捉长距离依赖关系,是Transformer模型的核心。例题(单选题)Q与K点积的主要作用是?A选项:生成新的词向量B选项:计算注意力权重C选项:更新模型参数D选项:减少训练数据量答案与题解答案、题解:见评论区温馨期待期待大家提出宝贵建议,互相交流,收获更大,助教:rht#AI创造营# #科技风向标# 网页链接

57. 这些绝对疯狂的 LLM 专家现在正在尝试使用 Turboquant 不仅压缩 KV 缓存,而且现在还压缩整个模型本身。该测试表明内存占用减少了 50% 以上,使得 Qwen 3.5-27B 可以在单个 RTX 5060 上以 3.15 位精度运行,且没有明显的性能下降。这正好说明我们距离现有模型的完全优化还很远。我们可能还需要不到一年的时间,才能在小型设备上运行大型模型,并将性能影响降到最低。在此期间,他们只会变得越来越好。生活在这样一个时代真好。

58. DeepSeek悄悄地又发布了一份重磅报告。他们提出了 Engram,这是一种将查找表记忆与上下文感知门控融合在一起的记忆技术,并将其添加到他们的模型中。因此,无需强制密集层每次都对事实进行编码和重新计算。在相同的浮点运算次数下,MoE 的容量可以从「存储」转向「推理 + 长上下文」,从而提高知识水平和整体性能

59. 北大、清华和DeepSeek联合发的新论文《DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference》arxiv.org/abs/2602.21548以下为AI解读:DualPath 是一个面向多轮代理 LLM 推理的系统,核心改动在于把命中 KV-Cache 的加载从“单一路径”扩展为“双路径”:除了传统的“存储→Prefill 引擎(PE)”,还允许“存储→Decode 引擎(DE)→经由计算网络 RDMA 转发给 PE”,并配合全局调度在两条路径间动态分流;系统还包含以 CNIC 为中心的流量管理以隔离 KV-Cache 传输与模型执行通信,从而在生产代理式负载上把离线吞吐提升最高到 1.87×、在线吞吐平均提升到 1.96×。 它存在的意义在于解决代理式推理从“算力瓶颈”转向“KV-Cache 存储 I/O 瓶颈”后的结构性失衡:在常见 Prefill/Decode 解耦架构里,KV-Cache 往往只由 PE 侧从外部存储读取,导致 PE 的存储网卡(SNIC)长期打满,而 DE 侧 SNIC 闲置,整体吞吐被 PE 侧存储带宽卡死;DualPath 通过利用 DE 侧闲置的存储带宽并借助更高速的计算网络回传,把原本集中在 PE 的 I/O 压力“摊开”,从根上缓解存储带宽瓶颈并提升端到端性能。 同类工作中,Mooncake/TokenLake 走的是“把 KV-Cache 缓存在分布式 DRAM 前缀池/内存池”路线,目标是提高命中与减少外部存储访问;但论文指出 Mooncake 在内存受限(如 RL rollout 时 DRAM 被训练状态占用)或工作集极大(在线服务)时会受成本/容量约束,而 DualPath 直接面向存储后端,通过在所有引擎间均衡 SNIC 读流量来提升有效存储带宽,并显著降低对 DRAM 的依赖;此外,DualPath 也可以叠加中间层 DRAM cache,但论文认为增益有限,强调其主要价值在“跨引擎汇聚与调度存储带宽”而非“加大缓存层”。#HOW I AI#

60. Qwen3.6-27B + MTP

61. llama.cpp接入MTP推测解码!3090实测最高2.44倍暴涨

62. 大语言模型LLM推理优化

63. 17,000 tokens/秒

64. Qwen模型渲染太慢?更新llama.cpp,推理速度翻倍

65. Qwen2.5长上下文推理提速2.66倍!加州大学&NVIDIA提出CPU-GPU协同混合注意力计算框架HybridGen

66. 下一个 AI 革命要来了?核心架构 Transformer 被直指瓶颈

67. Transformer危险!Titans打破记忆瓶颈

68. 线性复杂度序列建模框架(CPF)

69. 突破Transformer瓶颈

70. AI算法

71. Transformer的终结

72. 【论文笔记】GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

73. 【深度学习】注意力机制与自注意力机制详解

74. 高效自注意力机制

75. 从 Elastic 到 Flux Attention

76. 论文速读|AI 领域大语言模型高效推理

77. LycheeDecode

78. 长文本推理成本爆炸怎么办?ICLR 2026四种推理优化方案让短模型也能玩转长上下文

79. 【ICML2026】面向长上下文大语言模型的训练-推理一致性分段执行

80. 【清华张金涛、朱军26.2】Sparge 2- 可训练稀疏注意力

81. 清华刘知远团队论文

82. UCM 领读计划 #02

83. 9B端侧开源模型跑通百万上下文,面壁全新稀疏-线性混合注意力架构SALA立功了!

84. 深度解析 DeepSeek-V3.2

85. DeepSeek-V4与GLM-5技术报告解读

86. 媲美DeepSeek NSA!腾讯优图提出混合注意力机制SSA,长上下文外推更强

87. 12.2-4|超长上下文,层级稀疏注意力(HSA);自我验证的数学推理, DeepSeekMath-V2

88. FlashAttention

89. FlashAttention 算法原理详解

90. GPU 算力翻倍,AI 反而变慢了?FlashAttention-4 给出了惊人的答案

91. attention的优化思路

92. 大模型推理加速利器

93. 1.8-5|高性能大模型架构与训练

94. 稀疏注意力机制如何加速长文本推理

95. LayerBoost

96. 大模型推理

97. 滑动窗口与注意力结合起来,技巧不在参数上,而在于滑动窗口的注意力。

98. 大模型推理加速指南

99. 2026 大模型推理加速技术全景图

100. 小米大模型岗|推理加速底层逻辑+踩坑实录

101. 从模式匹配到推理能力的跃迁GPU——加速与大模型的技术进化

102. Speculative Decoding深度解析

103. NIPS2025最佳论文 Qwen团队Gated Attentio精读,LLM注意力机制再度突破

104. AI Infra面试常考—FlashAttention系列

105. 砍掉75%KV缓存还能不降性能!随机跨层注意力实现自适应深度缓存共享 【大模型推理优化】【KV缓存优化】

106. FlashAttention:为什么注意力能瞬间提速 10 倍?

107. FlashAttention详解

108. DeepSeek 突破 O(L²) 注意力机制的瓶颈

109. 滑动窗口注意力机制

110. 仅用0.1%的注意力,实现长上下文推理加速:原生Top-k稀疏注意力初步研究

111. step3.5的滑动窗口注意力SWA,Qwen3.5的线性注意力和DeepSeekV3.2 的DSA对比

112. vLLM 登顶 Artificial Analysis 推理榜:DeepSeek V3.2 / MiniMax-M2.5 / Qwen 3.5 397B

113. 推测解码参数调出 665% 加速,Qwen 3.6 只跑 40% 是为何

114. GPU高性能编程之 FlashAttention(Prefill 实验)

115. 为什么 FlashAttention 越做越快,而 Gated DeltaNet 更像一道系统题?

116. Deepseek NSA:长文本加速9倍的稀疏注意力技术

117. 苹果团队:让Transformer自适应共享KV缓存

118. KV Packet:零重计算破局KV缓存依赖,首Token延迟暴降19倍

119. 长上下文推理技术综述

120. 注意力 Attention 机制及其演进

121. 大模型推理性能优化实战:从 500ms 到 80ms 的完整路径

122. 实现高效建模!因果机制结合注意力机制,顶会发到手软! - 哔哩哔哩

123. 别盲目上Attention了!ICDE 2026这篇Li-Net用Top-K稀疏注意力直接省掉一半计算!

124. 百度×北大:用一半算力跑完128K上下文

125. 【大模型系列】KV Cache 优化方法(六大维度)

126. DeepSeek被截胡!新注意力机制提速4倍,64K上下文瓶颈一夜突破

127. Step 3.5 Flash: 推理巅峰,执行如电

128. 上交:Attention推理提速2.88倍的方法

129. LLM多步推理加速新突破SpecGuard让你快又省

130. LMCache:基于KV缓存复用的LLM推理优化方案

131. FlexAttention:用 PyTorch 实现高效灵活的注意力机制

132. 把Llama 3推理成本从100万降到500块,我只动了三个地方

133. 「漫画讲解」稀疏注意力的“鬼打墙”现象与极简改进方法

134. Qwen3.5-397B-A17B技术报告解读

135. 【佳作推荐】DeepMind联合团队发表Nature Machine Intelligence期刊论文:欧几里得快速注意力机制突破分子全局相互作用模拟瓶颈

136. 为什么transformer在处理超长文本时会变慢?它的瓶颈在哪里?怎么优化呢?

137. LLM KV缓存压缩十大技术

138. FlashAttention背后的思想

139. 破局显存焦虑:新华三推出大模型推理场景加速方案

140. 混合线性注意力的正确打开方式!清华&OpenBMB新王炸 HALO

141. CUTLASS 学习记 (6) —— 从零开始的 FlashAttention

142. ICCV 2025 | 首尔大学 ESC:卷积模拟自注意力,轻量化图像超分效率 & 性能双突破!

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章