动态路由真聪明吗?MoE模型的效率与幻觉

源自109位全网作者

06-01 23:44

精选参考来源

1
#DeepSeekV4还有多远#之前V4一直传4月发布,现在专家模式直接用上疑似V4雏形的MoE新架构,主打深度推理解决复杂问题,和快速模式做了明确场景分层。 看DeepSeek最近节奏:1月Engram条件记忆、2月DualPath推理框架,3月还搞了V4 Lite测试,3月底宕机就是在做算力扩容。种种迹象表明V4大概率4月中下旬登场,会补齐多模态短板,整合双模式优势。
2
《The Big LLM Architecture Comparison》 七年来,GPT架构演进虽有细节改进,但核心仍相似。从GPT-2到近期的DeepSeek V3与Llama 4,模型结构变化有限,更多是细节上的优化,如从绝对位置编码到旋转位置编码(RoPE)、多头注意力向分组查询注意力(GQA)转变,以及激活函数由GELU进化为更高效的SwiGLU。 DeepSeek V3(2024末发布)及其推理版本DeepSeek R1(2025年初)引入了两大关键架构创新:多头潜在注意力(MLA)和专家混合(MoE)层。MLA通过压缩键值张量显著节省KV缓存内存,并在性能上超越GQA。MoE则通过稀疏激活少量专家,极大提升模型容量与推理效率,DeepSeek V3拥有6710亿参数,但推理时仅激活37亿,大幅降低推理资源消耗。 非盈利Allen AI的OLMo系列以高透明度著称,虽非性能最强,但其对训练数据和代码的公开为社区提供了宝贵的蓝图。OLMo 2采用Post-Norm(归一化层置于注意力与前馈模块之后)搭配QK-Norm(针对查询和键的归一化),提升训练稳定性,区别于主流的Pre-Norm设计。 谷歌的Gemma系列(尤其是Gemma 3)强调滑动窗口注意力机制,限制每个查询的上下文范围,大幅降低KV缓存内存,用局部注意力替代全局注意力,保持性能几乎不变。Gemma 3还采用了Pre-Norm与Post-Norm混合归一化,兼顾训练稳定性与效率。此外,Gemma 3n针对移动设备进行了优化,利用分层嵌入(PLE)技术降低内存占用,并引入了Matryoshka Transformer结构,实现模型切片灵活部署。 Mistral Small 3.1以较小KV缓存和更少层数提升推理速度,虽舍弃滑动窗口注意力,但性能在多场景优于Gemma 3,凸显宽模型在推理速度上的优势。 Llama 4 Maverick采用MoE架构但激活专家更少且规模更大,整体与DeepSeek V3类似,体现MoE在2025年的流行趋势。 Qwen3系模型涵盖从0.6B到235B参数的密集和MoE版本,兼顾易用性和推理效率。其小型模型适合本地运行,MoE版本激活参数比例低,提升大规模应用的推理性价比。Qwen3 Next在较小规模下引入更多专家和共享专家,并采用混合门控DeltaNet注意力,实现超长上下文支持(262k tokens)和多步预测,提升训练速度和推理效率。 SmolLM3以3B参数提供优异性能,采用NoPE(无显式位置编码)策略,增强对长序列的泛化能力,减少对位置编码的依赖。 Kimi K2体量达到1万亿参数,基于DeepSeek V3架构扩展,采用Muon优化器替代AdamW,训练损失曲线平滑且下降迅速,性能媲美领先私有模型。最新的Thinking版本将上下文扩展至256k tokens,提升推理能力。 OpenAI最新开源的gpt-oss系列(20B和120B)采用类似Qwen3的MoE设计,结合滑动窗口注意力和注意力偏置,架构更宽而较浅,适合高吞吐量推理。其“注意力汇聚”机制(attention sinks)通过头偏置实现长上下文稳定性。 xAI的Grok 2.5作为去年旗舰模型,采用少量大专家,并引入始终激活的共享专家模块,与近期多专家模型设计呼应。 GLM-4.5通过先密集后稀疏的层序设计提高MoE模型稳定性,性能优于Claude 4 Opus,接近OpenAI和xAI的顶尖水平。 MiniMax-M2在保持高性能的同时回归全注意力,摒弃线性注意力的准确性不足问题,采用每层独立QK-Norm,参数激活比例更低,体现稀疏MoE架构的新趋势。 2025年线性注意力迎来复兴,Qwen3-Next和Kimi Linear将轻量级线性注意力与传统全注意力混合,兼顾效率与性能。Kimi Linear通过通道级门控提升长上下文推理能力,在速度和准确性之间取得平衡。 Allen AI最新的Olmo 3在保持透明度的基础上扩展规模,继续采用Post-Norm和滑动窗口注意力,支持64k上下文,表现稳定。 DeepSeek V3.2引入稀疏注意力机制,与Mistral 3大型MoE模型架构相似,后者增加视觉编码器支持多模态,优化推理速度,体现MoE架构的持续进化。 综观2025年旗舰开源大模型,核心仍是Transformer,但细节创新如多头潜在注意力、Mixture-of-Experts、滑动窗口与线性注意力混合、归一化层位置变换等,推动模型在性能和推理效率间取得更优平衡。MoE架构热度持续攀升,模型规模与激活参数数目被巧妙控制,实现大规模知识整合与高效推理。长上下文支持成为新标准,优化训练稳定性和推理速度的技术层出不穷。 未来,架构创新与训练工艺的协同将持续塑造大语言模型的发展路径,开源社区的透明度和多样化探索为行业注入活力。 magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison
全部
来源
内容由AI生成

精选参考来源

1. #DeepSeekV4还有多远#之前V4一直传4月发布,现在专家模式直接用上疑似V4雏形的MoE新架构,主打深度推理解决复杂问题,和快速模式做了明确场景分层。 看DeepSeek最近节奏:1月Engram条件记忆、2月DualPath推理框架,3月还搞了V4 Lite测试,3月底宕机就是在做算力扩容。种种迹象表明V4大概率4月中下旬登场,会补齐多模态短板,整合双模式优势。

2. 《The Big LLM Architecture Comparison》 七年来,GPT架构演进虽有细节改进,但核心仍相似。从GPT-2到近期的DeepSeek V3与Llama 4,模型结构变化有限,更多是细节上的优化,如从绝对位置编码到旋转位置编码(RoPE)、多头注意力向分组查询注意力(GQA)转变,以及激活函数由GELU进化为更高效的SwiGLU。 DeepSeek V3(2024末发布)及其推理版本DeepSeek R1(2025年初)引入了两大关键架构创新:多头潜在注意力(MLA)和专家混合(MoE)层。MLA通过压缩键值张量显著节省KV缓存内存,并在性能上超越GQA。MoE则通过稀疏激活少量专家,极大提升模型容量与推理效率,DeepSeek V3拥有6710亿参数,但推理时仅激活37亿,大幅降低推理资源消耗。 非盈利Allen AI的OLMo系列以高透明度著称,虽非性能最强,但其对训练数据和代码的公开为社区提供了宝贵的蓝图。OLMo 2采用Post-Norm(归一化层置于注意力与前馈模块之后)搭配QK-Norm(针对查询和键的归一化),提升训练稳定性,区别于主流的Pre-Norm设计。 谷歌的Gemma系列(尤其是Gemma 3)强调滑动窗口注意力机制,限制每个查询的上下文范围,大幅降低KV缓存内存,用局部注意力替代全局注意力,保持性能几乎不变。Gemma 3还采用了Pre-Norm与Post-Norm混合归一化,兼顾训练稳定性与效率。此外,Gemma 3n针对移动设备进行了优化,利用分层嵌入(PLE)技术降低内存占用,并引入了Matryoshka Transformer结构,实现模型切片灵活部署。 Mistral Small 3.1以较小KV缓存和更少层数提升推理速度,虽舍弃滑动窗口注意力,但性能在多场景优于Gemma 3,凸显宽模型在推理速度上的优势。 Llama 4 Maverick采用MoE架构但激活专家更少且规模更大,整体与DeepSeek V3类似,体现MoE在2025年的流行趋势。 Qwen3系模型涵盖从0.6B到235B参数的密集和MoE版本,兼顾易用性和推理效率。其小型模型适合本地运行,MoE版本激活参数比例低,提升大规模应用的推理性价比。Qwen3 Next在较小规模下引入更多专家和共享专家,并采用混合门控DeltaNet注意力,实现超长上下文支持(262k tokens)和多步预测,提升训练速度和推理效率。 SmolLM3以3B参数提供优异性能,采用NoPE(无显式位置编码)策略,增强对长序列的泛化能力,减少对位置编码的依赖。 Kimi K2体量达到1万亿参数,基于DeepSeek V3架构扩展,采用Muon优化器替代AdamW,训练损失曲线平滑且下降迅速,性能媲美领先私有模型。最新的Thinking版本将上下文扩展至256k tokens,提升推理能力。 OpenAI最新开源的gpt-oss系列(20B和120B)采用类似Qwen3的MoE设计,结合滑动窗口注意力和注意力偏置,架构更宽而较浅,适合高吞吐量推理。其“注意力汇聚”机制(attention sinks)通过头偏置实现长上下文稳定性。 xAI的Grok 2.5作为去年旗舰模型,采用少量大专家,并引入始终激活的共享专家模块,与近期多专家模型设计呼应。 GLM-4.5通过先密集后稀疏的层序设计提高MoE模型稳定性,性能优于Claude 4 Opus,接近OpenAI和xAI的顶尖水平。 MiniMax-M2在保持高性能的同时回归全注意力,摒弃线性注意力的准确性不足问题,采用每层独立QK-Norm,参数激活比例更低,体现稀疏MoE架构的新趋势。 2025年线性注意力迎来复兴,Qwen3-Next和Kimi Linear将轻量级线性注意力与传统全注意力混合,兼顾效率与性能。Kimi Linear通过通道级门控提升长上下文推理能力,在速度和准确性之间取得平衡。 Allen AI最新的Olmo 3在保持透明度的基础上扩展规模,继续采用Post-Norm和滑动窗口注意力,支持64k上下文,表现稳定。 DeepSeek V3.2引入稀疏注意力机制,与Mistral 3大型MoE模型架构相似,后者增加视觉编码器支持多模态,优化推理速度,体现MoE架构的持续进化。 综观2025年旗舰开源大模型,核心仍是Transformer,但细节创新如多头潜在注意力、Mixture-of-Experts、滑动窗口与线性注意力混合、归一化层位置变换等,推动模型在性能和推理效率间取得更优平衡。MoE架构热度持续攀升,模型规模与激活参数数目被巧妙控制,实现大规模知识整合与高效推理。长上下文支持成为新标准,优化训练稳定性和推理速度的技术层出不穷。 未来,架构创新与训练工艺的协同将持续塑造大语言模型的发展路径,开源社区的透明度和多样化探索为行业注入活力。 magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

3. 2025 小米“人车家全生态”合作伙伴大会于今日举行!小米生态全球累计开发者数量达 120 万,海外月活用户数达 5.5 亿,应用全球月分发 11 亿,游戏付费用户数 1800 万,内容与服务订阅用户 1300 万。今天还发布了开源大模型MiMo-V2-Flash,号称可以媲美DeepSeek V3.2,#小米发布最新MiMo大模型#,MiMo-V2-Flash 总参数 3090 亿,活跃参数 150 亿,采用专家混合架构 (MoE)。有兴趣的朋友可以试试体验。

4. 为什么都说 Claude 贵,但又都说好?⸻这几天准备把Openclaw分层引入不同的token调用,发现大家一致觉得 Claude 最强悍,但价格又确实贵。发现最直接的原因就是,Claude 选择的是 Dense 架构,而不是 MoE 架构。当前主流大模型,大致分两种架构:1、Dense(稠密模型):每一次推理,模型的全部参数都会参与计算。2、MoE(专家混合):模型里有很多专家,每个 token 只激活一小部分。Claude一直是 Dense 架构,而大家熟悉的Deepseek V3、GPT-4、Grok、Gemini等等几乎都是 MoE架构。那 Claude 为什么不选 MoE?因为 Anthropic 优先解决的不是“规模问题”,而是: • 推理是否稳定 • 行为是否可预测 • 长对话中是否一致 • 对齐是否可控而这些,Dense架构 天然更有优势。MoE 在工程上非常聪明,但它引入了一个额外的不确定性: • 不同专家学到不同风格 • 路由本身是隐含决策层 • 行为分布更离散在复杂、长链条推理里,这些差异会被放大。MoE 在解决“规模和成本”,Claude 在解决“连续性和可靠性”。虽然说这是一个技术取舍问题,但也说明了“贵有贵的道理”。。。

5. #一条音频告别2025##微博声浪计划# 小米天才少女罗福莉首次登场,发布开源大模型MiMo-V2-Flash。该模型采用MoE架构,激活参数150亿,推理速度比Claude 4.5快2倍,支持256K长上下文。罗福莉曾拒绝天才标签,小米借其强化AI布局,引发行业关注与讨论。 种斌Marco的微博音频

6. #小米发布最新MiMo大模型#小米在2025年12月16日深夜闪电开源了全新MoE大模型MiMo-V2-Flash,凭借3090亿总参数和150亿活跃参数的“瘦身”设计,一举实现150 token/秒的极速响应和百万token输入0.1美元的超低成本,迅速引发行业热议。小米MiMo-V2-Flash的核心突破在于平衡性能与效率。它采用专家混合架构(MoE),每次推理仅激活150亿参数,通过混合注意力机制(128窗口滑动+全局注意力)支持256K长上下文,适用于多轮复杂任务。实测生成速度达150 token/秒,用户反馈“问题发出即出答案”,延迟低至毫秒级,成本仅为闭源模型的1/10。性能上,该模型在多项基准测试中与头部开源模型DeepSeek-V3.2持平甚至超越。技术负责人罗福莉(前DeepSeek核心研究员)的贡献是关键。她主导的自研R3路由重放技术解决了MoE模型强化学习的稳定性问题,确保训练到150步仍保持平稳。#老张聊科技# 小米发布最新mimo大模型

7. 【当满屏都是新模型,你该选哪个?Qwen3.5 27B vs 35B-A3B 硬核实测】快速阅读: Qwen3.5同时发布了27B稠密模型和35B-A3B的MoE模型,引发社区关于“哪个更好”的激烈讨论。简单结论是:27B更聪明但更慢,35B-A3B快5倍但“智商”约等于10B稠密模型。16GB显存用户两边都够呛。---这两天模型发布的密度让人喘不过气。有网友说“模型真是下雨一样往下掉”,倒也形象。先说结论:27B稠密模型在智能水平上确实更强。但问题来了,有人在RTX 3090上测出的数据是:35B-A3B跑100 t/s,27B只有20 t/s。五倍的速度差距,足以让很多人重新考虑“更聪明”到底值多少钱。社区里流传着一个估算MoE模型智能水平的公式:√(总参数 × 激活参数)。按这个算法,35B-A3B大约相当于10B稠密模型的智力水平。有观点认为这个公式源自2023年Mixtral时代,现在的MoE架构已经进化太多,公式越来越不准了。但即便往乐观了估,35B-A3B也就是个20B的水平,还是比27B差一截。有人提了个有意思的视角:如果你的主要时间花在等待工具调用返回结果,或者花在给模型打补丁、写各种guardrail上,那速度优势就被抵消了。这话说得挺实在。关于MoE为什么“亏”参数,有网友解释得很清楚:稠密模型整个网络都参与计算,参数之间能产生复杂的干涉模式;MoE每次只激活一小部分专家,虽然“虚拟网络”更大,但失去了那些干涉效应。某种程度上,thinking模式可能对MoE更友好,因为推理过程给了模型机会去调用更多专家。硬件配置方面的反馈比较现实。有网友在RTX 5080 16GB显存上跑27B的Q4_K_M量化,只有7 t/s出头,手动分配55层到GPU后勉强拉到13.5 t/s,但上下文必须限制在16K。还有人直接说“16GB显存对这俩模型都不太友好”。有观点认为16GB显存大概只能跑“90 IQ”难度的任务,24-32GB才是正常人类智能水平。虽然是“napkin math”,但这个直觉可能没错。一个4060笔记本用户分享了自己的配置:8GB显存加32GB内存,跑35B-A3B的MXFP4量化,64K上下文能到29 t/s。这说明MoE在混合offload场景下确实有优势,因为每次只需要把激活的3B参数搬进显存。有个常见误解需要澄清:MoE并不是每轮对话选一次专家就完事了。每一层、每一个token都在重新路由。Mixtral论文里那张彩色的专家激活图应该能说明问题。最后一个数据点:有测试显示27B与122B-A10B的差距,比27B与35B-A3B的差距还小。稠密模型的效率优势在这个参数规模上体现得很明显。---简评:16GB显存用户今天的处境,像极了站在奶茶店发现中杯大杯都超预算的人。 27B太聪明但跑不动,35B跑得欢但不够聪明,两边都是将就。有人说“16GB只能跑90 IQ任务”,虽是玩笑,却戳中真相:不是模型不够好,是你的显卡配不上你的野心。 最讽刺的是那个4060笔记本用户的方案——8G显存+32G内存跑MoE,等于承认显卡已经沦为配角。当模型像雨点一样砸下来,真正的焦虑不是“选哪个”,而是“我的硬件还能撑多久”。显存焦虑,才是这个时代的新型消费主义陷阱。---www.reddit.com/r/LocalLLaMA/comments/1re72h4/qwen35_27b_better_than_35ba3b/

8. 全球AI开发者新宠!阶跃星辰Step 3.5 Flash,两天登顶OpenRouter趋势榜

9. 【Claude 懂你,Codex 出活:一个架构差异,解释了两类程序员的不同选择】快速阅读: Claude 的 Dense 架构让它在模糊意图下仍能输出连贯、有“灵魂感”的代码,适合 Vibe Coding 和原型迭代;Codex 的 MoE 架构让它在精准 Bug 修复和大规模重构中更快、更准。两者的差异不只是性能高低,而是底层设计哲学不同。---同一件事:写代码。同一个提示。Claude 会追问你“这个感觉更偏 minimalist 还是 feature-rich”,Codex 已经改完第三个文件了。这不是谁更聪明,是两台机器被造出来干不同的活。Dense 架构的核心特征是每次推理时所有参数都参与计算。Claude 对每个 token 的处理像全脑激活,这带来极强的上下文连贯性——模糊的意图进去,风格统一、逻辑完整的东西出来。Andrej Karpathy 2025 年提出 Vibe Coding,说的就是用自然语言描述“氛围”让 AI 自主生成产品原型。这个场景里,Claude 的全参数激活不是冗余,是必要条件。MoE 在高度模糊的创意任务中偶尔会显出“拼凑感”,不同专家各干各的,连贯性容易断。Codex 走的是另一条路。MoE 把前馈网络拆成多个专家子网络,每个 token 只激活其中少数几个,路由器动态决定找谁。总参数可以做到万亿级,激活参数却只有 Dense 的几分之一。对生产环境 Bug 修复来说,这个设计几乎是天然契合的:看到 Python 报错,激活 Python 专家;看到前端状态管理问题,激活对应模块。精准、快、成本低。有观点认为,这种分工不只是架构差异,更是训练哲学的分叉。Anthropic 的 Constitutional AI 训练 Claude 做“有益、无害、诚实”的助手,结果它更像一个资深产品设计师;OpenAI 对 Codex 重度 fine-tune 于代码语料,结果它更像一个不废话的工程师。社区里流传的说法直接:Claude 会跟你聊天,Codex 直接出活。多数开发者现在的实际做法是混用:Claude 负责 vibe 脑暴和架构规划,Codex 负责落地执行和循环修复。Cursor、Windsurf 这类多模型 IDE 的流行,某种程度上就是在把这个工作流产品化。未来 Hybrid MoE + Dense 混合架构或许会模糊这条线。但现在这个问题还没解决:当你用一个工具同时追求“懂我”和“出活”,它到底在优化哪个?ref: x.com/berryxia/status/2038208589198942226#AI创造营##人工智能#

10. 美团LongCat又开源Thinking-2601,这次广度推理扩展,有点意思。。

11. #千问Qwen3.5大模型发布#千问 Qwen3.5 是采用极致稀疏 MoE 架构在保持超强性能的同时,显存占用降低 60%,推理效率大幅提升,部署成本显著下降。模型支持最高 256K 超长上下文,让长文本处理变的更加的轻松有效率了!原生多模态统一也是Qwen3.5的特点之一,也是目前国内外大模型的发展的主要趋势,模型在图文、视频理解能力全面升级,精准解析图表、文档与复杂视觉内容。实现了一个入口实现多种属性。Qwen3.5对于中小企业特别友好, 很大程度上降低了企业运营成本,可以让中小企业得到高效、普惠、全能的运营工具。不再因为高昂的费用而排斥企业去追逐AI。#过个有AI年##HOW I AI#

12. 超DeepEP两倍!无问芯穹FUSCO以「空中变阵」突破MoE通信瓶颈,专为Agent爆发设计

13. 昨天刚说了要注意deepseek v4发布,今天就有用户看到灰度测试了。估计是随机选择的用户,没有覆盖全量群体。获得测试权限的用户可以看到三个模式切换入口,感觉跟豆包一样,有快速模式、专家模式、视觉模式。v4采用MoE混合专家架构,总参数量1万亿,单轮推理激活参数量320亿。对比v3,推理速度提升2倍,显存占用降低50%。现在还没正式官宣是不是v4。太吊胃口了。

14. 【推理效率狂飙19倍!#千问3.5成本仅为谷歌大模型5%#】千问3.5凭什么做到成本仅为谷歌的1/18?答案是底层架构的全面革新。全新MoE架构,3970亿参数仅激活170亿,推理吞吐量最高提升19倍,部署显存降低60%。技术上的“斤斤计较”,才有了价格上的“大大方方”。#有AI的春节有什么不一样# 引力科普的微博视频

15. WWW 2026|让MoE路由拥有「记忆」:RMS-MoE用检索记忆协同实现更高效专家调度

16. #微博声浪计划##听见微博# DeepSeek创始人梁文锋确认,DeepSeek V4将于2026年4月下旬发布,是中国首个去英伟达化的万亿级大模型,适配华为昇腾、寒武纪等国产芯片。该模型采用MOE架构,响应速度较V3提升35倍,支持百万级上下文窗口,代码生成质量内部测试超Claude Opus和GPT系列。 叶锦川的微博音频

17. 【#零态洞察百态##小米推出在线AI聊天服务#】小米发布 Xiaomi MiMo-V2-Flash 开源 MoE 模型,总参数量 309B,活跃参数量 15B,专为智能体 AI 设计,专注于快。#卢伟冰回应小米自研大模型开源上线##小米新模型跑分曝光#小米推出了一个在线 AI 聊天服务 Xiaomi MiMO Studio,用户可以在其中体验 Xiaomi MiMo-V2-Flash。该服务支持深度搜索和联网搜索。(IT之家)

18. 做了一天测试在ultra7 270kplus 64G 4800内存 5070ti的资源下 gemma31b 最好每秒6token/sgemma26b 最好每秒45token/sqwen3.6 35b 最好每秒77.66token/s这说明千问这一套MoE模型量化技术比较适配低显存环境。

19. 阿里新一代模型曝光 黄心怡 财联社 据《科创板日报》,在全球最大AI开源社区HuggingFace的开源项目页面中,最新出现Qwen3.5并入Transformers的新PR(提交代码合并申请)。这意味着阿里千问新一代基座模型Qwen3.5或发布在即。相关信息透露,千问3.5采用了全新的混合注意力机制,并且极有可能是原生可实现视觉理解的VLM类模型。有开发者进一步挖掘出,Qwen3.5或将开源至少2B的密集模型和35B-A3B的MoE模型。这一最新动态印证了此前有消息称Qwen3.5将在春节期间开源。

20. 速度压倒准确性?OpenAI撤回ChatGPT“模型路由器”功能,响应迟缓引发用户流失

21. 科技巨头集体押注自研芯,AI芯片战场正加速向推理端迁移

22. MoE路由拥有「记忆」

23. ACL 2026 | Xingchen AGI

24. ICML 2026 | 打破「回音室」效应!人大孟澄团队&华为提出集成剪枝视角下的MoE新架构

25. BEAM二元专家掩码

26. 认知自适应混合专家模型

27. MOE

28. (2026|LMU & UCLA,无路由/TopK/Softmax MoE,AoE,ReMoE,ReLU,专家偏置和全局后处理阈值,token/专家负载均衡)无路由 MoE

29. Stanford cs336 lecture 4

30. 混合专家模型(Mixture-of-Experts,MoE)深入解析

31. 大模型的“智能调度官”

32. Mixture of Experts(MoE)

33. ACL 2026 | RouteMoA

34. 玻璃盒中的精密博弈

35. 2026年硬核拆解

36. 谷歌GLaM团队扔出王炸!64B参数拆成64个专家,效果比GPT-3还猛,源码原来这么写

37. 稠密模型 vs MoE 模型

38. LLM推理优化-续写MOE故事DeepSeek MoE

39. 阿里Qwen3.5-32B MoE架构深度实战

40. DeepSeek MoE背后隐藏的硬核真相

41. 月之暗面K3推理速度暴增300%!MoE+KDA架构揭秘

42. LLM本地部署进阶篇

43. DAC2026 | ExpertFlow

44. MoE推理耗时真相

45. 清华联合混元斩获MLSys 2026 MoE模型推理优化竞赛冠军,NPU推理提速4.1倍

46. DWDP

47. 10.9倍推理加速!OmniMoE百万级原子专家动态组装实现极致性能

48. 三项世界第一!流形空间提出世界模型MoE架构

49. ACL 2026 | 大模型为何“视而不思”?浙大×阿里揭秘MoE分心机制

50. MoE-ACT让机器人策略从单任务走向多任务通用

51. CVPR 2026 | MoECLIP 融合 MoE 与 PEFT

52. Mistral AI重磅开源!Mistral Small 4

53. CS-MoE(原Self-MoE)

54. MoE模型总结笔记

55. Mamba作者团队提出SonicMoE

56. 稀疏混合专家模型 (SMoE) 的崛起

57. 程序员应该熟悉的概念(5)MoE

58. 为什么大模型都在挤"MoE"这条路?混合专家模型到底是什么

59. MoE架构真的是大模型的未来吗?现在用得怎么样了?

60. 大模型架构革命

61. MoE 混合专家架构真的是大模型未来方向吗?为什么这么多厂商都在用?

62. AI大模型系列第六站

63. 为什么现在的顶级大模型都在卷 MoE?

64. 一文读懂大模型里的混合专家 MoE

65. 大模型自学笔记・番外四

66. MoE

67. 深入浅出MOE模型

68. 白话大模型 MoE 架构

69. [从零开始学大模型]-MOE混合专家模型

70. Transformer架构演进与MoE混合专家模型技术解析

71. 【AI速探·说明书】第23期|MoE(混合专家模型)

72. AI-MoE模型革命与硬件边界的重新划定

73. AI产品经理必知

74. DeepSeek-V3 技术深度解析

75. Gemma 4 26B MoE对决Claude Opus 4.6 两周深度实测 开发者该选本地AI

76. 英伟达扔出核弹!30B-MoE单卡就能跑,多模态智能体吞吐量狂飙9倍,开发者彻底坐不住了

77. Kimi K2.6 智能路由机制:AI Agent 群体协作的核心引擎

78. Job interview:MoE 后训练难点清楚吗?

79. RouteMoA 解读:用 86M 小模型省下 81% 的多模型推理成本

80. Qwen3.5 MoE vs 标准版:OpenClaw部署必看!成本省3-5倍?

81. 告别路由漂移!LLaVA-DyMoE:用动态MoE破解大模型持续学习的“令牌困境”

82. 把增量学习扩展到300+任务!解决灾难性遗忘的双层路由MoE新架构 【计算机视觉论文解读】

83. MoE 模型还不够稀疏?动态专家剪枝让大模型推理再次“瘦身”

84. JIUTIAN Research | EMNLP 2025 精选论文导读:MoE如何提质增效

85. DeepSeek-V4测评:开源MoE模型深度解析

86. (2026|复旦,多头专家混合/MH-MOE,特征切片,头私有/分片路由和聚合)多头注意力是 Transformer 中灾难性遗忘的根源

87. NeurIPS 2024 | Read-ME 把 Dense LLM 变成 MoE 还能推理提速

88. MoE 推理的致命陷阱:算力没超支,带宽和倾斜把你拖垮

89. AI算法:MoE混合专家架构

90. GLM5技术洞察:MoE架构突破、256K长上下文与多模态效率革命

91. ICML 2026 | 打破「回音室」效应!人大孟澄团队&华为提出集成剪枝视角下的MoE新架构

92. 稠密模型编码更精准,Qwen-Coders却执意用MoE

93. moe架构的post-training难点与经验分享

94. Mixture-of-Experts推理优化新方案:解锁大模型边缘部署新路径

95. MoE 优化方案知识分享:从 Token 路由到昇腾/MindSpeed 落地

96. CVPR 2026 | 让MoE真正学会“怎么分工”:SMoES用软模态机制让专家之间实现精准协作

97. 告别 Router Replay:利用 Online IcePop 解决 MoE 模型 RL 训练的不稳定性

98. 什么场景用MoE 模型(Qwen3.6-35B-A3B与 Qwen3.6-27B)分析对比!

99. 22岁小伙逆推Mythos架构:MoE和注意力机制借鉴DeepSeek始末

100. 砍掉一半专家还不丢性能!给训练好的MoE大模型做推理加速 【大模型优化】【MoE】

101. 手撕MOE

102. 一文图解混合专家模型 (MoE)

103. Meta新方案用专家激活提速MoE

104. 《CS336 Spring 2025 Lecture 4:MoE》学习笔记

105. 一文图解混合专家模型 (MoE) 深度指南

106. LLM篇(一) MOE结构的理解

107. MoE 架构演进史:从 Switch Transformer 到 DeepSeek V4 的 1.6 万亿参数

108. ICLR 2026 | 不是所有MoE模型都适合专家卸载!揭示MoE模型路由一致性的秘密

109. MoE架构揭秘

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章