国产大模型在MoE架构领域实现局部反超
06-02 00:30
精选参考来源
新浪微博 2025-12-17
抖音 2026-02-14
来源
精选参考来源
1. #小米发布最新MiMo大模型#小米在2025年12月16日深夜闪电开源了全新MoE大模型MiMo-V2-Flash,凭借3090亿总参数和150亿活跃参数的“瘦身”设计,一举实现150 token/秒的极速响应和百万token输入0.1美元的超低成本,迅速引发行业热议。小米MiMo-V2-Flash的核心突破在于平衡性能与效率。它采用专家混合架构(MoE),每次推理仅激活150亿参数,通过混合注意力机制(128窗口滑动+全局注意力)支持256K长上下文,适用于多轮复杂任务。实测生成速度达150 token/秒,用户反馈“问题发出即出答案”,延迟低至毫秒级,成本仅为闭源模型的1/10。性能上,该模型在多项基准测试中与头部开源模型DeepSeek-V3.2持平甚至超越。技术负责人罗福莉(前DeepSeek核心研究员)的贡献是关键。她主导的自研R3路由重放技术解决了MoE模型强化学习的稳定性问题,确保训练到150步仍保持平稳。#老张聊科技# 小米发布最新mimo大模型
新浪微博 2025-12-17 00:00:00
2. 这次春节AI大战,国产模型与国产芯片第一次,双向奔赴! #春节世界观察 #新年囤点专业货 #燃起来了大国重器 #大咖观察 #红衣聊AI
抖音 2026-02-14 00:00:00
3. #DeepSeekV4还有多远#之前V4一直传4月发布,现在专家模式直接用上疑似V4雏形的MoE新架构,主打深度推理解决复杂问题,和快速模式做了明确场景分层。 看DeepSeek最近节奏:1月Engram条件记忆、2月DualPath推理框架,3月还搞了V4 Lite测试,3月底宕机就是在做算力扩容。种种迹象表明V4大概率4月中下旬登场,会补齐多模态短板,整合双模式优势。
新浪微博 2026-04-09 00:00:00
4. #一条音频告别2025##微博声浪计划# 小米天才少女罗福莉首次登场,发布开源大模型MiMo-V2-Flash。该模型采用MoE架构,激活参数150亿,推理速度比Claude 4.5快2倍,支持256K长上下文。罗福莉曾拒绝天才标签,小米借其强化AI布局,引发行业关注与讨论。 种斌Marco的微博音频
新浪微博 2025-12-18 00:00:00
5. #千问Qwen3.5大模型发布#阿里在除夕夜甩出了个王炸——全新大模型千问Qwen3.5开源了,看完参数我直接好家伙: 用了Mamba混合注意力+MoE稀疏专家架构,总参数3970亿,但每次推理只激活170亿,相当于“小身材干大活”,显存占用直接砍半还多,长文本处理速度直接起飞。终于从纯文本模型进化成原生多模态,以后图文交互、复杂任务处理更丝滑。性能直接对标顶级开源产品,关键是部署门槛低了一大截,不管是企业还是个人开发者,都能轻松玩起来。 与其说是发布新模型,不如说是把大模型的“技术普惠”又往前推了一大步。
新浪微博 2026-02-16 00:00:00
6. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?
知乎 2026-02-16 00:00:00
7. 其实虽然我们不是做 LLM 的,但是因为 AI 眼镜要用,所以我们好歹也折腾了有一年了。某些技术趋势,可以先预测一下:1 MoE 是答案。2 专家模型之间的沟通是向量,所以最终,所有模态的向量都会统一(至少在开源世界)。3 专家模型的规模可以更小,能力还会更强。4 最终 MoE 会变成分布式模型。不同模型分布在不同的网址,但是可以统一思考。互联网的开源世界会拥有一个能力极强但是延迟比较高的高度能力的思维模型。5 因此,开源世界会有统一的模型之间的向量沟通标准,做到书同文。6 因此,专家模型的训练会高度专业化。一个专家模型可能就能支持类似今天 Minimax 这种公司活下去。7 因此,虽然今天大家关注电力需求,而网速的需求被忽视了,需要指数级的上升。8 会有一天,模型之间消耗的流量,会超越人类。9 因此,开源模型不可能被闭源打败。10 所以深度思考的 LLM 和要求低延迟的 SLM 会分离。11 端侧 SLM 的数量会爆炸,对应的嵌入式 SLM 芯片需求远远超越今天英伟达供给的显卡。12 这种 SLM 本地芯片的价格,会非常非常便宜(几美金)。13 最终,本地加速算力和云端加速算力会融合。14 LLM 和 Crypto 会合流,用区块链和社区治理机制解决这种技术架构下所有模型的意见分歧,最终解决决策问题。这 14 条简单说就是三个技术方向: 1 The Decentralized AI(去中心化 AI ) 2 The Intelligence on the Edge (边缘智能) 3 Community as MoE, Governance as DAO( DAO 治理下的专家模型社区) 在这种未来下,谈论 Copyright ,甚至任何版权保护都是可笑的。5 年后,命中 60% 算合格,80% 值得庆祝。不及格,我裸奔。ps我不是娱乐财经篮球博主。。。我也是扩招前的一本提前录取计算机专业毕业的服务了多年 500 强企业的互联网业务架构师。模型训练我没有能力训练的更好,但是当模型训练面临瓶颈,要在计算机和互联网工程层面想办法的时候,那我就很熟悉了。当然,也只是一个预测而已,对错与否?Time will tell。
新浪微博 2025-12-22 00:00:00
8. #deepseek为什么影响力大# 说实话,DeepSeek能火成这样,真不是偶然!最关键的是它把 “高性能 + 超低价” 做到了极致,直接打破了行业认知。别家训练大模型动辄几亿美金,它V3模型才花约600万美元,效果却能对标顶尖闭源模型,推理成本更是低到离谱。而且它特别大方,直接全栈开源,免费商用,代码和训练方法都公开,全球开发者都能拿来用、二次开发。这波操作直接拉低AI门槛,催生了超多应用,社区越做越大。再加上技术硬实力能打,MoE架构稀疏激活,算力分配更智能,长文本处理、代码能力都很强。中文理解更是精准,贴合国内用户习惯。可以说,它靠技术创新、极致性价比和开放生态,成了全球AI圈的黑马,影响力自然越来越大。
新浪微博 2026-05-25 00:00:00
9. #微博声浪计划##听见微博# DeepSeek创始人梁文锋确认,DeepSeek V4将于2026年4月下旬发布,是中国首个去英伟达化的万亿级大模型,适配华为昇腾、寒武纪等国产芯片。该模型采用MOE架构,响应速度较V3提升35倍,支持百万级上下文窗口,代码生成质量内部测试超Claude Opus和GPT系列。 叶锦川的微博音频
新浪微博 2026-04-11 00:00:00
10. 【梁文锋:DeepSeek V4将于4月下旬正式发布】 DeepSeek创始人梁文锋近日在内部沟通中透露,新一代旗舰大模型DeepSeek V4将于4月下旬正式发布。 核心信息:采用万亿参数MoE混合专家架构,推理时仅激活370亿参数,速度提升35倍、能耗降低40%;百万级上下文窗口,首次实现与华为昇腾等国产芯片深度适配;近期已上线“快速模式”与“专家模式”作为V4发布前的预热。阿里巴巴、字节跳动等国内科技巨头已预订数十万片新一代AI算力芯片,计划通过云服务提供新模型,相关芯片价格近期已上涨约20%。 观察:DeepSeek V4的国产芯片适配标志着中国AI产业在“去CUDA化”道路上迈出关键一步,而V4的正式登场也有望在激烈的国产大模型竞争中掀起新一轮技术竞赛。 #DeepSeek #梁文锋 #国产大模型 #AI芯片#
新浪微博 2026-04-10 00:00:00
11. 体验完智谱刚刚发布的 GLM-5,我终于明白它为什么让硅谷猜破了头
微信公众号 2026-02-12 00:00:00
12. 【推理效率狂飙19倍!#千问3.5成本仅为谷歌大模型5%#】千问3.5凭什么做到成本仅为谷歌的1/18?答案是底层架构的全面革新。全新MoE架构,3970亿参数仅激活170亿,推理吞吐量最高提升19倍,部署显存降低60%。技术上的“斤斤计较”,才有了价格上的“大大方方”。#有AI的春节有什么不一样# 引力科普的微博视频
新浪微博 2026-02-16 00:00:00
13. #千问Qwen3.5大模型发布#真正的卷王出现了,就在刚刚,阿里正式发布全新一代大模型千问Qwen3.5-Plus。这次核心更新在于采用了Mamba混合注意力机制(SSM-Transformer) + 稀疏MoE架构,总参数3970亿但仅激活170亿参数,显存占用降低60%,推理吞吐量最高提升19倍。举个例子,传统大模型就像人工翻整墙档案,你每问一个新问题,都要把前面所有档案重新翻一遍核对关系,内容越长,翻得越慢,越到后面越卡。 纯Mamba机制则像只记档案摘要,翻得极快,但细节容易丢,关键信息可能漏看。 而Qwen3.5-Plus的混合注意力,就是摘要+精准抽查一起上:速度跟得上,细节不丢失,长文本、复杂推理又快又准。 这才是真·技术内卷,大模型体验又要上一个台阶了。#how i ai##过个有ai年# 千问qwen3.5大模型发布
新浪微博 2026-02-16 00:00:00
14. 2026开年王炸:Qwen3.5震撼发布,一条视频讲清所有玩法...
哔哩哔哩 2026-02-22 00:00:00
15. #千问Qwen3.5大模型发布# 刚刚,千问正式官宣发布 Qwen3.5,并推出Qwen3.5系列的第一款模型 Qwen3.5-397B-A17B 的开放权重版本。作为原生视觉-语言模型,Qwen3.5-397B-A17B 在推理、编程、智能体能力与多模态理解等全方位基准评估中表现优异,助力开发者与企业显著提升生产力。该模型采用创新的混合架构,将线性注意力(Gated Delta Networks)与稀疏混合专家(MoE)相结合,实现出色的推理效率:总参数量达 3970 亿,每次前向传播仅激活 170 亿参数,在保持能力的同时优化速度与成本。我们还将语言与方言支持从 119 种扩展至 201 种,为全球用户提供更广泛的可用性与更完善的支持!#HOW I AI##过个有AI年#
新浪微博 2026-02-16 00:00:00
16. Deepseek V4 Pro:1.6T总参数,49B激活参数,1M上下文 #DeepseekV4# 我们推出了 DeepSeek-V4 系列的预览版本,包含两款强大的混合专家(MoE)语言模型——DeepSeek-V4-Pro(参数规模 1.6 万亿,激活 490 亿)和 DeepSeek-V4-Flash(参数规模 2840 亿,激活 130 亿)——两者均支持一百万个 token 的上下文长度。DeepSeek-V4 系列在架构和优化上引入了若干关键升级:混合注意力架构:我们设计了一种结合压缩稀疏注意力(CSA)和深度压缩注意力(HCA)的混合注意力机制,极大提升了长上下文效率。在 100 万 token 的上下文设定中,DeepSeek-V4-Pro 相比 DeepSeek-V3.2,单 token 推理所需的 FLOPs 仅为前者的 27%,KV 缓存占用也仅为 10%。流形约束超连接(mHC):我们引入 mHC 来强化传统的残差连接,在保持模型表达能力的同时,增强了信号跨层传播的稳定性。Muon 优化器:我们采用 Muon 优化器,以实现更快的收敛速度和更强的训练稳定性。我们在超过 32 万亿个多样化且高质量的 token 上对两个模型进行了预训练,随后采用了一套全面的后训练流程。后训练采用两阶段范式:先通过监督微调(SFT)和基于 GRPO 的强化学习,独立培养领域专属专家;再通过在线策略蒸馏进行统一模型整合,将不同领域的独特能力融合到单个模型中。DeepSeek-V4-Pro-Max 是 DeepSeek-V4-Pro 的最大推理努力模式,它大幅提升了开源模型的知识能力,稳固确立了其作为当前最佳开源模型的地位。该模型在编程基准测试中取得了顶尖表现,并在推理和智能体任务上显著缩小了与领先闭源模型的差距。另一方面,DeepSeek-V4-Flash-Max 在获得更大的思考预算时,推理性能可与 Pro 版本相媲美,但其较小的参数规模自然使其在纯知识任务和最复杂的智能体工作流上稍逊一筹。
新浪微博 2026-04-24 00:00:00
17. 市值近600亿,大模型公司上市了! #AI #智谱ai
抖音 2026-01-10 00:00:00
18. DeepSeek悄悄地又发布了一份重磅报告。他们提出了 Engram,这是一种将查找表记忆与上下文感知门控融合在一起的记忆技术,并将其添加到他们的模型中。因此,无需强制密集层每次都对事实进行编码和重新计算。在相同的浮点运算次数下,MoE 的容量可以从「存储」转向「推理 + 长上下文」,从而提高知识水平和整体性能
新浪微博 2026-01-14 00:00:00
19. #科技先锋官# 国际 AI 巨头正在联手筑起算力高墙!CoreWeave 集齐 OpenAI、Google、Meta、Anthropic 四大巨头,深度绑定 GPU 资源,形成技术垄断联盟。他们抱团不是为了技术共赢,而是为了锁死算力、卡住后来者的脖子,不过外部围堵越紧,国产自主化步伐越快。从昇腾、寒武纪等芯片突破,到 MoE 高效模型架构创新,再到 “东数西算” 算力底座建设,国产 AI 正在走出一条属于自己的突围之路。#微博超有用视频大赛##AI创造营##上微博涨知识##科普大作战# 种斌Marco的微博视频
新浪微博 2026-04-12 00:00:00
20. 财报需求和预期全面打开,英特尔突然大涨DeepSeekV4 MIMO也来了:拼谁把算力榨干 | 模型压缩 |CPU|GPU
哔哩哔哩 2026-04-25 00:00:00
21. DeepSeek V4这波价格战,把整个大模型行业的水温彻底打乱了。百万tokens输入0.2元,输出2元——不到GPT-5.5的1/70。国产化+MoE架构,直接脱离英伟达生态。有人说是赔本赚吆喝,但换个角度:DeepSeek在逼整个行业重新算账——堆算力的故事,还能讲多久?2026年下半年昇腾950量产,Pro版价格还要再降。到那时候,闭源厂商的利润空间还剩多少?价格屠夫背后,真正洗的是整个AI赛道。#DeepSeekV4 价格屠夫#
新浪微博 2026-04-24 00:00:00
22. #千问Qwen3.5大模型发布# 阿里“年夜饭”来了,开源全新一代大模型千问Qwen3.5-Plus。 总参数为3970亿,激活170亿,性能超过万亿参数的Qwen3-Max模型,部署显存占用降低60%,推理效率大幅提升,最大推理吞吐量可提升至19倍。 在推理、编程、Agent智能体等全方位基准评估中均表现优异,并在视觉理解能力的权威评测中斩获数项性能最佳。 支持长达2小时(1M token上下文)的视频直接输入,适用于长视频内容分析与摘要生成。#过个有AI年#
新浪微博 2026-02-16 00:00:00
23. #DeepSeek v4 百万上下文# 直接就发布了,这次太炸裂,又是行业重磅!DeepSeek-V4已经正式上线并开源,其核心特点如下:拎几个重点来聊聊:1、百万上下文标配:Pro与Flash双版本均原生支持1M token超长上下文。2、领先性能:Agent能力、世界知识与推理性能达国内与开源领域领先,Agentic Coding性能登顶开源模型。3、架构革新:创新采用基于token维度的动态压缩与DSA稀疏注意力技术,大幅降低算力与显存消耗。4、双版本策略:推出Pro版(1.6T参数,49B激活)与Flash版(284B参数,13B激活)。5、开源生态:同步开源模型权重,并已完成对华为昇腾等国产芯片的深度适配。#DeepSeekV4发布##DeepSeekV4和GPT5.5谁更强#
新浪微博 2026-04-24 00:00:00
24. GLM-5封神,智谱市值五天翻倍,中国AI火力全开了
微信公众号 2026-02-13 00:00:00
25. #一条音频告别2025##微博声浪计划# 2026年开年,DeepSeek团队发布的mHC架构以《流形约束超连接》论文引爆AI圈,创始人梁文锋领衔的这项创新直击大模型训练核心痛点。mHC架构的落地不仅依赖理论突破,更得益于DeepSeek在工程层面的智慧。mHC架构的价值远超单一技术突破,它为多模态模型、工业级智能决策等复杂场景提供了稳定支撑,更重要的是大幅降低了大模型研发门槛。mHC架构的推出标志着大模型竞争已从“堆参数、堆算力”转向底层设计的硬实力比拼。mHC架构的成功验证了“理论+工程”双轮驱动的创新模式,为下一代基础模型的演进点亮了清晰路径。 川北小哥的微博音频
新浪微博 2026-01-02 00:00:00
26. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能
抖音 2026-02-15 00:00:00
27. 小米悄摸摸的上线了mimo V2 Pro大模型专为实现世界中高强度的Agent工作场景打造,1T的总参数量,42B的激活参数。采用了创新的混合注意力架构,支持1M超长上下文。在全球权威大模型综合智能排行榜 Artificial Analysis 上,MiMo-V2-Pro 位列全球第八,国内第二准备把它接进龙虾试试#小米发布最新mimo大模型#
新浪微博 2026-03-19 00:00:00
28. 盘点一周AI大事(12月28日)|最强开源大模型易主 智谱发布最强开源大模型GLM 4.7 MiniMax发布最强开源编码模型MiniMax M2.1 阿里开源超长上下文模型QwenLong-L1.5 字节发布最强数学模型Seed-Prover 1.5 英伟达开源游戏智能体Nitrogen 阿里开源语音对话模型Fun-Audio-Chat 字节开源短剧视频模型StoryMem 字节开源关键帧视频模型DreaMontage 奥特曼认为通用人工智能已成为过去式,并提出超级人工智能定义 #前沿科技趋势发布月 #抖音知识年终大赏 #AI新星计划 #OpenAI #大模型
抖音 2025-12-28 00:00:00
29. 阿里开源 Qwen3.5-Plus!三千行代码一次生!超强性能超低价格
哔哩哔哩 2026-02-17 00:00:00
30. DeepSeek做大→Mega MoE,Tri Dao团队加快→SonicMoE
微信公众号 2026-05-04 00:00:00
31. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文
微信公众号 2026-02-11 00:00:00
32. 《The Big LLM Architecture Comparison》 七年来,GPT架构演进虽有细节改进,但核心仍相似。从GPT-2到近期的DeepSeek V3与Llama 4,模型结构变化有限,更多是细节上的优化,如从绝对位置编码到旋转位置编码(RoPE)、多头注意力向分组查询注意力(GQA)转变,以及激活函数由GELU进化为更高效的SwiGLU。 DeepSeek V3(2024末发布)及其推理版本DeepSeek R1(2025年初)引入了两大关键架构创新:多头潜在注意力(MLA)和专家混合(MoE)层。MLA通过压缩键值张量显著节省KV缓存内存,并在性能上超越GQA。MoE则通过稀疏激活少量专家,极大提升模型容量与推理效率,DeepSeek V3拥有6710亿参数,但推理时仅激活37亿,大幅降低推理资源消耗。 非盈利Allen AI的OLMo系列以高透明度著称,虽非性能最强,但其对训练数据和代码的公开为社区提供了宝贵的蓝图。OLMo 2采用Post-Norm(归一化层置于注意力与前馈模块之后)搭配QK-Norm(针对查询和键的归一化),提升训练稳定性,区别于主流的Pre-Norm设计。 谷歌的Gemma系列(尤其是Gemma 3)强调滑动窗口注意力机制,限制每个查询的上下文范围,大幅降低KV缓存内存,用局部注意力替代全局注意力,保持性能几乎不变。Gemma 3还采用了Pre-Norm与Post-Norm混合归一化,兼顾训练稳定性与效率。此外,Gemma 3n针对移动设备进行了优化,利用分层嵌入(PLE)技术降低内存占用,并引入了Matryoshka Transformer结构,实现模型切片灵活部署。 Mistral Small 3.1以较小KV缓存和更少层数提升推理速度,虽舍弃滑动窗口注意力,但性能在多场景优于Gemma 3,凸显宽模型在推理速度上的优势。 Llama 4 Maverick采用MoE架构但激活专家更少且规模更大,整体与DeepSeek V3类似,体现MoE在2025年的流行趋势。 Qwen3系模型涵盖从0.6B到235B参数的密集和MoE版本,兼顾易用性和推理效率。其小型模型适合本地运行,MoE版本激活参数比例低,提升大规模应用的推理性价比。Qwen3 Next在较小规模下引入更多专家和共享专家,并采用混合门控DeltaNet注意力,实现超长上下文支持(262k tokens)和多步预测,提升训练速度和推理效率。 SmolLM3以3B参数提供优异性能,采用NoPE(无显式位置编码)策略,增强对长序列的泛化能力,减少对位置编码的依赖。 Kimi K2体量达到1万亿参数,基于DeepSeek V3架构扩展,采用Muon优化器替代AdamW,训练损失曲线平滑且下降迅速,性能媲美领先私有模型。最新的Thinking版本将上下文扩展至256k tokens,提升推理能力。 OpenAI最新开源的gpt-oss系列(20B和120B)采用类似Qwen3的MoE设计,结合滑动窗口注意力和注意力偏置,架构更宽而较浅,适合高吞吐量推理。其“注意力汇聚”机制(attention sinks)通过头偏置实现长上下文稳定性。 xAI的Grok 2.5作为去年旗舰模型,采用少量大专家,并引入始终激活的共享专家模块,与近期多专家模型设计呼应。 GLM-4.5通过先密集后稀疏的层序设计提高MoE模型稳定性,性能优于Claude 4 Opus,接近OpenAI和xAI的顶尖水平。 MiniMax-M2在保持高性能的同时回归全注意力,摒弃线性注意力的准确性不足问题,采用每层独立QK-Norm,参数激活比例更低,体现稀疏MoE架构的新趋势。 2025年线性注意力迎来复兴,Qwen3-Next和Kimi Linear将轻量级线性注意力与传统全注意力混合,兼顾效率与性能。Kimi Linear通过通道级门控提升长上下文推理能力,在速度和准确性之间取得平衡。 Allen AI最新的Olmo 3在保持透明度的基础上扩展规模,继续采用Post-Norm和滑动窗口注意力,支持64k上下文,表现稳定。 DeepSeek V3.2引入稀疏注意力机制,与Mistral 3大型MoE模型架构相似,后者增加视觉编码器支持多模态,优化推理速度,体现MoE架构的持续进化。 综观2025年旗舰开源大模型,核心仍是Transformer,但细节创新如多头潜在注意力、Mixture-of-Experts、滑动窗口与线性注意力混合、归一化层位置变换等,推动模型在性能和推理效率间取得更优平衡。MoE架构热度持续攀升,模型规模与激活参数数目被巧妙控制,实现大规模知识整合与高效推理。长上下文支持成为新标准,优化训练稳定性和推理速度的技术层出不穷。 未来,架构创新与训练工艺的协同将持续塑造大语言模型的发展路径,开源社区的透明度和多样化探索为行业注入活力。 magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison
新浪微博 2025-12-14 00:00:00
33. 【Claude 懂你,Codex 出活:一个架构差异,解释了两类程序员的不同选择】快速阅读: Claude 的 Dense 架构让它在模糊意图下仍能输出连贯、有“灵魂感”的代码,适合 Vibe Coding 和原型迭代;Codex 的 MoE 架构让它在精准 Bug 修复和大规模重构中更快、更准。两者的差异不只是性能高低,而是底层设计哲学不同。---同一件事:写代码。同一个提示。Claude 会追问你“这个感觉更偏 minimalist 还是 feature-rich”,Codex 已经改完第三个文件了。这不是谁更聪明,是两台机器被造出来干不同的活。Dense 架构的核心特征是每次推理时所有参数都参与计算。Claude 对每个 token 的处理像全脑激活,这带来极强的上下文连贯性——模糊的意图进去,风格统一、逻辑完整的东西出来。Andrej Karpathy 2025 年提出 Vibe Coding,说的就是用自然语言描述“氛围”让 AI 自主生成产品原型。这个场景里,Claude 的全参数激活不是冗余,是必要条件。MoE 在高度模糊的创意任务中偶尔会显出“拼凑感”,不同专家各干各的,连贯性容易断。Codex 走的是另一条路。MoE 把前馈网络拆成多个专家子网络,每个 token 只激活其中少数几个,路由器动态决定找谁。总参数可以做到万亿级,激活参数却只有 Dense 的几分之一。对生产环境 Bug 修复来说,这个设计几乎是天然契合的:看到 Python 报错,激活 Python 专家;看到前端状态管理问题,激活对应模块。精准、快、成本低。有观点认为,这种分工不只是架构差异,更是训练哲学的分叉。Anthropic 的 Constitutional AI 训练 Claude 做“有益、无害、诚实”的助手,结果它更像一个资深产品设计师;OpenAI 对 Codex 重度 fine-tune 于代码语料,结果它更像一个不废话的工程师。社区里流传的说法直接:Claude 会跟你聊天,Codex 直接出活。多数开发者现在的实际做法是混用:Claude 负责 vibe 脑暴和架构规划,Codex 负责落地执行和循环修复。Cursor、Windsurf 这类多模型 IDE 的流行,某种程度上就是在把这个工作流产品化。未来 Hybrid MoE + Dense 混合架构或许会模糊这条线。但现在这个问题还没解决:当你用一个工具同时追求“懂我”和“出活”,它到底在优化哪个?ref: x.com/berryxia/status/2038208589198942226#AI创造营##人工智能#
新浪微博 2026-03-30 00:00:00
34. 最新的DeepSeek V4来了!一文带你读懂DeepSeek最新模型
微信公众号 2026-04-24 00:00:00
35. #DeepSeekV4更新了什么#DeepSeek‑V4:国产AI算力与技术双突破,以双版本架构、百万上下文、全栈国产算力三大突破,重新定义开源大模型上限。V4采用Pro+Flash双路线:Pro版1.6万亿参数、激活49亿,Agent能力超越Claude Sonnet 4.5,接近Opus 4.6非思考模式;Flash版2840亿参数、激活13亿,主打普惠,输入1元/百万tokens、输出2元/百万tokens,成本仅为GPT‑5.5的约1/20。全系标配1M上下文,依托自研DSA稀疏注意力,显存与计算量大幅下降,可一次性处理全书、大型代码库与长文档。最具行业意义的是,V4全面迁移至华为CANN框架,全流程跑在昇腾950PR,推理速度较H20提升2.87倍、能耗降40%,标志国产芯片可支撑万亿级模型训练与推理。当前Pro受产能限制高价限流,下半年量产放量后价格将下调,普惠可期。第三方测评显示,V4知识储备仅次于Gemini 3.1 Pro,与GLM‑5.1整体相当,长文本与成本优势突出;目前暂未开放原生多模态,为后续迭代重点方向。模型已深度适配OpenClaw等主流Agent,企业长文本任务成本可降约90%。从技术攻坚到算力自主,DeepSeek‑V4以长期主义推进技术普惠,不仅拉高国产AI天花板,更加速国产算力产业链商业化,为开源模型树立新标杆。#科技先锋官#
新浪微博 2026-04-26 00:00:00
36. #零态洞察百态# 【“95后AI才女”罗福莉小米首秀,发布并开源新模型】今日上午,在小米2025小米人车家全生态合作伙伴大会上,Xiaomi MiMO大模型负责人罗福莉完成入职后的小米首秀,并正式发布和开源最新MoE大模型MiMo-V2-Flash。罗福莉被誉为“"95后AI才女"”,本科毕业于北京师范大学计算机专业、硕士就读于北京大学计算语言学研究所,曾通过阿里 “阿里星项目” 入职达摩院主导开发多语言模型VECO,后任职幻方量化、DeepSeek并成为DeepSeek-V2关键开发者。2025年11月起罗福莉担任小米MiMo大模型团队负责人。今日发布并开源的MiMo-V2-Flash是其加入小米后领导开发的“作品”。据小米官方介绍,Xiaomi MiMo-V2-Flash总参数 309B(激活15B),采用专家混合架构 (MoE),在多个 Agent 测评基准上进入全球开源模型 Top 2;代码能力超过所有开源模型,比肩标杆闭源模型 Claude 4.5 Sonnet,但推理价格仅为其2.5%且生成速度提升至2 倍。
新浪微博 2025-12-17 00:00:00
37. 世界模型双冠王诞生!国产世界模型力压谷歌、英伟达等持续领跑
微信公众号 2026-04-27 00:00:00
38. #小米发布最新MiMo大模型#小米今天正式发布并开源了专为智能体场景设计的超高速大模型:MiMo-V2-Flash,3090亿总参数、150亿激活参数的稀疏架构,在推理、编码和长交互任务中实现性能与DeepSeek-V3.2对标。简单试了下反应速度可以,专业类知识回答的比较全面,目前还没有正式开放,只有开发者演示平台。
新浪微博 2025-12-17 00:00:00
39. 昨天刚说了要注意deepseek v4发布,今天就有用户看到灰度测试了。估计是随机选择的用户,没有覆盖全量群体。获得测试权限的用户可以看到三个模式切换入口,感觉跟豆包一样,有快速模式、专家模式、视觉模式。v4采用MoE混合专家架构,总参数量1万亿,单轮推理激活参数量320亿。对比v3,推理速度提升2倍,显存占用降低50%。现在还没正式官宣是不是v4。太吊胃口了。
新浪微博 2026-04-08 00:00:00
40. GLM-5.1开源,SWE-Bench Pro 登顶王座,老金帮你拆清楚
微信公众号 2026-04-09 00:00:00
41. 阿里除夕夜发布 Qwen3.5 模型,哪些技术亮点值得关注?对大模型发展有何影响?
知乎 2026-02-16 00:00:00
42. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生
抖音 2026-01-08 00:00:00
43. #一条音频告别2025##微博声浪计划# 当小米MiMo-V2-Flash以MIT协议正式开源,3090亿参数规模与150亿活跃参数的MoE架构组合,不仅在SWE-Bench编程测试中以73.4%的成功率登顶开源榜首,更标志着中国科技企业在AI大模型赛道完成了从技术追赶到生态引领的关键跨越。 川北小哥的微博音频
新浪微博 2025-12-17 00:00:00
44. 谁能想到,小米悄悄掏出的MiMo-V2-Flash,居然在海外开源圈杀疯了。 热度不输同期Gemini3 Flash,直接被老外封神平替。核心就两点,一个是性能能打,309B总参数的MoE架构,推理速度、编程得分都在开源榜前排。另一个是价格更狠,每百万token成本仅为竞品零头,还免费开放API。 以往都是我们追着海外模型跑,现在终于轮到国产大模型让老外抢着用。这波破圈,小米把性价比玩到了AI赛道,属实给国产长脸了!
新浪微博 2025-12-27 00:00:00
45. 迟来,26年2月开源模型汇总!DeepSeek虚晃一枪,国内大模型狂卷~
知乎 2026-03-03 00:00:00
46. 开源大模型与闭源大模型的差距是在缩小还是在扩大?关键因素是什么?
知乎 2025-12-23 00:00:00
47. Deepseekv4 参数量有望达 1.6 万亿,远超预期,这一突破对大模型发展有何意义?
知乎 2026-04-17 00:00:00
48. 四道题评测 Qwen3.7-Max:从空间推理到 3D 建模,它离 Agent 更近了吗?
微信公众号 2026-05-28 00:00:00
49. 小米MiMo有点东西,小米MoE大模型MiMo-V2-Flash开源后,已经成为最近阶段国产大模型调用量第一。之前都觉得谷歌Gemini无敌,小米的新模型MiMo-V2-Flash又好用又免费,开发者没理由不选小米。从DeepSeek爆火,再到小米的AI大模型热度攀升,咱们国产AI的能力真的有点太强了!
新浪微博 2025-12-27 00:00:00
50. GLM-5深夜官宣:Pony Alpha身份揭晓,编程能力逼近Claude Opus
微信公众号 2026-02-11 00:00:00
51. #小米新模型什么水平#从参数上我和Deepseek对比了下。MiMo-V2-Flash 总参数 3090 亿,活跃参数 150 亿,采用专家混合架构 (MoE)。Deepseek R1最大的参数量是6710亿(后来R2是1.2万亿),R1活跃参数是370亿。MiMo-V2-Flash 推理速度150 tokens/秒,成本每百万 token 输入 0.1 美元、输出 0.3 美元。Deepseek R1我不记得了,R2输入每百万次 0.07 美元,输出每百万次 0.27 美元。毕竟Deepseek是国内第一梯队,从性价比来看的话,小米的大模型好像也还行。
新浪微博 2025-12-17 00:00:00
52. 有新论文暗示 DeepSeekV4 已完成训练,这对未来 AI 大模型发展意味着什么?
知乎 2026-01-13 00:00:00
53. 【当满屏都是新模型,你该选哪个?Qwen3.5 27B vs 35B-A3B 硬核实测】快速阅读: Qwen3.5同时发布了27B稠密模型和35B-A3B的MoE模型,引发社区关于“哪个更好”的激烈讨论。简单结论是:27B更聪明但更慢,35B-A3B快5倍但“智商”约等于10B稠密模型。16GB显存用户两边都够呛。---这两天模型发布的密度让人喘不过气。有网友说“模型真是下雨一样往下掉”,倒也形象。先说结论:27B稠密模型在智能水平上确实更强。但问题来了,有人在RTX 3090上测出的数据是:35B-A3B跑100 t/s,27B只有20 t/s。五倍的速度差距,足以让很多人重新考虑“更聪明”到底值多少钱。社区里流传着一个估算MoE模型智能水平的公式:√(总参数 × 激活参数)。按这个算法,35B-A3B大约相当于10B稠密模型的智力水平。有观点认为这个公式源自2023年Mixtral时代,现在的MoE架构已经进化太多,公式越来越不准了。但即便往乐观了估,35B-A3B也就是个20B的水平,还是比27B差一截。有人提了个有意思的视角:如果你的主要时间花在等待工具调用返回结果,或者花在给模型打补丁、写各种guardrail上,那速度优势就被抵消了。这话说得挺实在。关于MoE为什么“亏”参数,有网友解释得很清楚:稠密模型整个网络都参与计算,参数之间能产生复杂的干涉模式;MoE每次只激活一小部分专家,虽然“虚拟网络”更大,但失去了那些干涉效应。某种程度上,thinking模式可能对MoE更友好,因为推理过程给了模型机会去调用更多专家。硬件配置方面的反馈比较现实。有网友在RTX 5080 16GB显存上跑27B的Q4_K_M量化,只有7 t/s出头,手动分配55层到GPU后勉强拉到13.5 t/s,但上下文必须限制在16K。还有人直接说“16GB显存对这俩模型都不太友好”。有观点认为16GB显存大概只能跑“90 IQ”难度的任务,24-32GB才是正常人类智能水平。虽然是“napkin math”,但这个直觉可能没错。一个4060笔记本用户分享了自己的配置:8GB显存加32GB内存,跑35B-A3B的MXFP4量化,64K上下文能到29 t/s。这说明MoE在混合offload场景下确实有优势,因为每次只需要把激活的3B参数搬进显存。有个常见误解需要澄清:MoE并不是每轮对话选一次专家就完事了。每一层、每一个token都在重新路由。Mixtral论文里那张彩色的专家激活图应该能说明问题。最后一个数据点:有测试显示27B与122B-A10B的差距,比27B与35B-A3B的差距还小。稠密模型的效率优势在这个参数规模上体现得很明显。---简评:16GB显存用户今天的处境,像极了站在奶茶店发现中杯大杯都超预算的人。 27B太聪明但跑不动,35B跑得欢但不够聪明,两边都是将就。有人说“16GB只能跑90 IQ任务”,虽是玩笑,却戳中真相:不是模型不够好,是你的显卡配不上你的野心。 最讽刺的是那个4060笔记本用户的方案——8G显存+32G内存跑MoE,等于承认显卡已经沦为配角。当模型像雨点一样砸下来,真正的焦虑不是“选哪个”,而是“我的硬件还能撑多久”。显存焦虑,才是这个时代的新型消费主义陷阱。---www.reddit.com/r/LocalLLaMA/comments/1re72h4/qwen35_27b_better_than_35ba3b/
新浪微博 2026-02-27 00:00:00
54. 怎么看待新加坡政府宣布在东南亚语言大模型项目放弃Meta模型,采用阿里的通义千问(Qwen)开源架构?
知乎 2025-12-03 00:00:00
55. 性价比也杀进大模型领域了!AI天才少女罗福莉加入后,小米迅速发布并开源新模型MiMo-V2-Flash,总参数达3090亿(活跃参数150亿),采用MoE专家混合架构,性能直接对标头部开源模型DeepSeek-V3.2、Kimi-K2#小米天才少女罗福莉首次登场# #小米发布最新MiMo大模型#
新浪微博 2025-12-17 00:00:00
56. GLM-5 逼平 ClaudeOpus4.5,对中国 AI 大模型发展有何意义?
知乎 2026-02-13 00:00:00
57. 刚刚!DeepSeek开源高性能GPU算子库TileKernels
微信公众号 2026-04-23 00:00:00
58. DeepMind华人研究员Lun Wang离职,「评估」成制约模型能力飞跃的瓶颈
微信公众号 2026-05-19 00:00:00
59. 阿里大模型算法岗三面追问
今日头条 2026-05-24 00:00:00
60. MoE 混合专家架构真的是大模型未来方向吗?为什么这么多厂商都在用?
微信公众号 2026-04-16 00:00:00
61. 国产小模型崛起
今日头条 2026-04-07 00:00:00
62. 35B总参仅3B运行!Qwen3.6稀疏MoE模型重磅开源
今日头条 2026-04-20 00:00:00
63. MoE 混合专家模型详解
微信公众号 2026-04-03 00:00:00
64. 重磅破局!阿里Qwen3全系MoE大模型开源,国产AI终于摆脱卡脖子
微信公众号 2026-04-22 00:00:00
65. DeepSeek-V4测评
微信公众号 2026-05-20 00:00:00
66. 百亿次下载量之后,国产大模型迭代潮起
今日头条 2026-04-28 00:00:00
67. 混合专家模型驱动前沿 AI 模型,在 NVIDIA Blackwell 系统上运行速度提升 10 倍
微信公众号 2025-12-09 00:00:00
68. ICLR 2026 | 不是所有MoE模型都适合专家卸载!揭示MoE模型路由一致性的秘密
微信公众号 2026-01-29 00:00:00
69. MiniMax 今日正式开源MiniMax-M2.7模型!
小红书 2026-04-12 00:00:00
70. 小米MiMo-V2-Flash
今日头条 2025-12-17 00:00:00
71. DeepSeek和Qwen的极致“效率竞赛”浅析
今日头条 2025-12-17 00:00:00
72. llm氪ke普课-Qwen 2.5→3→3.5 技术变革全视角解读+高频面试题汇总
知乎 2026-04-19 00:00:00
73. LLM推理优化-续写MOE故事DeepSeek MoE
微信公众号 2026-04-18 00:00:00
74. Qwen2.5 技术报告重点总结
知乎 2026-05-11 00:00:00
75. GLM-4.7-Flash 开源发布30B 参数、3B 激活的高效 MoE 大模型
微信公众号 2026-01-21 00:00:00
76. GLM-4-0414系列
微信公众号 2026-04-04 00:00:00
77. 智谱GLM-4.6V深度解析
知乎 2025-12-11 00:00:00
78. 智谱GLM-5.1、阿里Qwen3.6-Plus、谷歌Gemma 4、微软Azure AI Studio、智谱GLM-5V-Turbo密集发布
微信公众号
79. DeepSeek MoE背后隐藏的硬核真相
微信公众号
80. MoE 架构演进史
微信公众号
81. DeepSeek-V3 技术深度解析
微信公众号
82. DeepSeek-V4-Pro发布
微信公众号
83. GPT-5.5与DeepSeek V4同日发布
微信公众号
84. DAC2026 | ExpertFlow
微信公众号
85. 必知必会
知乎
86. 混合专家模块MoE
知乎
87. 2026 年开源大模型 TOP10 完整榜单
知乎 2026-02-24 00:00:00
88. 大模型MoE架构解析
微信公众号 2026-04-15 00:00:00
89. 人人都能懂的大模型 · 第21期
今日头条 2026-05-01 00:00:00
90. 告别算力浪费!DeepSeek开源MoE架构,大模型参数效率提升3倍
今日头条 2026-05-29 00:00:00
91. 中国开源AI震撼全球!架构选择暗藏玄机,超越DeepSeek之路曝光
今日头条 2026-03-25 00:00:00
92. 2026 大模型技术爆发
今日头条 2026-04-05 00:00:00
93. DeepSeek又开源了
微信公众号 2026-04-27 00:00:00
94. GPT-6 vs DeepSeek V4
知乎 2026-04-22 00:00:00
95. DeepEP 深度拆解
微信公众号 2026-04-29 00:00:00
96. 谷歌Gemma 4发布
微信公众号 2026-04-11 00:00:00
97. 盘点!2025年中国大模型行业全景
今日头条 2025-12-13 00:00:00
98. 2024-2026年大模型架构都用啥?40个模型架构图、4大架构及4个趋势总结
微信公众号 2026-03-17 00:00:00
99. 大模型的下一个重大技术创新将来自于中国
微信公众号 2026-01-30 00:00:00
100. 2026年主流大模型对比分析,谁才是你心中的第一
今日头条 2026-05-31 00:00:00
101. 2026年,AI大模型行业格局已定?深度解析当前竞争态势与未来走向
知乎 2026-03-24 00:00:00
102. 国产大模型凭什么霸榜全球 不止是极致性价比
https://tech.qianlong.com/2026/0401/8648972.shtml
103. Transformer深度拆解-第10章:MoE架构深度拆解——DeepSeek V3如何用671B参数达到GPT-4效果?
知乎 2026-04-29 00:00:00
104. 摩根大通:第二波DeepSeek冲击,V3.2 改写中国云生态与芯片生态
微信公众号 2025-12-06 00:00:00
105. 深度解析大模型的稠密模型与稀疏模型
今日头条 2026-05-18 00:00:00
106. OmniMoE:当专家数量达到百万级,如何兼顾极致的细粒度与硬件效率?
知乎 2026-02-11 00:00:00
107. 混合专家MoE深度拆解:GPT-4和DeepSeek V4凭什么又大又快
知乎 2026-05-02 00:00:00
108. 国内首个全国产化千亿参数细粒度 MoE:开源!
知乎 2025-12-24 00:00:00
109. 玻璃盒中的精密博弈:大模型 MoE 架构全解析
微信公众号 2026-04-06 00:00:00
110. DeepSeek-V4 架构下的 Mega MoE 融合算子与 英伟达 PDL 的应用
微信公众号 2026-05-04 00:00:00
111. 混合专家模型(MoE)架构:如何实现推理成本降低60%,吞吐量提升19倍的技术突破
微信公众号 2026-03-02 00:00:00
112. 《CS336 Spring 2025 Lecture 4:MoE》学习笔记
知乎 2026-03-28 00:00:00
113. Mamba作者团队提出SonicMoE:一个Token舍入,让MoE训练速度提升近2倍
知乎 2025-12-19 00:00:00
114. 大模型自学笔记・番外四:MoE混合专家架构
微信公众号 2026-05-18 00:00:00
115. 混合专家模型(MoE):大模型时代的“降本增效”革命
百度 2026-04-20 00:00:00
116. 小米开源MiMo-V2-Flash大模型
小红书 2025-12-17 00:00:00
117. moe架构的post-training难点与经验分享
知乎 2026-03-19 00:00:00
118. 混合专家模型(Mixture-of-Experts,MoE)深入解析
微信公众号 2026-03-28 00:00:00
119. 一文读懂大模型里的混合专家 MoE
微信公众号 2026-03-31 00:00:00
120. 大模型的“节能密码”:解密稀疏激活(Sparse Activation)
今日头条 2025-12-14 00:00:00
121. 从DeepSeek光速入坑混合专家模型(MoE)
知乎 2026-01-22 00:00:00
122. MoE 笔记:从数学推导到 SonicMoE 的极致优化
知乎 2025-12-27 00:00:00
123. MiniMax M2.7开源:MoE架构,总参数230B,激活参数10B
今日头条 2026-04-19 00:00:00
124. 2.MoE架构:DS如何用14B参数实现671B效果?
小红书 2026-05-27 00:00:00
125. DeepSeek做大→Mega MoE,Tri Dao团队加快→SonicMoE
今日头条 2026-05-05 00:00:00
126. AI名词解释 EP09|混合专家 MoE 是什么?
哔哩哔哩 2026-04-11 00:00:00
127. 一文讲清:混合专家模型MoEs技术发展介绍
今日头条 2025-12-22 00:00:00
128. Qwen 3.6-35B-A3B 开源,3B激活参数比肩10倍规模模型
微信公众号 2026-04-18 00:00:00
129. NeurIPS 2025 Oral | 全新正交与方差双重约束,无痛缓解MoE「负载均衡」同质化问题
知乎 2026-01-30 00:00:00
130. AI大模型系列第六站:大模型 MoE(混合专家)
今日头条 2026-03-14 00:00:00
131. 大模型技术突破解析:从MoE到多模态,哪些应用场景即将迎来商业化爆发?
微信公众号 2026-03-18 00:00:00
132. 大模型入门 CS336 笔记 Lecture4
知乎 2026-01-09 00:00:00
133. MoE架构深度解析:大模型成本优化的终极武器
微信公众号 2025-12-09 00:00:00
134. 一文搞懂MOE混合专家架构!
微信公众号 2026-03-21 00:00:00
135. 大模型架构革命:MoE 成为主流,小模型挑战巨无霸
今日头条 2026-03-31 00:00:00
136. 从6000亿到万亿参数:MoE混合专家模型如何让大模型更高效?
百度 2026-05-22 00:00:00
137. LLM 参数稀疏化的抽卡效应
知乎 2025-12-10 00:00:00
138. SuperCLUE 3 月榜单出炉:中外大模型贴身肉搏,国产第一梯队正式成型
知乎 2026-04-08 00:00:00
139. moe训练优化?这几个坑得知道!
小红书 2025-12-21 00:00:00
140. MOE 专家模型
知乎 2026-03-12 00:00:00
141. 深入浅出MOE模型
微信公众号 2026-05-07 00:00:00
142. 大模型应用:不减性能只减负担:大模型稀疏化技术全景与实践.36
知乎 2026-03-08 00:00:00
143. Transformer架构演进与MoE混合专家模型技术解析
今日头条 2026-03-29 00:00:00
144. 字节:无训练剪枝 + 动态MoE恢复满血生成
小红书 2025-12-06 00:00:00
145. MoE训练通信瓶颈怎么破?NVIDIA Hybrid-EP技术深度解析
知乎 2026-02-27 00:00:00
146. 【译】混合专家(Mixture of Experts, MoE)
微信公众号 2026-03-22 00:00:00
147. 大模型应用:混合专家模型(MoE):大模型性能提升的关键技术拆解.37
知乎 2026-03-09 00:00:00
148. GigaChat的MoE架构在实际应用中有什么独特优势?
知乎 2025-12-30 00:00:00
149. 深入理解 MOE (混合专家模型)
知乎 2026-02-27 00:00:00
150. MoE架构:大模型兼顾规模与效率的核心设计
今日头条 2026-01-30 00:00:00
151. MOE
知乎 2025-12-11 00:00:00
152. 【IEEE TPAMI 2026】6.2倍极致压缩!Colab联合HKU、NUS、NVIDIA提出MC#:重新定义MoE大模型的高效部署
今日头条 2026-03-01 00:00:00
153. DeepSeek悄悄更新:Mega MoE、FP4 Indexer来了
知乎 2026-04-17 00:00:00
154. Qwen2 技术报告解读 - 哔哩哔哩
哔哩哔哩 2026-04-01 00:00:00
已收藏
去我的收藏夹