马斯克公开点赞中国AI团队Kimi新架构AttnRes,训练效率提升25%

源自34位全网作者

03-18 08:06

精选参考来源

1
3月16日,马斯克在X上转发并点赞了中国AI公司月之暗面旗下Kimi团队的一项新研究成果。他只写了一句很简短但很重磅的话:“Kimi的作品令人印象深刻”。简单来说,Kimi团队今天公布了一份技术报告,他们找到了一种让AI“大脑”变得更聪明、更省电的方法,而且这个方法效果真的很明显。我们平时用的大模型(比如ChatGPT这类AI),核心零件叫Transformer,它从2017年问世以来,基本靠一种叫“残差连接”的方式把每一层的信息加起来传给下一层。听起来挺简单,但层数一多就出问题了:最前面几层学到的东西越传越淡,最后几层为了让声音被听到,只能使劲“喊”,导致训练特别费力、也很不稳定。Kimi团队这次的做法就像给AI装了个“智能选择器”:不再简单粗暴地把前面所有层的信息平均加起来,而是让当前这一层自己去“挑”——“我现在最需要前面哪几层的信息?”它用一种叫注意力的机制(就像人脑关注重点的机制)来动态挑选和加权,把真正有用的信息放大,没用的信息自动压低。为了不让电脑内存爆炸,他们还把模型分成几个大块,块里面照旧简单相加,块和块之间才用这个聪明挑选的方式。这样既保留了原来的稳定性,又大大降低了计算成本。他们在自己48亿参数的模型上实测,结果非常亮眼:* 用同样的电(算力),模型学得更好,相当于白送了25%的算力提升* 回答问题时速度几乎没变慢(只多用了不到2%的时间)* 在好几个很难的考试里成绩明显提高,比如科学推理题高了7.5%,数学题高了3.6%马斯克这一句点赞,让很多人都开始关注这件事。不少人觉得,如果这个方法以后被证明靠谱、被大家广泛使用,可能会成为未来两三年里AI模型的“新标配”。
2
马斯克最新预测再次预言未来 马斯克最新预测,著名播客三小时访谈,5年计划大曝光,十大要点总结:手机消失、工作洗牌、脑机觉醒、机器上岗、汽车起飞、火星殖民、AI 全面接管,人人过上国王般的生活,最离谱的是,他还说,人类,可能就生活在一段模拟程序里,必须保持有趣才能不被删除,这脑洞,不愧是穿越马!#马斯克 #AI #自动驾驶
全部
来源
内容由AI生成

精选参考来源

1. 3月16日,马斯克在X上转发并点赞了中国AI公司月之暗面旗下Kimi团队的一项新研究成果。他只写了一句很简短但很重磅的话:“Kimi的作品令人印象深刻”。简单来说,Kimi团队今天公布了一份技术报告,他们找到了一种让AI“大脑”变得更聪明、更省电的方法,而且这个方法效果真的很明显。我们平时用的大模型(比如ChatGPT这类AI),核心零件叫Transformer,它从2017年问世以来,基本靠一种叫“残差连接”的方式把每一层的信息加起来传给下一层。听起来挺简单,但层数一多就出问题了:最前面几层学到的东西越传越淡,最后几层为了让声音被听到,只能使劲“喊”,导致训练特别费力、也很不稳定。Kimi团队这次的做法就像给AI装了个“智能选择器”:不再简单粗暴地把前面所有层的信息平均加起来,而是让当前这一层自己去“挑”——“我现在最需要前面哪几层的信息?”它用一种叫注意力的机制(就像人脑关注重点的机制)来动态挑选和加权,把真正有用的信息放大,没用的信息自动压低。为了不让电脑内存爆炸,他们还把模型分成几个大块,块里面照旧简单相加,块和块之间才用这个聪明挑选的方式。这样既保留了原来的稳定性,又大大降低了计算成本。他们在自己48亿参数的模型上实测,结果非常亮眼:* 用同样的电(算力),模型学得更好,相当于白送了25%的算力提升* 回答问题时速度几乎没变慢(只多用了不到2%的时间)* 在好几个很难的考试里成绩明显提高,比如科学推理题高了7.5%,数学题高了3.6%马斯克这一句点赞,让很多人都开始关注这件事。不少人觉得,如果这个方法以后被证明靠谱、被大家广泛使用,可能会成为未来两三年里AI模型的“新标配”。

2. 马斯克最新预测再次预言未来 马斯克最新预测,著名播客三小时访谈,5年计划大曝光,十大要点总结:手机消失、工作洗牌、脑机觉醒、机器上岗、汽车起飞、火星殖民、AI 全面接管,人人过上国王般的生活,最离谱的是,他还说,人类,可能就生活在一段模拟程序里,必须保持有趣才能不被删除,这脑洞,不愧是穿越马!#马斯克 #AI #自动驾驶

3. 特斯拉技术分享:明年2季度汽车工业,将迎来没有方向盘的时代#特斯拉 #自动驾驶 #汽车 #Cybercab #端到端

4. Kimi 推出 Kimi Claw 并原生集成 OpenClaw,有哪些技术亮点?

5. 【#Kimi回应建议网友先用Deepseek#】#Kimi回应建议先用Deepseek#2月6日,有网友在@月之暗面Kimi 的评论区中反映称:“最近总是显示这个。”具体内容为:高峰时段算力不足,已切换至K2.5快速,升级会员畅用思考模型。对此,月之暗面Kimi回复称:“嗯,正在找算力。要不先用DeepSeek。”2月9日,月之暗面Kimi发文称:“表情包收到了。工作可能要保不住了。”@东方财经 发现,该表情包是Kimi的表情头像,配文为“要不先用Deepseek”。各位网友,您怎么看?#Kimi建议网友先用DeepSeek# 东方财经的微博视频

6. 盘点一周AI大事(11月9日)|GPT5.1决战Gemini OpenAI预热GPT5.1,月底决战Gemini 3.0 Google内测Nano banana2.0 月之暗面发布最强开源大模型Kimi K2 Thinking,一举将开源大模型提到GPT5水平 阿里发布Qwen 3 Max预览版 Higgsfield上线角色交换Recast Hume AI上线声音交换Voice Conversion Heygen推出超真实数字人 字节发布开源版Sora客串BindWeave 视频模型MotionStream能让大象转身 Futurehouse推出AI科学家Kosmos 科学家研发出最强读心术模型Brain-IT #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

7. 盘点一周AI大事(2月1日)|AI乌托邦魔幻开局 Google上线世界模型Project Genie 阿里开源实时世界模型LingBot-World AI乌托邦社区Moltbook爆火 Chrome升级为AI浏览器 月之暗面发布最强开源大模型Kimi K2.5 Gemini 3 Flash升级视觉能力 腾讯发布最强开源图像模型HunyuanImage 3.0-Instruct 阿里开源Z image Base满血版 OpenMOSS发布最强开源视频模型MOVA MIniMax上线顶级音乐模型MiniMax Music 2.5 英伟达开源天气预测模型Earth-2 #AI新星计划 #前沿科技趋势发布月 #抖音知识年终大赏 #AI #AIGC

8. 【#Kimi获5亿美元新融资#】#Kimi获阿里腾讯等老股东超额认购#12月31日,据晚点LatePost,月之暗面(Kimi)近期完成5亿美元C轮融资,IDG领投1.5亿美元,阿里、腾讯、王慧文等老股东超额认购,投后估值43亿美元。据了解,王慧文已经累计投资月之暗面7000万美元。“他们前后只用了不到两个月,属于超额融资。”一位接近月之暗面的人士称,一级市场对公司的热情超出预期。同日,月之暗面创始人、CEO杨植麟发布内部信,公司有超过 100 亿元人民币现金储备。上述人士称,这意味着月之暗面“可以不着急IPO”。各位网友,您怎么看?(晚点LatePost)@东方财经

9. #Kimi估值超100亿美元# Kimi这个融资速度有点厉害? 一个多月前才刚融完5亿美元,转头又拿了超7亿美元融资,两轮加起来超12亿美元,直接把估值干到破100亿美元了。 阿里腾讯都在加码,难怪创始人说不着急上市,账上躺着超百亿现金,这在大模型赛道里也太猛了。 现在的AI赛道,真的是有核心技术就不愁资本买单……[点赞] http://t.cn/AXtjQIVu

10. DeepSeek论文登《Nature》, 让中国AI在全球 “插旗”!#大咖观察 #红衣聊AI #DeepSeek

11. SpaceX吞并xAI!马斯克终极豪赌:地球已经装不下AI了 马斯克终极豪赌:地球已经装不下AI了,硅基的未来在太空 #ai #马斯克 #SpaceX #grok #SpaceX宣布收购xAI

12. 《The Big LLM Architecture Comparison》 七年来,GPT架构演进虽有细节改进,但核心仍相似。从GPT-2到近期的DeepSeek V3与Llama 4,模型结构变化有限,更多是细节上的优化,如从绝对位置编码到旋转位置编码(RoPE)、多头注意力向分组查询注意力(GQA)转变,以及激活函数由GELU进化为更高效的SwiGLU。 DeepSeek V3(2024末发布)及其推理版本DeepSeek R1(2025年初)引入了两大关键架构创新:多头潜在注意力(MLA)和专家混合(MoE)层。MLA通过压缩键值张量显著节省KV缓存内存,并在性能上超越GQA。MoE则通过稀疏激活少量专家,极大提升模型容量与推理效率,DeepSeek V3拥有6710亿参数,但推理时仅激活37亿,大幅降低推理资源消耗。 非盈利Allen AI的OLMo系列以高透明度著称,虽非性能最强,但其对训练数据和代码的公开为社区提供了宝贵的蓝图。OLMo 2采用Post-Norm(归一化层置于注意力与前馈模块之后)搭配QK-Norm(针对查询和键的归一化),提升训练稳定性,区别于主流的Pre-Norm设计。 谷歌的Gemma系列(尤其是Gemma 3)强调滑动窗口注意力机制,限制每个查询的上下文范围,大幅降低KV缓存内存,用局部注意力替代全局注意力,保持性能几乎不变。Gemma 3还采用了Pre-Norm与Post-Norm混合归一化,兼顾训练稳定性与效率。此外,Gemma 3n针对移动设备进行了优化,利用分层嵌入(PLE)技术降低内存占用,并引入了Matryoshka Transformer结构,实现模型切片灵活部署。 Mistral Small 3.1以较小KV缓存和更少层数提升推理速度,虽舍弃滑动窗口注意力,但性能在多场景优于Gemma 3,凸显宽模型在推理速度上的优势。 Llama 4 Maverick采用MoE架构但激活专家更少且规模更大,整体与DeepSeek V3类似,体现MoE在2025年的流行趋势。 Qwen3系模型涵盖从0.6B到235B参数的密集和MoE版本,兼顾易用性和推理效率。其小型模型适合本地运行,MoE版本激活参数比例低,提升大规模应用的推理性价比。Qwen3 Next在较小规模下引入更多专家和共享专家,并采用混合门控DeltaNet注意力,实现超长上下文支持(262k tokens)和多步预测,提升训练速度和推理效率。 SmolLM3以3B参数提供优异性能,采用NoPE(无显式位置编码)策略,增强对长序列的泛化能力,减少对位置编码的依赖。 Kimi K2体量达到1万亿参数,基于DeepSeek V3架构扩展,采用Muon优化器替代AdamW,训练损失曲线平滑且下降迅速,性能媲美领先私有模型。最新的Thinking版本将上下文扩展至256k tokens,提升推理能力。 OpenAI最新开源的gpt-oss系列(20B和120B)采用类似Qwen3的MoE设计,结合滑动窗口注意力和注意力偏置,架构更宽而较浅,适合高吞吐量推理。其“注意力汇聚”机制(attention sinks)通过头偏置实现长上下文稳定性。 xAI的Grok 2.5作为去年旗舰模型,采用少量大专家,并引入始终激活的共享专家模块,与近期多专家模型设计呼应。 GLM-4.5通过先密集后稀疏的层序设计提高MoE模型稳定性,性能优于Claude 4 Opus,接近OpenAI和xAI的顶尖水平。 MiniMax-M2在保持高性能的同时回归全注意力,摒弃线性注意力的准确性不足问题,采用每层独立QK-Norm,参数激活比例更低,体现稀疏MoE架构的新趋势。 2025年线性注意力迎来复兴,Qwen3-Next和Kimi Linear将轻量级线性注意力与传统全注意力混合,兼顾效率与性能。Kimi Linear通过通道级门控提升长上下文推理能力,在速度和准确性之间取得平衡。 Allen AI最新的Olmo 3在保持透明度的基础上扩展规模,继续采用Post-Norm和滑动窗口注意力,支持64k上下文,表现稳定。 DeepSeek V3.2引入稀疏注意力机制,与Mistral 3大型MoE模型架构相似,后者增加视觉编码器支持多模态,优化推理速度,体现MoE架构的持续进化。 综观2025年旗舰开源大模型,核心仍是Transformer,但细节创新如多头潜在注意力、Mixture-of-Experts、滑动窗口与线性注意力混合、归一化层位置变换等,推动模型在性能和推理效率间取得更优平衡。MoE架构热度持续攀升,模型规模与激活参数数目被巧妙控制,实现大规模知识整合与高效推理。长上下文支持成为新标准,优化训练稳定性和推理速度的技术层出不穷。 未来,架构创新与训练工艺的协同将持续塑造大语言模型的发展路径,开源社区的透明度和多样化探索为行业注入活力。 magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

13. 盘点一周AI大事(2月22日)|不赚钱拔网线,龙虾狂赚1万 工程师开源龙虾打工人ClawWork,10刀开局,7小时狂赚1万刀 工程师Sigil开源首个全自主智能体The Automaton Kimi上线云端龙虾Kimi Claw 网易开源桌面版龙虾LobsterAI Google上线地表最强大模型Gemini 3.1 Pro Gemini接入音乐模型 Lyria 3 NotebookLM升级,动动嘴就能修改PPT,还支持导出PPTX格式 Anthropic发布Claude Sonnet 4.6 Claude与Figma官宣史诗联动,Claude Code写的页面能一键导入Figma 阿里开源最强行动智能体 Mobile-Agent-v3.5 字节开源极速生图模型BitDance Tavus发布最强数字人模型Phoenix-4 Taalas研发出革命性AI芯片HC1 #抖音年味新知贺岁 #前沿科技趋势发布月 #AI新星计划 #OpenAI #智能体

14. 硅谷新贵、Cursor最强对手“倒戈”中国开源大模型?Kilo Code 是 GitLab 的前CEO Sid Sijbrandij搞的AI编程助手,它比cursor更开放,完全开源。这个工具现在非常火,上线仅半年,月活冲至15万,拥有全球100万+活跃开发者,现在是OpenRouter上使用token最多的APP (嗯,同时Kimi K2又是Kilo Code现在token用量最大的模型)。当然Kimi作为编程能力比较靠前的模型,被AI类编程助手支持几乎是理所当然的。包括国内的腾讯CodeBuddy、字节Trae、阿里Qoder、美团CatPaw等等都接入了Kimi模型。为啥这么火?一个原因是这个版本的kimi设计能力真的很强。之前版本的Kimi就有着自己独特的审美。而k2.5更加强了这个层面的训练,结果就是评估大模型前端设计能力的Design Arena直接干到第一的位置了,这也是开源模型首次登顶!注意:这个榜单不是跑固定评测,而是靠人类盲测手工打分的榜单,更适合设计这类没有固定标准的评测,同时也无法作弊,更有说服力。配合其原生的多模态能力,可以直接读图、读视频来生成前端页面—— 对,Kimik2.5的视觉识别能力在LMArena榜单上也是仅次于gemini和gpt的。对啦,国内用户的好消息,Kimi的 Code Plan,今天起搞活动直接提升到日常 3 倍的使用额度了。如果是直接用api也有返利活动~ 用官网提供的服务更稳定速度也更快,速冲!

15. 以谷歌waymo算力与模型实力,为什么不走特斯拉fsd的路线呢?为了答案,先抛砖引玉: 1,谷歌waymo在高精地图加激光雷达路线上船大难掉头,这条技术路线本就是谷歌开创出来的,目前仍是全球第一大商业化落地的无人出租车运营商 谷歌可以躺在他的功劳簿上,守住自己在这一个方向上的技术积累与优势 一旦切换到与特斯拉fsd(纯AI驱动端到端仿生人类驾驶)一样的路线,需要从0开始 在切换的初期,一定会出现能力的大幅回退 这对目前无人出租车网络的运营体验,对技术上的骄傲来说,都是重大的打击 2,谷歌waymo毕竟不是车企,没有上百万辆的车队与车主提供海量的数据,完全走数据驱动没有优势,无法丢掉编程规则,即是依仗也是束缚 3,技术理念本来就是道不同不相为谋,目前谷歌waymo的安全性的确还是远高于特斯拉fsd,在马斯克diss waymo泛化能力不行时,waymo同时也在diss马斯克的安全性还赶不上waymo 或许条条道路通罗马,搞技术的人必须得有技术自信 自己选的这一条路不一定是最佳的路线,但一定是最符合自己现实情况的适当路线 4,请高手补充指点…… #特斯拉fsd##人工智能#

16. Kimi K2.5这次能力提升和发布时机恰到好处,从调用量上已经成为 OpenClaw的主力调用模型,超越 Gemini 3 Flash、Claude Sonnet 4.5 等国际主流模型。大模型应用,一旦上规模上量了,最终还是要看性价比啊。

17. 2025年,Agent对于打工人真的有用吗?实测OK Computer

18. #黄仁勋新年第一场演讲提了DeepSeek#黄仁勋CES演讲中点名DeepSeek R1,并将Kimi K2、Qwen等中国开源模型纳入全球展示名单,标志着中国AI技术已跻身全球开源核心阵营。这不仅是对中国模型技术实力的认可,更印证了开源生态成为AI创新主旋律的行业趋势。DeepSeek R1以纯强化学习突破推理能力天花板,训练成本仅为行业平均的1/50,其开源实践大幅降低了AI应用门槛;Qwen的多语言优势、Kimi K2的低成本部署特性,形成差异化竞争力。这些模型性能逼近顶尖闭源产品,打破了海外技术垄断。中国开源力量的崛起,源于超150万开发者的生态积淀与企业持续技术攻坚。黄仁勋的认可,本质是对中国AI“开源普惠”理念的呼应。但需清醒看到,底层算力依赖仍是短板。未来,唯有持续夯实技术根基、完善商业化闭环,中国开源模型才能在全球AI工业化浪潮中真正掌握话语权。黄仁勋新年第一场演讲提了deepseek 川北小哥的微博视频

19. #一条音频告别2025# #微博声浪计划# 微软Kimi Agent级合作深度解读!#微软或与Kimi进行Agent级合作#深入剖析微软与Kimi可能开展的Agent级合作,探讨其合作背景、潜在模式、技术互补性,分析对市场的影响及给AI行业带来的启示。 慧玩先生的微博音频

20. 24小时痛失2位华人联创!马斯克xAI「梦之队」只剩下一半

21. 马斯克公开点赞

22. 美企刚贬低完中国AI,马斯克转头给中国模型点赞

23. 马斯克“点赞”中国AI

24. 马斯克频繁为中国AI站台,真相被忽略了

25. 美企指控中国AI偷师,马斯克嘲讽

26. 杨植麟带队发论文,Kimi下一代模型架构曝光,推理之父惊呼:深度学习2.0要来了!

27. Kimi Linear Attention 技术报告

28. Moonshot AI发布Kimi Linear技术报告,采用混合线形注意力架构

29. Kimi K2.5技术报告解读:能看、会想,还能“分身”协作

30. Kimi新报告狠打脸!30页硬核干货,把AI大厂的“常识”按地上摩擦

31. Kimi Linear技术报告解读:高效注意力架构的突破

32. 马斯克驳抄袭指控:贼喊捉贼!Anthropic竟称中国AI窃密

33. 马斯克被中国AI反超,Kimi新模型1%成本逆袭美国

34. Kimi K2 Thinking震撼上线:

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章