非Transformer架构能否成为AI新方向?混合范式正在改写大模型演进路径

源自114位全网作者

01-24 11:02

精选参考来源

1
【中国科研人员研发出类脑脉冲大模型】今日,中国科学院自动化研究所宣布,该研究所李国齐、徐波团队与沐曦MetaX合作,成功研发出类脑脉冲大模型“瞬悉1.0”(SpikingBrain-1.0)。据介绍,该模型基于团队原创的“内生复杂性”理论构建,在国产GPU平台上完成全流程训练与推理,显著提升了大模型高效处理极长文本或数据序列的效率和速度,展示了构建国产自主可控的新型(非Transformer)大模型架构生态的可行性。据了解,当前主流的Transformer模型,在处理超长文章或对话时速度会非常慢且成本极高,造成了巨大的资源消耗。与当前主流大模型架构(Transformer架构)不同,“瞬悉1.0”借鉴大脑神经元内部工作机制,清晰地展示了一条不断提升模型复杂度和性能的新型可行路径。该模型仅需约主流模型2%的数据量,就能在多项语言理解和推理任务中达到媲美众多主流模型的性能。中国科学院自动化研究所表示,这是我国首次提出大规模类脑线性基础模型架构,并首次在国产GPU算力集群上构建类脑脉冲大模型的训练和推理框架。其超长序列处理能力在法律与医学文档分析、复杂多智能体模拟、高能粒子物理实验、DNA序列分析、分子动力学轨迹等超长序列任务建模场景中具有显著的潜在效率优势。本次发布的大模型为新一代人工智能发展提供了非Transformer架构的新技术路线,并将启迪更低功耗的下一代神经形态计算理论和芯片设计。
2
谷歌祭出Transformer杀手,8年首次大突破!掌门人划出AGI死线
全部
来源
内容由AI生成

精选参考来源

1. 【中国科研人员研发出类脑脉冲大模型】今日,中国科学院自动化研究所宣布,该研究所李国齐、徐波团队与沐曦MetaX合作,成功研发出类脑脉冲大模型“瞬悉1.0”(SpikingBrain-1.0)。据介绍,该模型基于团队原创的“内生复杂性”理论构建,在国产GPU平台上完成全流程训练与推理,显著提升了大模型高效处理极长文本或数据序列的效率和速度,展示了构建国产自主可控的新型(非Transformer)大模型架构生态的可行性。据了解,当前主流的Transformer模型,在处理超长文章或对话时速度会非常慢且成本极高,造成了巨大的资源消耗。与当前主流大模型架构(Transformer架构)不同,“瞬悉1.0”借鉴大脑神经元内部工作机制,清晰地展示了一条不断提升模型复杂度和性能的新型可行路径。该模型仅需约主流模型2%的数据量,就能在多项语言理解和推理任务中达到媲美众多主流模型的性能。中国科学院自动化研究所表示,这是我国首次提出大规模类脑线性基础模型架构,并首次在国产GPU算力集群上构建类脑脉冲大模型的训练和推理框架。其超长序列处理能力在法律与医学文档分析、复杂多智能体模拟、高能粒子物理实验、DNA序列分析、分子动力学轨迹等超长序列任务建模场景中具有显著的潜在效率优势。本次发布的大模型为新一代人工智能发展提供了非Transformer架构的新技术路线,并将启迪更低功耗的下一代神经形态计算理论和芯片设计。

2. 谷歌祭出Transformer杀手,8年首次大突破!掌门人划出AGI死线

3. AI的未来,也许不在于模型规模的无限扩大。 #大咖观察 #红衣聊AI #transformer神经网络架构 #人工智能

4. 刚刚,北大DeepSeek斩获ACL 2025最佳论文!全网首发一作演讲,稀疏注意力是终局

5. 模型为什么要自回归?这没道理,Diffusion LLM更像人类的思考

6. 一封来自Transformer之父的分手信:8年了!世界需要新的AI架构

7. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

8. 懂得留白:当大模型学会了「断舍离」

9. Transformer架构是否已触及天花板?光靠Transformer能走通AGI吗?

10. Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识

11. Transformer已死?DeepMind正在押注另一条AGI路线

12. 终结Transformer统治!清华姚班校友出手,剑指AI「灾难性遗忘」

13. 【#DeepSeek下一代技术曝光#】#梁文锋获最佳论文奖# 在 ACL 2025 的颁奖典礼上,由 DeepSeek 梁文锋作为通讯作者、与北京大学等联合发表的论文荣获最佳论文奖。这次 ACL 2025 规模空前,总投稿量达到 8360 篇,相较于去年的 4407 篇几乎翻倍,竞争异常激烈。简单来说,他们提出的原生稀疏注意力(NSA)机制,通过算法与硬件的协同优化,直接把长文本处理速度提升了 11 倍。更厉害的是,性能不仅没降反而还超越了传统的全注意力模型。一作袁境阳在会上发表演讲,透露这项技术可以把上下文长度扩展到 1 百万 tokens,将被应用到下一个前沿模型中。结合论文发表于 DeepSeek-R1 推出之后,实验设置中也提到使用了 DeepSeek-R1 的蒸馏数据来微调了新的模型。大家纷纷猜测,这项技术将被用于下一代 DeepSeek-V4 以及 DeepSeek-R2。(量子位) DeepSeek 下一代技术提前曝光,梁文锋署名论文获 ACL 2025 最佳论文

14. 20分钟读懂AI史上最重要的一篇论文《Attention Is All You Need》

15. 下一个Transformer可能又被Google做出来了

16. 谷歌最新研究推出了Titans架构与MIRAS理论框架,革新了AI长时记忆能力。传统Transformer虽然引入了注意力机制,但随着序列变长计算成本激增,难以处理超长文本或基因组数据。此前Efficient RNN和状态空间模型虽能线性扩展,却因固定大小记忆压缩丢失丰富信息。 Titans结合了RNN的速度与Transformer的精度,开启了“测试时记忆”能力——模型在运行中实时学习和更新参数,无需离线重训。其创新在于用深层多层感知机作为长时记忆模块,远超传统RNN固定向量的表达力,不仅存储信息更是理解和总结文本全貌。 核心机制“惊喜度”衡量输入与记忆预期差异,低惊喜跳过,保持效率,高惊喜则优先永久记忆,类似人类更记得突发事件。Titans还引入动量机制捕捉上下文连续性和自适应遗忘门控,平衡信息更新与存储,保证性能稳定。 MIRAS理论统一了各种序列模型设计,定义了记忆结构、注意偏向、遗忘调节与记忆算法四大要素,突破传统均方误差限制,探索更丰富的非欧几里得目标和正则化。基于此,衍生出YAAD(鲁棒抗噪)、MONETA(严格数学范数)、MEMORA(概率映射稳定性)等无注意力新模型,进一步提升记忆稳健性和泛化能力。 实验表明,Titans及MIRAS变体在语言建模、零样本推理、基因组和时间序列预测等多任务中均优于Transformer++、Mamba-2等先进模型,且具备高效并行训练和线性推理速度。特别是在BABILong长上下文推理测试中,Titans超越包括GPT-4的大型模型,并能扩展至超过200万token的上下文窗口。 这项工作不仅突破了长序列建模瓶颈,也揭示了在线优化与联想记忆的深层联系,为AI长时记忆和实时适应打开新纪元。未来,结合深度记忆神经网络与非欧几里得优化,AI将在超长文本理解、复杂推理等领域实现质的飞跃。 原文:research.google/blog/titans-miras-helping-ai-have-long-term-memory/

17. 《Beyond Standard LLMs》当前主流大型开源大语言模型(LLM)依然基于自回归解码器架构和经典多头注意力机制,但近年来,行业正在积极探索多种替代技术,包括文本扩散模型、线性注意力混合架构和代码世界模型等。 传统Transformer基于的注意力机制计算复杂度随上下文长度平方增长,限制了长文本处理效率。线性注意力尝试通过状态递归更新,将复杂度降至线性,代表作如MiniMax-M1、Qwen3-Next和Kimi Linear等,它们采用混合策略,将轻量线性注意力和标准全注意力交替使用,既保证性能又提升效率。尽管MiniMax最新版本放弃了线性注意力,回归全注意力以保证多轮推理准确性,但线性注意力因KV缓存节省显著、推理速度提升,仍被看好为未来长上下文模型的关键技术。文本扩散模型借鉴图像生成领域的扩散思想,通过多步并行“去噪”生成文本,理论上提高推理效率,但因缺乏传统自回归的条件依赖,生成连贯性和条件控制仍存在挑战。谷歌等大厂的Gemini Diffusion模型展示了扩散模型在速度和性能上的潜力,但实际应用效果尚待验证。扩散模型不支持链式调用工具,这限制了其在复杂应用中的灵活性。代码世界模型(Code World Models)则是提升模型“理解”能力的另一方向。通过模拟代码执行的内部状态变化,模型不仅预测代码文本,更模拟程序运行过程,提升代码推理和验证能力。这种“世界模型”思路首次被成功应用于文本生成领域,有望成为增强代码生成和调试能力的重要里程碑。此外,小型递归Transformer如Hierarchical Reasoning Model(HRM)和Tiny Recursive Model(TRM)展示了通过递归自我改进实现高效推理的可能性。它们虽专注于结构化任务(如数独、ARC挑战),但以极低算力成本实现高准确度,未来或作为专用推理模块嵌入更大系统,提升复杂任务的处理效率。总结来看,标准自回归Transformer依旧是当前最成熟和性能最佳的选择,尤其在模型规模不受限时表现出色;线性注意力混合架构针对长上下文提高效率,折中部分性能;文本扩散模型提供了并行生成新思路,但仍需克服质量和应用限制;代码世界模型则开辟了模型深度理解和验证的新路径;小型递归模型则证明了“少即是多”的推理潜力。未来,融合多种创新技术的混合架构有望推动LLM在效率与性能间找到更优平衡。原文链接:magazine.sebastianraschka.com/p/beyond-standard-llms

18. Kimi开源新架构 Linear,押注「线性注意力」, LLM 架构的新拐点来了吗?

19. 独家!DeepSeek最新模型上线,全新注意力机制基于北大ACL最佳论文

20. 硬核拆解大模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构

21. 【AI前沿】IBM Granite 4.0:超高效、高性能的企业级混合架构大模型

22. Mamba-3惊现AI顶会ICLR 2026!CMU知名华人教授一作首代工作AI圈爆红

23. token危机解决?扩散模型数据潜力3倍于自回归,重训480次性能仍攀升

24. Mamba-3横空出世!

25. AI的硬件时刻来了吗?

26. 当今改进cnn,transformer还有出路吗?

27. 【#中国科研人员研发出类脑脉冲大模型##类脑脉冲大模型来了#】记者今天(9月8日)从中国科学院自动化研究所获悉,近日,该研究所李国齐、徐波团队与相关单位合作,成功研发出类脑脉冲大模型“瞬悉1.0”(SpikingBrain-1.0)。与当前主流大模型架构(Transformer架构)不同,“瞬悉1.0”借鉴大脑神经元内部工作机制,清晰地展示了一条不断提升模型复杂度和性能的新型可行路径。该模型仅需约主流模型2%的数据量,就能在多项语言理解和推理任务中达到媲美众多主流模型的性能。

28. NextStep-1:一次在图像生成上自回归范式的探索

29. 你对下一代Transformer架构的预测是什么?

30. 千问斩获NeurIPS 2025最佳论文,为国内唯一获奖团队,论文提到的注意力门控机制解决了哪些问题?

31. 英伟达再出手!新型混合架构模型问世,两大创新实现53.6倍吞吐提速

32. 蚂蚁联手人大,发布MoE扩散模型

33. 2025,AI硬件回归真实世界

34. 硬核拆解大模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构

35. 扩散语言模型有MoE版了!蚂蚁&人大从头训练LLaDA-MoE,将完全开源

36. 国庆前的猛刷一次存在感:DeepSeek开源685B新模型DeepSeek-V3.2-Exp,还带火了稀疏注意力

37. DeepSeek又干大事,让开源模型重回第一梯队

38. 无需动作预训练,物理自回归模型让机器人“从视频学会操作”

39. 浙大MambaMap:基于状态空间模型的在线矢量高精地图构建

40. 手机也能跑,腾讯混元一口气开源4款小模型

41. 端到端,VLA,世界模型都是什么意思?

42. 400万人围观的分层推理模型,「分层架构」竟不起作用?性能提升另有隐情?

43. “世界模型”竞赛升级:Runway推出GWM-1,实时交互可持续数分钟之久

44. 国庆前的猛刷一次存在感:DeepSeek开源685B新模型DeepSeek-V3.2-Exp,还带火了稀疏注意力

45. 360 AI眼镜来了!周鸿祎布局十余年,对AI硬件志在必得?

46. 揭秘大模型的魔法:实现带可训练权重的自注意力机制

47. 揭秘大模型的魔法:实现带有可训练权重的多头自注意力机制

48. 《Transformer架构的黄昏与黎明

49. 蚂蚁联手人大发布首个原生MoE扩散语言模型,蓝振忠

50. Mamba (SSM)和RWKV (线性 Attention)和Jamba (混合架构)学习

51. Mamba 架构上顶会ICLR 2026,AI大脑核心Transformer的王座还能坐稳吗?

52. 线性注意力背后的视角转换

53. 理解线性注意力(Linear Attention)的局限性

54. 从线性注意力到Mamba 2

55. 从Softmax到线性注意力

56. 下一代大模型架构系列

57. 月之暗面唐飞虎

58. 大模型面试基础 | Transformer性能优化之LinearAttention

59. 线性注意力回归!Kimi新模型引爆,MiniMax却悄悄换回传统架构

60. Agent注意力机制

61. 清华&上海AI Lab联手,原生混合注意力NHA问世,长文推理效率与精度终于两全!

62. Kimi开源新线性注意力架构,首次超越全注意力模型,推理速度暴涨6倍

63. DeepSeek-V3.2-Exp 完整分析

64. DeepSeekV3.2硬核拆解

65. DeepSeek模型首次引入“稀疏注意力”机制

66. DeepSeek-V3.2-Exp模型的新特性与技术亮点

67. 今日DeepSeek-V3.2-Exp重磅开源

68. 树莓派上流畅运行大模型!让终端具备自主学习与记忆能力|对话RockAI CEO刘凡平

69. 非Transformer架构!首个纯无注意力大模型,超越开源巨头Llama3

70. Transformer挑战者出现!FlashAttention作者参与,模型代码都开源,公司已创办

71. ALPHA掘金系列之十九:基于MAMBA2模型的端到端选股框架

72. WAIC观察

73. 换掉Transformer,7B开源模型立刻登顶!任意长序列都能处理

74. Docs

75. 上海AI Lab胡侠

76. 扩散模型架构与其他模型架构对比

77. 未来Transformer 架构探索:状态空间模型

78. 【论文速递】NeurIPS2025 | 完全非自回归的多人对话语音生成模型

79. 综述:LLM 高效架构系统性梳理

80. 【稀疏注意力】DeepSeek ACL2025最佳论文

81. Kimi开源新线性注意力架构,首次超越全注意力模型,推理加速6倍

82. Mamba革命!SISMA:三倍速生成逼真人脸,扩散模型迎来轻量化时代

83. Transformer 过时了?大模型长出“外接大脑” DeepSeek 发布新论文,扔出一枚重磅炸弹:Engram 架构,或将开启大模型的全新赛道。\n它的核心,是一个条件记忆机制,可以理解为给模型装了一个“外接U盘”。\n💾 什么是 Engram ?\n简单说,它把模型的知识分成了两层:\n• 静态记忆库:存放事实、常识等固定知识,存在“外接U盘”里,调用时计算成本极低。\n• 动态注意力:让模型的“大脑”腾出来,专注于复杂的逻辑推理和创造性思考。\n🚀 效果如何?实验说话\n在长文本理解等任务上,表现显著提升。\n计算量大幅降低,推理速度几乎不受影响。\n最关键的是:增加记忆容量,模型性能会持续、可预测地提升,这为大模型的进化指明了新方向。\n🔮 这意味着什么?\n它实现了参数规模与计算量的解耦。未来,模型的“知识量”(参数)可以海量存储在硬盘里,而推理时只调用需要的一小部分,高效又经济。\n这不仅是技术优化,更是一种范式转移:神经计算 + 智能检索 的结合,可能是下一代稀疏模型的关键。\n大模型的进化,正从“蛮力缩放”,走向“精巧设计”。#deepseek #技术突破 #论文解读

84. TCSVT 2025 | 颠覆性融合!首个CLIP-Mamba框架M³amba问世,遥感分类SOTA被刷新!

85. Kimi 又开源了!Kimi Linear 48B深度解析 - 百万token上下文+6倍解码提速的AI新选择!

86. Point-SSM:一种用于点云分析的极简状态空间模型,在医学点云任务上表现SOTA

87. 轻量高效:MedMamba 以状态空间模型重塑医学影像分类新基准

88. 引入线性注意力!一起探索图像视频扩散模型的高效设计与加速

89. 2分钟速通最先进的几种大模型注意力机制优化方式!

90. DeepSeek推出实验性AI模型,“稀疏注意力”机制首亮相

91. 字节提出双向稀疏注意力,视频扩散模型训练FLOPs 降低20 倍!

92. TGRS 即插即用 | GLVMamba双剑合璧!让模型兼具全局视野与局部精度,代码已开源!

93. 37. 什么是稀疏注意力,常见的稀疏注意力机制有哪些?

94. CVPR 2025 | 基于选择性状态空间模型的高效注意力Mamba轨迹预测模型

95. 【双语音】什么是状态空间模型?用数据重新定义人工智能与机器学习

96. 告别注意力机制?MamEVSR:基于状态空间模型的事件视频超分新范式

97. 可稀疏注意力机制

98. CVPR 2025 | Mesh Mamba:用于非纹理和纹理网格显著性预测的统一状态空间模型

99. 谷歌新研究CausNVS:自回归扩散模型,让3D新视角生成更灵活、更连贯

100. CVPR 2025 | 大连理工 & 耶鲁联合提出 DefMamba:可变形视觉状态空间模型,革新图像结构捕捉

101. PlainMamba来了!结构极简,空间感知满分,轻松碾压非层次模型

102. 基于跨模态级联扩散模型的图像描述方法

103. 发文暴论!线性注意力is all you need!

104. DeepSeek模型首次引入“稀疏注意力”机制,“稀疏注意力”机制到底是什么?

105. TPAMI2025 | AVC-GAN:三大核心设计碾压主流 GAN 模型,用非自回归 + 注意力破解 TSG 三大难题!

106. 智源TALK305期|可训练动态稀疏注意力来了:港科大&智源联合提出高效长序列大模型新解法

107. TGRS 2025 | 状态空间模型首入绝缘子缺陷检测!SGFP-YOLO 实现全局特征增强与局部细节捕获统一

108. ICCV顶会最新注意力机制MALA,适用CV、NLP、语音识别、图像生成——深度学习\u002F神经网络

109. FMambaIR:一种用于图像恢复的混合状态空间和频域模型

110. TGRS 2025 | 南科大 & 清华提出 RSIC-GMamba:基因操作 + 状态空间模型

111. DeepSeek发布V3.2-exp模型,开创性稀疏注意力机制 将API 成本降低一半

112. 备忘:关于 离散扩散LM 与 NAR 非自回归模型

113. DiffRhythm 2:非自回归的高效 × 自回归的灵魂,AI音乐创作的新纪元

114. 从 Self-Attention 到 Flash Attention:注意力机制的演进与优化

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章