谷歌Titans架构是颠覆者还是噱头?623+用户观点大PK

源自32位全网作者

01-18 19:40

内容由AI生成

精选参考来源

1. Google 提出Titans和MIRAS,超长上下文能力

2. 谷歌甩出Transformer 杀手,8年首次大突破!

3. 谷歌Titans架构深度解读

4. 谷歌新架构突破Transformer超长上下文瓶颈!Hinton灵魂拷问

5. 从 Transformers 到“联想记忆”

6. 《The Big LLM Architecture Comparison》 七年来,GPT架构演进虽有细节改进,但核心仍相似。从GPT-2到近期的DeepSeek V3与Llama 4,模型结构变化有限,更多是细节上的优化,如从绝对位置编码到旋转位置编码(RoPE)、多头注意力向分组查询注意力(GQA)转变,以及激活函数由GELU进化为更高效的SwiGLU。 DeepSeek V3(2024末发布)及其推理版本DeepSeek R1(2025年初)引入了两大关键架构创新:多头潜在注意力(MLA)和专家混合(MoE)层。MLA通过压缩键值张量显著节省KV缓存内存,并在性能上超越GQA。MoE则通过稀疏激活少量专家,极大提升模型容量与推理效率,DeepSeek V3拥有6710亿参数,但推理时仅激活37亿,大幅降低推理资源消耗。 非盈利Allen AI的OLMo系列以高透明度著称,虽非性能最强,但其对训练数据和代码的公开为社区提供了宝贵的蓝图。OLMo 2采用Post-Norm(归一化层置于注意力与前馈模块之后)搭配QK-Norm(针对查询和键的归一化),提升训练稳定性,区别于主流的Pre-Norm设计。 谷歌的Gemma系列(尤其是Gemma 3)强调滑动窗口注意力机制,限制每个查询的上下文范围,大幅降低KV缓存内存,用局部注意力替代全局注意力,保持性能几乎不变。Gemma 3还采用了Pre-Norm与Post-Norm混合归一化,兼顾训练稳定性与效率。此外,Gemma 3n针对移动设备进行了优化,利用分层嵌入(PLE)技术降低内存占用,并引入了Matryoshka Transformer结构,实现模型切片灵活部署。 Mistral Small 3.1以较小KV缓存和更少层数提升推理速度,虽舍弃滑动窗口注意力,但性能在多场景优于Gemma 3,凸显宽模型在推理速度上的优势。 Llama 4 Maverick采用MoE架构但激活专家更少且规模更大,整体与DeepSeek V3类似,体现MoE在2025年的流行趋势。 Qwen3系模型涵盖从0.6B到235B参数的密集和MoE版本,兼顾易用性和推理效率。其小型模型适合本地运行,MoE版本激活参数比例低,提升大规模应用的推理性价比。Qwen3 Next在较小规模下引入更多专家和共享专家,并采用混合门控DeltaNet注意力,实现超长上下文支持(262k tokens)和多步预测,提升训练速度和推理效率。 SmolLM3以3B参数提供优异性能,采用NoPE(无显式位置编码)策略,增强对长序列的泛化能力,减少对位置编码的依赖。 Kimi K2体量达到1万亿参数,基于DeepSeek V3架构扩展,采用Muon优化器替代AdamW,训练损失曲线平滑且下降迅速,性能媲美领先私有模型。最新的Thinking版本将上下文扩展至256k tokens,提升推理能力。 OpenAI最新开源的gpt-oss系列(20B和120B)采用类似Qwen3的MoE设计,结合滑动窗口注意力和注意力偏置,架构更宽而较浅,适合高吞吐量推理。其“注意力汇聚”机制(attention sinks)通过头偏置实现长上下文稳定性。 xAI的Grok 2.5作为去年旗舰模型,采用少量大专家,并引入始终激活的共享专家模块,与近期多专家模型设计呼应。 GLM-4.5通过先密集后稀疏的层序设计提高MoE模型稳定性,性能优于Claude 4 Opus,接近OpenAI和xAI的顶尖水平。 MiniMax-M2在保持高性能的同时回归全注意力,摒弃线性注意力的准确性不足问题,采用每层独立QK-Norm,参数激活比例更低,体现稀疏MoE架构的新趋势。 2025年线性注意力迎来复兴,Qwen3-Next和Kimi Linear将轻量级线性注意力与传统全注意力混合,兼顾效率与性能。Kimi Linear通过通道级门控提升长上下文推理能力,在速度和准确性之间取得平衡。 Allen AI最新的Olmo 3在保持透明度的基础上扩展规模,继续采用Post-Norm和滑动窗口注意力,支持64k上下文,表现稳定。 DeepSeek V3.2引入稀疏注意力机制,与Mistral 3大型MoE模型架构相似,后者增加视觉编码器支持多模态,优化推理速度,体现MoE架构的持续进化。 综观2025年旗舰开源大模型,核心仍是Transformer,但细节创新如多头潜在注意力、Mixture-of-Experts、滑动窗口与线性注意力混合、归一化层位置变换等,推动模型在性能和推理效率间取得更优平衡。MoE架构热度持续攀升,模型规模与激活参数数目被巧妙控制,实现大规模知识整合与高效推理。长上下文支持成为新标准,优化训练稳定性和推理速度的技术层出不穷。 未来,架构创新与训练工艺的协同将持续塑造大语言模型的发展路径,开源社区的透明度和多样化探索为行业注入活力。 magazine.sebastianraschka.com/p/the-big-llm-architecture-comparison

7. 谷歌最新研究推出了Titans架构与MIRAS理论框架,革新了AI长时记忆能力。传统Transformer虽然引入了注意力机制,但随着序列变长计算成本激增,难以处理超长文本或基因组数据。此前Efficient RNN和状态空间模型虽能线性扩展,却因固定大小记忆压缩丢失丰富信息。 Titans结合了RNN的速度与Transformer的精度,开启了“测试时记忆”能力——模型在运行中实时学习和更新参数,无需离线重训。其创新在于用深层多层感知机作为长时记忆模块,远超传统RNN固定向量的表达力,不仅存储信息更是理解和总结文本全貌。 核心机制“惊喜度”衡量输入与记忆预期差异,低惊喜跳过,保持效率,高惊喜则优先永久记忆,类似人类更记得突发事件。Titans还引入动量机制捕捉上下文连续性和自适应遗忘门控,平衡信息更新与存储,保证性能稳定。 MIRAS理论统一了各种序列模型设计,定义了记忆结构、注意偏向、遗忘调节与记忆算法四大要素,突破传统均方误差限制,探索更丰富的非欧几里得目标和正则化。基于此,衍生出YAAD(鲁棒抗噪)、MONETA(严格数学范数)、MEMORA(概率映射稳定性)等无注意力新模型,进一步提升记忆稳健性和泛化能力。 实验表明,Titans及MIRAS变体在语言建模、零样本推理、基因组和时间序列预测等多任务中均优于Transformer++、Mamba-2等先进模型,且具备高效并行训练和线性推理速度。特别是在BABILong长上下文推理测试中,Titans超越包括GPT-4的大型模型,并能扩展至超过200万token的上下文窗口。 这项工作不仅突破了长序列建模瓶颈,也揭示了在线优化与联想记忆的深层联系,为AI长时记忆和实时适应打开新纪元。未来,结合深度记忆神经网络与非欧几里得优化,AI将在超长文本理解、复杂推理等领域实现质的飞跃。 原文:research.google/blog/titans-miras-helping-ai-have-long-term-memory/

8. DeepSeek 发布开年新论文,提出全新 MHC 架构,有何创新与应用前景?

9. 如何理解 DeepSeek 最新提出的 mHC 架构?

10. 下一个Transformer可能又被Google做出来了

11. 好家伙,在ETHZ AI Benchmark测试中,天玑9500以15015的高分蝉联第一,性能霸榜!这得益于#天玑9500旗舰芯#全新搭载的超性能+超能效双NPU架构,性能猛、能效还高,低功耗下AI照样常驻,再加上首发端侧4K超高画质文生图功能,不得不说,发哥这是要带头解放AI生产力呀,首发真的有点期待了!

12. 窎,发哥最新旗舰处理器天玑 9500,测试成绩15015,直接登顶加霸榜 ETHZ AI Benchmark!说起来也很合理,因为天玑 9500 这次的 NPU 可谓是架构级改进,采用超性能+超能效的双 NPU 架构。前者超强性能,负责端侧新奇功能,后者保持低功耗 AI 常驻,可以说是领先行业的架构改进。并且这基于芯片底层的改进,让首批搭载#天玑9500旗舰芯#的 vivo X300 系列、OPPO Find X9 系列,都会在端侧 AI 有更好的表现。可以好好期待一下,发哥是站起来之后,硬的不行呀! 抽奖详情

13. 如何评价DeepSeek发布梁文锋署名论文,提出「条件记忆」及Engram记忆检索架构?有哪些亮点?

14. 以Transformer架构的big model已经走近了死胡同。这种以完全烧硬件为代价的“智能”就像我们写代码时写了10亿个if一样的愚蠢,但他们假装自己非常高级。Transformer是谷歌研发出来的,面向超级巨型IT公司,假设算力是无限的,忽略硬件成本,电力等基础设施的一种算法。这种算法的出现就像是计算机刚出现时的摩天大楼式的巨型二级管算机,它是笨重的,低效的,成本高昂。但另一方面,它也是AI发展的必然,只是现在人们把它幻想的太美好了。请问,现在谁还在乎30吨重的第一台计算机呢?现在的手机方寸之间,算力极其强大。所以AI的发展在大模型的路上遇到了成长的烦恼。以后的发展方向是AI小型化,小模型。将这些小型的智能模型嵌入到各种系统里,万物(硬件)皆有灵性,这就是AI的未来发展方向。大模型的算法是写死的,而不是自适应,它无法自己调整认知算法,完全靠既定的后台数学公式概率预测,所以是一种假装自己很智能的统计与匹配,属于高级自编辑的搜索引擎,这也是为什么transformer能成功的原因,因为它来自谷歌。当然这种模糊的匹配与人类很像,所以表现上出现了界面“智能”,但仅仅是像,因为人类有强大的自适应函数,可以自编程,大模型的统计的伪装就差远了。

15. 深聊GPT-5发布:过度营销的反噬与AI技术突破的困局【硅谷101】

16. 你对下一代Transformer架构的预测是什么?

17. 地平线的BPU经历了伯努利、贝叶斯、纳什的三代演进。以目标感知、场景理解、交互博弈作为自动驾驶算法演进的路标,地平线每一代BPU都精准地满足了各个自动驾驶技术发展节点上的关键需求。伯努利架构旨在解决精准识别道路上的车辆、行人、交通标志这些任务,它的主要使命是通过浮点到定点的能效优化,高效准确地完成图像识别和目标检测,为后续决策提供可靠的输入。伯努利架构的代表作是征程3,首发于长安。贝叶斯架构再接再厉,从目标感知进化到场景理解,致力于打通从感知到预测的闭环,通过场景理解为车辆后续的决策规划提供更连续、更深入的环境信息。由于对车周环境的理解更精细,贝叶斯通过脉动张量计算和提升计算单元的利用效率降低内存访问的频次和功耗,并通过优先处理高优先级任务,显著降低关键任务的延迟,从而支持更高的分辨率和更先进的算法模型,达到感知与预测的闭环。贝叶斯架构的代表作是征程5,首发于理想汽车。到了需要更强交互和博弈能力的L2+++和L3阶段,专为处理大参数Transformer模型和大规模交互式博弈而设计的纳什架构应运而生。纳什架构通过多脉动立方加速引擎实现引擎间的数据灵活流动,实现高效的能效和低带宽占用,通过灵活支持Transformer中的细小算子,更好地理解并预测其他交通参与者的意图,从而做出更拟人化更安全的决策,为端到端自动驾驶大模型提供硬件基础。纳什架构的代表作正是HSD的核心计算平台-征程6P,首发于奇瑞。#大v聊车#

18. 天玑 9500 性能首发实测!本期视频,我们带来了联发科天玑 9500 的现场实测报告。台积电第三代 3nm、全大核架构、最高主频 4.21GHz……纸面参数很强劲,方方面面亮点不少,具体实测出来什么水平?大家看视频了解一下~#有点东西# 姜唯的微博视频 抽奖详情

19. Transformer已死?DeepMind正在押注另一条AGI路线

20. 谷歌祭出Transformer杀手,8年首次大突破!掌门人划出AGI死线

21. 从nano banana看google为什么能够重新崛起,甚至隐隐要夺走OpenAI目前AI一哥的地位。如果说 OpenAI 是 AI 圈里最擅长搭积木的公司,那么 Google 就是造积木的那家公司。你去看 OpenAI 最出圈的几样东西——GPT 系列、DALL·E、Sora,其实背后的底层逻辑和方法几乎都能追溯到 Google。2017 年那篇《Attention is All You Need 》,是整个大模型时代的起点。Transformer 的提出,让神经网络第一次真正具备了规模化建模的可能,不管是 Self-Attention 还是 Multi-Head Attention,如今你能看到的几乎所有模型,都还在用这套框架的变体。再到 2018 年的 BERT,它最大的贡献不是单一性能指标上的突破,而是彻底改变了整个 NLP 的范式:先大规模预训练,再针对不同任务去微调或做后训练。这种思路直到今天还在延续,哪怕已经演化出不同分支,本质上还是那条路。Google 并不满足于只在语言模型里折腾。2020 年它又把 Transformer 搬到了视觉领域,Vision Transformer 一出,大家才发现原来图像也能用这种方式建模。这条技术线后来影响了包括 Sora 在内的大量工作,OpenAI 的视频生成看上去新奇,其实里面的时空 Transformer 思路,正是从 ViT 延伸出来的。只是 OpenAI 在产品化和叙事上更擅长,先声夺人。但当 Google 拿出 Veo 的时候,差距立刻被缩小了。要支撑这一切,算力是绕不开的底层。Google 很早就不打算完全依赖英伟达,它从 2016 年就开始自研 TPU 。这个选择现在看是正确的,因为 TPU 和它自己的软件栈(TensorFlow、JAX、Pathways)天然适配,让 Google 在大规模训练上的成本更低。Gemini 系列就是在 TPU 集群上跑出来的。更有意思的是,它还通过 Colab 这种形式,把 GPU、TPU 免费开放给全球的研究者和学生,让更多人能够上手,这在潜移默化中扩大了它的技术影响力。不过,如果只是发明技术,Google 可能永远只能被看作“学术公司”。一度它确实被外界调侃:论文满天飞,产品没声音。Brain、Research、DeepMind,各自都做出过亮眼成果,却缺少统一的出口。转折点出现在 2023 年,Google 把 Brain 和 DeepMind 合并,交给 Demis Hassabis 统一领导,目标就是做出能和 GPT-4 对标的产品。于是有了 Gemini,从最初被质疑,到今天在长上下文和多模态一致性上占到优势,Google 终于再次站在舞台中央。而且值得注意的是,Google 今天的 AI 产品线几乎每一条都站在顶点:(LLMArena大模型竞技场四个单榜,Gemini三个排第一)基础大模型有 Gemini 2.5 Pro,能在超长上下文和多模态任务里直接对标甚至超过 GPT-4o; 视频生成有 Veo3,画面质感和稳定性Top; 图像生成与编辑有 Nano Banana(Gemini 2.5 Flash),一致性和可控性在社区里反响非常的好,好评占绝大多数; 音频方向有 NotebookLM,把语音转录、总结、交互整合成一体,体验上远超大多数竞品。这说明 Google 已经不再是只会发论文的角色,而是真正把技术链条拉通,从底层算力、模型,到面向用户的应用产品,全面铺开。而且,它的每一条产品线都指向了一个清晰的方向:多模态、长上下文、跨平台生态。我觉得 Google 的故事最有意思的一点,就是它证明了“慢工出细活”在这个行业依然成立。它可能不会像 OpenAI 那样频繁丢出让人眼前一亮的演示,但一旦它把技术和产品线整合到位,往往能在多个方向上同时冲到顶点。长期主义、算力自给、团队整合,这几件事叠加在一起,才让它从“不被看好”走到今天。所以这也给行业留下一个清晰的分工逻辑:要么去造积木,要么去搭好积木,但千万别只停在中间。

22. 2025 年 7 月,阶跃星辰发布 Step-3 模型,3210 亿参数却比同类运行成本低 40%。其多矩阵分解注意力机制和分离式系统设计,让每 GPU 吞吐量达 4039 tokens / 秒,超竞争对手 74%,相关论文已发表。Step-3 的核心创新在于重新设计 AI 的 “大脑结构”。多矩阵分解注意力机制让多个注意力头共享精简记忆系统,减少内存占用;分离式设计则让 “前厅” 和 “后厨” 各司其职,实现流水线作业,提升效率。在成本控制上,Step-3 优势显著,处理长文本时优势更明显。它颠覆 “模型越大越贵” 的观念,证明运行成本取决于架构设计。实际测试中性能优异,还能适配多种硬件。你觉得这样的模型会给 AI 应用带来哪些改变?

23. 国产AI首次「长出」原生记忆,非Transformer架构成新王!机器狗当场引爆WAIC

24. Transformer架构是否已触及天花板?光靠Transformer能走通AGI吗?

25. AI的未来,也许不在于模型规模的无限扩大。 #大咖观察 #红衣聊AI #transformer神经网络架构 #人工智能

26. NEO 刚刚证明,每个主要的人工智能实验室建立的视觉模型都是错误的💀OpenAI、谷歌、Anthropic……他们都使用相同的方法:训练视觉编码器,将其固定在 LLM 上,祈祷对齐有效。NEO 说“如果我们只是......不这样做呢?”并从第一原理构建了原生视觉语言模型。这就是为什么这实际上是疯狂的:传统的 VLM 是弗兰肯斯坦架构。你采用预训练的视觉编码器(CLIP,等等)。添加一个投影层。将其附加到冻结的语言模型。希望他们学会互相交谈。它确实有效,但从根本上来说却是碎片化的。视觉和语言竞争模型容量。对齐的成本很高。训练是分阶段进行的。你强迫两个为不同事物设计的系统进行合作。NEO 彻底抛弃了这一点。它通过相同的自回归架构处理图像和文本——一种统一的视觉语言原语,可以从头开始学习这两种模式。无需单独的视觉编码器。无需投影操作。无需对齐税。实现这一目标的技术突破:1)具有混合掩蔽的本机多模态注意力 - 文本标记使用因果注意力(正常的 LLM 行为),图像标记使用完全双向注意力(详尽的视觉交互)。每种模态都在同一模型中同时以其自然的方式处理信息。2)Native-RoPE 为时间、高度和宽度维度分配不同的基本频率——解决文本序列(时间)和视觉数据(空间)之间的关键不匹配问题。不再通过仅限时间的位置嵌入强制空间信息。3)自适应架构在预训练期间使用预缓冲层,然后在微调期间将所有内容合并到整体主干中 - 自动分配编码、对齐和推理的容量。效率?3.9亿个图文示例。不是数十亿。3.9亿。它可以与 GPT-4V 和 LLaVA 相媲美。每个大型实验室都采用模块化架构,因为这是最早奏效的方法。NEO 则表明,我们一直以来都在采用昂贵而复杂的方法。#ai创造营##ai生活指南#

27. 【中国科研人员研发出类脑脉冲大模型】今日,中国科学院自动化研究所宣布,该研究所李国齐、徐波团队与沐曦MetaX合作,成功研发出类脑脉冲大模型“瞬悉1.0”(SpikingBrain-1.0)。据介绍,该模型基于团队原创的“内生复杂性”理论构建,在国产GPU平台上完成全流程训练与推理,显著提升了大模型高效处理极长文本或数据序列的效率和速度,展示了构建国产自主可控的新型(非Transformer)大模型架构生态的可行性。据了解,当前主流的Transformer模型,在处理超长文章或对话时速度会非常慢且成本极高,造成了巨大的资源消耗。与当前主流大模型架构(Transformer架构)不同,“瞬悉1.0”借鉴大脑神经元内部工作机制,清晰地展示了一条不断提升模型复杂度和性能的新型可行路径。该模型仅需约主流模型2%的数据量,就能在多项语言理解和推理任务中达到媲美众多主流模型的性能。中国科学院自动化研究所表示,这是我国首次提出大规模类脑线性基础模型架构,并首次在国产GPU算力集群上构建类脑脉冲大模型的训练和推理框架。其超长序列处理能力在法律与医学文档分析、复杂多智能体模拟、高能粒子物理实验、DNA序列分析、分子动力学轨迹等超长序列任务建模场景中具有显著的潜在效率优势。本次发布的大模型为新一代人工智能发展提供了非Transformer架构的新技术路线,并将启迪更低功耗的下一代神经形态计算理论和芯片设计。

28. 如何评价MiniMax视频团队首次开源的VTP 可扩展视觉 Tokenizer 预训练框架,有何优势?

29. 刚刚,梁文锋署名,DeepSeek元旦新论文要开启架构新篇章

30. T5Gemma模型再更新,谷歌还在坚持编码器-解码器架构

31. 元戎 CEO 周光在前天的 VLA 发布会上如此解释 VLA:- VLA 可以称为基于 GPT 的端到端模型,这与传统的 CNN 端到端模型有本质区别。- 如果 CNN 能做好推理,那 ChatGPT 就可能不需要出现了。VLA 模型正是基于 GPT-Transformer 的神经网络架构,具备更强的语义和逻辑推理能力。- VLA 和第一代端到端最根本的区别是模型架构变了——从 CNN 转向 GPT————哈?所以说了半天,我们在今年 VLA 量产之前体验到的所有端到端,都是基于 CNN 的?可是看各种传播口起码说了两三年基于 Transformer 的 BEV...是说 CNN 和 Transformer 的缝合怪?

32. 2026年将是AI从工具进化为协作伙伴的关键转折点。根据Dan McAteer的预测以及行业前沿的动态,我们正站在一个新时代的入口。首先,持续学习将被攻克。目前的模型像是每隔半年更新一次的静态快照,存在知识截止日期。随着Nested Learning和TITANS等架构的推进,AI将具备流式的智能,在交互中实时更新。这意味着模型不再有知识断层,它将从一个死板的工具变成一个与世界同步呼吸的生命体。其次,模型将实现自我验证。正如Noam Brown所预期的,可靠性和幻觉问题将在2026年得到根本性改善。当模型学会审视自己的逻辑并进行自我修正,AI将从一个偶尔胡言乱语的助手,变成一个真正值得信赖的决策支持系统。再者,算力与规模的红利远未见顶。我们甚至还没有看到由Blackwell架构训练出的顶级模型问世。摩尔定律依然在发挥作用,预训练、中段训练及强化学习的指数级增长将继续推高智能的上限。从深层视角来看,如果AI解决了所有答案,人类的价值将从寻找答案转向提出问题。解决者的时代正在落幕,提问者的时代正式开启。当智能变得廉价且无处不在,人类唯一的稀缺资源将是我们的愿景与好奇心。虽然在现实落地中,我们仍需面对数据治理、工作流适配以及操作成熟度等挑战,但正如历史所揭示的:问题出现,然后被解决。我们始终如此。2026年,AI将不再仅仅是屏幕里的演示,它将成为创造财富、解决真实难题并提升人类幸福感的基石。保持这种纯粹的乐观,因为我们正走向一个所有人都能更频繁微笑的未来。x.com/daniel_mac8/status/2003933645887725940

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章