Transformer,王座不保?!今天,一款AI模型SubQ横空出世,震撼了全世界。这是全球首个基于完全亚二次方稀疏注意力架构(SSA)的模型,上下文高达1200万Token。SubQ的核心突破叫做SSA——亚二次方稀疏注意力(Subquadratic Sparse Attention)。它的思路出奇地简单,不再让每个token和所有token做比较。既然训练好的模型中,绝大多数注意力权重都接近零0,那为什么还要算它们?SSA的做法是,对每一个query,基于「内容」选择序列中真正值得关注的位置,然后只在这些位置上精确计算注意力。它只计算那些真正有意义的交互,跳过其余99%以上的无用计算。以下是SSA的三大关键特性—— 线性扩展计算量随选中的位置数量增长,而不是随整个序列长度增长。上下文翻倍,成本只翻倍,不再是翻四倍。 内容依赖路由模型根据语义决定看哪里,而不是根据位置。关键信息在序列第3个token还是第1100万个token,都能被找到。 精确检索不像循环模型那样把信息压缩成固定状态,SSA保留了从任意位置精确取回信息的能力。说白了,SSA不是「把密集注意力算得更快」,而是「让模型做更少的注意力计算」。减少的计算量,直接转化为速度。速度狂飙52.5倍,成本不到Opus 5%SubQ放出的数据,每一条都在暴击:在100万token长度上,SSA比标准密集注意力+FlashAttention-2快52.2倍。在12.8万token上快7.2倍,25.6万token快13.2倍,51.2万token快23倍。显而易见,上下文越长,优势越碾压。这正是SSA线性扩展的直接体现——密集注意力越长越慢,SSA越长越划算。再来看算力消耗,在100万token下,注意力FLOP减少了62.5倍。在1200万token下,这个数字飙升到接近1000倍。至于成本,Subquadratic给了一个非常直观的对比——在RULER 128K基准测试上,SubQ花费8美元,Opus为2600美元,直接拉出了300倍的成本差距。最关键的是,这些速度和成本优势,并没有以牺牲准确率为代价。RULER 128K基准测试: SubQ拿下95%,Opus 4.6是94.8%;SWE-Bench Verified(代码工程): SubQ得分81.8,超过Opus 4.6的80.8。MRCR v2(长上下文检索): SubQ拿到65.9%,虽然低于Opus 4.6的78%,但远超GPT 5.4(39%)和Gemini 3.1 Pro(23%)。这组数字放在一起看,细思极恐——一家种子轮公司,用不到Opus 5%的成本,在多项核心基准测试上打平甚至超过了Anthropic和OpenAI的旗舰模型。一个提示词,SubQ即可处理1200万Token的超长信息:无论是整个代码库、数月的 PR 记录,还是长期运行的 AI 智能体状态,全都游刃有余,而且成本仅需原来的五分之一。不得不说,若这一切成真,这将是Transformer问世以来最重要的架构级突破。