一块芯片500轮自主演进:阿里发布超级大模型,能自己设计芯片
8月3号阿里发Qwen3.8的时候,大部分人都在看跑分:2.4万亿参数,1M上下文,Arena全球第二,紧追Claude。
但说实话,跑分这东西见多了,今天你超我明天我超你,已经有点麻木了。真正让我后背一凉的,是官方文档里藏着的一个案例——这个大模型,自己设计了一块芯片。
不是辅助写代码,不是给工程师提建议,是从算法架构到RTL代码,再到仿真验证、逻辑综合、布局布线,全流程自己跑。没人告诉它怎么优化,没有参考设计,甚至连内部逻辑都没给,就给了个接口定义和一个“门数越少越好”的目标。
然后它自己跟自己死磕了500轮,把电路从8298门优化到了678门,芯片面积直接砍了81%,还跑通了500MHz时序。
这已经不是“AI辅助设计”了,这是AI在自己迭代芯片。

01、先简单说下跑分,确实站到第一梯队了
先快速过一下大家都在转的成绩单,知道个大概就行。
Qwen3.8是千问家族目前最大的模型,总参数2.4万亿,支持1M长上下文,能看图。在第三方盲测Arena里排全球第二,仅次于Anthropic的Claude。
具体到硬指标:
-论文能力PaperBench93.0分,比Claude的Fable5高4分多
-指令遵循IFBench82.8分,比Claude高了近20分
-电脑操作OSWorld86.1分,也略超
-编程排全球第四,视觉排全球第二
怎么说呢,就是国产大模型第一次真正站到了最顶级的牌桌上,跟GPT、Claude正面掰手腕不落下风。这个进步确实很大,但还在我的预期内。
真正超预期的,是下面这个芯片设计的能力。
文章配图-102、500轮自我博弈,它把自己设计的电路砍了92%
这次Qwen3.8做的任务,是设计一个GCD/RSA密码硬件加速器。说人话就是一块做加密运算的数字电路,属于典型的逻辑密集型模块,很考验工程师的优化功力。
最开始给它的东西特别简单:一个任务说明,一个只有输入输出接口的空壳子,再加一个自动评分脚本。评分标准就两个:第一,功能必须完全正确,4/6/8/16位各种情况算出来的结果一个bit都不能错;第二,用的逻辑门越少越好。
没有任何人类干预,没有参考设计,甚至连怎么实现的思路都没给。
然后Qwen3.8就开始自己跟自己玩了。
它第一个能跑通的版本,用了8298个门。这很正常,不管是人还是AI,第一版先保证能工作,肯定是又大又笨。

但接下来的操作就开始离谱了:
第22轮,它自己把整个除法器推翻重写了。它发现原来用的16位硬件取模除法器太占地方,自己换成了迭代移位减法架构。就这一步,门数直接从8298砍到了2010,少了6000多门,整个优化过程80%的收益都是这一步带来的。
这是什么概念?相当于一个工程师写了第一版代码,然后自己看了半天说"不对,这个思路从根上就错了",然后全部推倒重来。很多工程师工作三五年,都不一定有这个魄力和判断力。
然后它继续死磕:
-35到48轮,它发现有些逻辑其实是冗余的,安全地删掉了整个REDUCE阶段,把两个模块合并成一个,门数降到1304;
-60到113轮,它开始抠寄存器和状态机,删掉没用的触发器,把"先比较再减法"合成一个减法器,门数降到907;
-170到252轮,它直接打破了模块边界,把好几个子模块揉成一团,全局共享同一组减法器,门数降到765;
-最后443到500轮,它开始在门级抠细节,共享或非门树,调整选择逻辑,最终定格在678门。
整整500轮交互,71次评估,13个关键里程碑。它自己写代码,自己跑仿真,自己看报错,自己找瓶颈,自己改,再跑,再改。中间有好几次,我以为它已经到极限了,结果过了一百多轮,它又搞出了一个结构性的大改动。
最恐怖的是什么?它没有陷入局部最优。很多优化算法,或者说很多人类工程师,改到一定程度觉得"差不多了",就停了。但Qwen3.8在几百轮之后,还能发起架构级的重构,而不是在细枝末节上修修补补。
最后它甚至自己把RTL代码送去做了布局布线,生成了真正的芯片版图。结果是:芯片面积从106×106微米缩小到46×46微米,布线长度从33000微米降到4000多微米,原来时序违例4.46纳秒根本跑不起来,最后不仅能跑,还跑到了500MHz,时序还留了0.66纳秒的余量。
面积砍了81%,速度反而更快了。

03、这意味着什么?AI设计AI芯片的闭环,快要成了
我知道有人会说:这不就是个小模块吗?又不是设计整个CPU。
没错,这只是一个加速器模块,还不是完整的芯片。但你要看到这件事的本质:大模型已经具备了端到端的芯片设计能力,而且它的优化方向,和人类工程师是一样的——先保证功能正确,再做架构级优化,再抠逻辑,最后抠物理实现。
更重要的是,它不知疲倦。人类工程师可能优化个十几版就到头了,它可以优化500版、5000版,而且永远理性,永远不会嫌麻烦,永远不会说"算了就这样吧"。
你想想这个场景:未来的芯片设计,不是几百个工程师画几年,而是大模型在沙箱里自己跟自己博弈,几天甚至几小时就迭代几百版,每一版都比上一版更小、更快、更省电。
而且这还只是个开始。Qwen3.8能设计密码加速器,那它能不能设计CPU核心?能不能设计GPU?能不能设计AI加速芯片?
如果有一天,AI设计的芯片,比人类工程师设计的还要好,然后用这块芯片去跑更强的AI,更强的AI再去设计更好的芯片——这个闭环一旦转起来,那才是真正的指数级加速。
之前大家都在说"AI写代码",但写的都是应用层代码,是给CPU跑的。现在AI开始写硬件了,开始设计跑代码的东西本身了。这是完全不同的两个层级。

04、国产大模型,真的走到无人区了
最后说点感触。
曾几何时,我们说国产大模型,都是“跟在GPT后面”、“差距还有半年”、“虽然差点但够用了”。但这次Qwen3.8展示的芯片设计能力,我没在GPT或者Claude的公开演示里见过同等级别的东西。
这不是跟着别人走了,这是自己走到前面去了。
更有意思的是,阿里做这个事的路径也很有意思。别人都在卷对话、卷Agent、卷多模态的时候,它悄悄把大模型塞进了芯片设计这个最硬核、最专业的领域,而且一做就是全流程。
2.4万亿参数不是白给的。当模型大到一定程度,真的会涌现出一些你想不到的能力。之前谁能想到,一个语言模型,居然能懂数字电路,能做逻辑综合,能看懂时序报告?
现在它能做678门的小模块,那下一代呢?再下一代呢?
芯片设计这个行业,可能要变天了。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
