AI写Verilog:考题通过率92%,真实工程60分,这周四组数据把边界说清楚了

源自6位全网作者

14:27

这两天,Verilog 圈子里有两组数据在打架。

一边,是有人拿经典的 VerilogEval V2 题库实测了 gemini-3-flash-thinking 模型:156 道模块级设计题,做对 144 道,通过率 92.31%。知乎要知道,按这位作者梳理的往年论文,上一代模型在这个题库上最高也就 70% 左右,一年时间进步非常明显。

另一边,8 月 11 日,一位高强度用 AI 干 FPGA 活的工程师发了篇体验文,标题直接开炮:AI 写 Verilog 的能力只有 60 分。

两个数字都是真的,但它们量的根本不是一回事。信了 92% 就把工程交给 AI,大概率要吃瘪;信了 60 分完全不用,又白白亏掉一截效率。我把最近一周看到的四份材料摆到一起,把这个边界给你拆清楚。

这四个数字,各自在量什么

先看最亮眼的 92.31%。它来自知乎用户"独行"4 月份的实测,8 月又被翻出来反复讨论。几个关键前提要说明白:题库是 VerilogEval V2,156 道都是教科书式的小模块题——移位寄存器、优先编码器、序列检测器这类;每题只给三轮对话,没有反馈回路、没有工具链;通过标准是仿真和参考代码行为一致。

AI写Verilog:考题通过率92%,真实工程60分,这周四组数据把边界说清楚了

更有意思的是他对 12 道失败题的复盘:2 道是测试脚本仿真超时,代码本身没错;2 道是题目没给复位信号导致的初值问题;剩下 8 道是"理解错误",但其中一大半,比如"数据该在停止信号当拍还是下一拍输出 done"这种,连人类工程师只看题面也很难和参考答案做出一模一样。换句话说,拦住 AI 的很大一部分不是能力,是需求描述本身的含糊。知乎

再看 84%。8 月 5 日 arXiv 上挂了一篇论文,让 Copilot 自动检测并修复 Verilog 里的硬件安全漏洞,32 个模块里 27 个"修复通过",通过率 84%。听着很唬人,但解读这篇论文的文章指出了一个扎眼的反差:5 个本来就没漏洞的对照模块,全部被 AI 报出了至少一个"漏洞"。知乎这个 84% 混合了漏洞判断、自动生成的测试平台、仿真结果好几道工序,既不是检出率,更不是补丁正确率。

然后是 60 分变 85 分。那位 FPGA 工程师的原话是:单让 AI 写 Verilog 代码,能力 60 到 70 分;可一旦让 AI 以 Agent 的形式接上工具链——自己打开 Vivado 工程、读时序报告、改 RTL、补 XDC 约束、重跑综合实现、再对比前后结果——表现能到 85 分。知乎

最后一份是 7 月底的一篇实操记录:一位 IC 设计师用 Trae SOLO 花一天"氛围编程",让 AI 独立完成一个 UART 发送模块。结论很具体——AI 帮他省了 60% 到 70% 的机械编码时间。知乎从零手写要一个半到两小时,AI 出初版后他只花了 15 分钟精修。但精修的那三处恰恰是关键:状态机用了 one-hot 编码浪费触发器、发送忙的时候没锁存数据、完成信号给的是电平不是脉冲。AI 还自作主张加了 16 倍过采样——那是接收端才需要的东西。

为什么考题 92%,干活只有 60 分

把四份材料摆一起,规律其实很清楚:AI 的强项是"生成",弱项是"验证"。

Verilog 和软件代码最大的区别是,代码写出来只是开始。软件跑通就是跑通,硬件代码要过三道关:综合能不能过、时序收不收敛、上板功能对不对。考题里只有第一道关的影子,所以 AI 能考 92%;真实工程里三道关全在,而且每一关的反馈都不在代码文本里,在工具的报告里,所以裸模型只剩 60 分。

AI写Verilog:考题通过率92%,真实工程60分,这周四组数据把边界说清楚了

Agent 之所以能拉到 85 分,本质是把这三道关的反馈接进了循环:改完代码自己跑综合,时序不收敛自己看报告接着改。人工调时序一天试不了几次,Agent 可以不知疲倦地整夜迭代。更极端的案例是一位不懂 YOLO 算法的工程师:一行代码没写,纯靠和 AI 对话,把模型跑上了 ZYNQ。知乎

但 84% 那篇论文恰好暴露了这个闭环的死穴:如果找漏洞的是它、写测试平台的是它、改代码的还是它,最后拿自己写的测试给自己打分,绿灯可能只是同一套错误假设顺利跑通。五道假阳性就是证据——AI 很容易把"没做额外防护"当成"设计有缺陷"。

所以判断 AI 的 Verilog 输出能不能用,别问"跑没跑通",问三个问题:测试平台是不是独立于生成代码写出来的?补丁有没有偷偷改接口、改行为?改动是谁独立验证的?

实操清单:哪些环节现在就能交给它

结合这四份材料,我自己的分级是这样的,供参考:

放心交给 AI 的:testbench 骨架、模块说明文档、约束脚本草稿、HDLBits 那种小模块、lint 级别的低级错误修复。这些要么验证成本低,要么错了立刻能看出来。

可以用但必须人工把关的:模块级代码生成,前提是测试激励不能全信 AI 自己那套,边界场景自己补;时序优化建议,必须对比修改前后的时序报告,别只看它说"已收敛"。

暂时别碰的:安全相关、车规这类关键路径的补丁——那篇论文的五道假阳性就是前车之鉴;跨时钟域这种高危逻辑,AI 对复位和初值的处理目前还经常出幺蛾子;最终的时序签核,责任必须留在人手里。

还有一个省钱提醒:Agent 跑起来 token 烧得很快,综合实现一轮几十分钟的工程,让它空转迭代之前,先确认你的需求文档写得足够严谨。实测已经反复证明,需求含糊时 AI 的输出就是概率游戏——这次给你下一拍拉高,下次可能就是当拍拉高。把需求写清楚,比换个更贵的模型管用。

这件事和谁有关

如果你是一线工程师,这周就可以动手试:从一个小模块开始,让 Agent 接管"写代码—综合—看时序"的循环,自己守住测试和签核两道关。

如果你是备战秋招的同学——8 月秋招已经开闸,最近知乎上有人用 AI 爬取题库整理的 SystemVerilog 和 UVM 高频考点里,考的仍然是覆盖率、TLM、AXI 握手这些硬通货,AI 还进不了题库。知乎但"你怎么看 AI 生成的 RTL、你怎么验证它"正在变成面试里的新谈资,把今天这几个数字和背后的逻辑消化掉,比背一段八股有说服力。

如果你在准备集创赛——第十届全国大学生集成电路创新创业大赛全国总决赛的参赛事项通知 7 月底已经发布。知乎按通知附件的日程,芯片设计与产业链赛项 8 月 18 日报到、19 到 20 日答辩,芯片应用与芯创成果赛项 23 日报到、24 日答辩,两场颁奖分别在 21 日和 25 日。平时训练用 AI 加速调 bug 没问题,但要记住 Trae 那篇实操的教训:AI 初版永远留着边界保护的窟窿,赛场上能救你的,是你知道窟窿在哪。

AI写Verilog:考题通过率92%,真实工程60分,这周四组数据把边界说清楚了

一句话收尾:AI 写 Verilog 不是"能不能用"的问题,是"在哪一段流水线用、谁来验收"的问题。往后值得盯两个信号:一是有人晒出项目级 RTL 而不是题库级的实测数据,二是 EDA 厂商把 Agent 闭环做进官方流程。这两个信号出现之前,考题分数还会涨,但验收权交出去的那天,才是真翻车的那天。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章