最强模型只能过三成的题:AI写Verilog被783道真题打分后,手搓党吵成两派
九月底到十月初这几天,智能硬件圈的两条消息正好撞了个满怀。
一边,NVIDIA在EDA方向放出一串消息:拿Nemotron 3 Ultra搭配ACE-RTL智能体做RTL编码,宣称"在Verilog基准上领先开源模型"。 另一边,B站上有UP主晒出"只说了两次’继续’,GPT自己画完一块6层FPGA板"的过程,最后一轮跑了4小时、烧掉约26%的周额度。知乎哔哩哔哩
评论区却完全是另一个画风。那条6层板视频下面,点赞最高的评论(17赞)上来先泼冷水:"又不是DRC过了就等于能用。4层能做的就没必要上6层,只会增加成本。你看这个DCDC,布线横穿电感下面,耦合干扰严重。"第二条更损:“跟自动布线坐一桌”。哔哩哔哩
同一周,知乎上有人把NVIDIA自己开源的那份评测基准CVDP从头扒了一遍,得出的结论是:出题者写得最狠的一句话是——最先进的模型在代码生成上,通过率也不超过 34%。知乎
发布会说"领先",评测集说"三成",UP主说"能画板",评论区说"不能用"。这四句话到底哪个对?对这块感兴趣的人——不管是刚从单片机固件毕业想碰FPGA的手搓党,还是被"AI造芯"新闻晃了一下神的同学——这篇值得看完。
一、783道真题,错了就是0分:CVDP这把尺子为什么可信
先说这份基准本身的来路。CVDP全名Comprehensive Verilog Design Problems,NVIDIA团队提出,论文挂在arXiv上,数据集在GitHub(NVlabs/cvdp_benchmark,Apache 2.0许可)和HuggingFace上都能直接下载。它被行业机构Si2收为联盟基准(Coalition Benchmark),意思是这套评测方法不只NVIDIA一家自说自话。知乎
它和前辈VerilogEval那类"给个函数签名让模型填空"的短题最大的区别在于三条:
题目是资深硬件工程师出的,783道,覆盖从规格书到RTL、仿真验证再到debug的真实工作流,不是网上爬的代码片段;
打分不靠嘴:模型输出的RTL必须丢进真实的cocotb测试台里跑仿真,跑不通就是0分,没有"看起来差不多";
除了对错还算成本:答得再对,生成一次烧掉海量token、跑几十轮才收敛,在真实工程里同样没法用。

分数长这样(CVDP论文Table 2,非Agentic代码生成,pass@1,n=5):最强模型33.56%,整张榜没有一个过34%。更值得注意的是往下拆:同一个模型,从"单次问答"切到"多轮自主完成的Agentic任务",从33.56%掉到29.0%;而"复用已有模块实现新功能"这类题(cid05),只有24%,个别模型接近0%。知乎

翻译成手搓党的语言:AI写一个孤立的计数器、LFSR、FIFO,像模像样;让它接进你现成的工程、复用模块、把验证一起做完,就是另一道题了。
二、为什么Verilog比固件难为AI?三个原因,外加成本不对等
这个结果不算意外。知乎今年四月那篇《AI编程还没攻破Verilog》早就给过共识:语料稀缺、时序复杂,决定了AI写Verilog工程代码不如它写前端后端顺手。再展开一点:知乎
语料量级差几个数量级。Python、C的公开语料以百亿行计,Verilog的公开高质量语料本来就少,还混着大量坏代码。模型见没见过,是两回事。
并行语义骗不了人。软件代码写错,逻辑错了就是错了;Verilog描述的是同时发生的硬件行为,语法正确、C语言风格能过编译,不等于综合出来是你要的电路。
反馈回路重得多。写固件翻车,重刷一次,成本以分钟计;RTL时序不收敛,从综合、实现、看时序报告到改XDC,一轮就是几十分钟起步,烧到板子上翻车,成本就是钱。
那位做Agent实测的知乎作者(坏雷达研究所)打了个很圈层的比方:AI写的Verilog代码再漂亮,过时序,就只是穿着旗袍站在泥地里的美女——远看风情万种,近看鞋底全是泥。知乎
三、“模型60分,Agent90分”?和CVDP吵起来的那位,其实没矛盾
有意思的是,同一份"三成"数据,和一线实践者的体感看起来完全相反。
坏雷达研究所那篇的标题就叫《AI写verilog的能力只有60分,但Agent有90分》:单独让模型吐一段.v文件,给到六七十分;但只要把它放进能自己调用工具链的Agent里——自己打开Vivado工程、读最差路径、改RTL、补multicycle/false path约束、重新跑综合实现、对比修复前后的时序报告、没收敛就继续循环——最终产出能到八九十分。他的原话是"AI也许会犯错,但Agent会纠错"。他群里甚至有不懂算法、一行代码不写、纯靠跟AI聊天在ZYNQ上跑起来YOLO的工程师。知乎

这两边打架吗?不打。它们量的是不同的东西:CVDP量的是"从规格书到测试台全绿,全程没人"的自主完成率;实践者说的八九十分,前提是人提需求、人验收,AI在中间替你把几十轮脏活跑完。前者说明它还不是独立工程师,后者说明它已经是个很能干的操作工。B站那条"只说了两次继续"的视频恰好同时踩中这两点:能"说完就画完"是Agent闭环的功劳,评论区挑出的DCDC走线问题则是"没人验收"的代价——那位UP主自己在评论区也把验收的账认了:“现在AI做的板子,不能直接打,得人工进行调整才行”。哔哩哔哩
这也是为什么9月30日那条《关于AICoding-RTL的一些总结和处理》在B站是个值得收藏的信号:47个赞配137个收藏,藏赞比接近3:1——圈内人存的是"AI代码常见翻车特征清单",不是段子。AI生成的RTL有一眼可辨的毛病:写死的复位、不跨时钟域的处理、似是而非的状态机,老手扫一眼就知道下一步仿真会死在哪。哔哩哔哩
四、这笔账怎么算:哪些环节交给AI,哪些必须攥在自己手里
把上面所有信号合起来,给正在犹豫的DIY玩家一张分工表——
可以放心外包给AI的:单功能模块初稿(计数器、流水灯级别的组合/时序逻辑)、cocotb/testbench脚手架、把spec转成检查清单、读时序报告找关键路径、胶水脚本。这些恰好是CVDP里得分相对高的"模式化任务"区。知乎
必须自己攥着的:跨时钟域与复位策略、引脚与XDC约束、电源/地和模拟走线的取舍(就是那条17赞评论指出的位置)、以及一切"验收"环节。验收只认一条:没在自己环境里跑过仿真的AI代码,一律不算数——这正是CVDP的打分逻辑,也是你该给自己立的规矩。
成本意识:Agent闭环不是免费的。6层板那单,最后一轮4小时、约四分之一周额度。有Pro级订阅的人可以拿它换迭代次数;学生党电赛党拿的是额度更小甚至没有的账号,硬学UP主"只说继续",大概率在综合那一步排队等到比赛结束。预算表里,token和时间要排进材料费同一栏。哔哩哔哩
分人群建议:还不会读Verilog的(研一新生在知乎问过"现在还需要自己手搓verilog吗",高赞回答把前提说得很直白——看得懂,让AI写才正常。 所以得先手写过FIFO、计数器、状态机这三板斧再谈外包,否则AI犯了第三种错误你连症状都认不出;已经在做完整工程进阶FPGA的——值得试Agent闭环,从"读报告、改约束"这类低风险环节切入;纯玩ESP32的手搓党——CVDP的结论同样适用于你的固件流程,硬件这行"生成"和"能用"之间永远隔着一台真实仿真器或一块真实板子。知乎
五、接下来盯什么
三个信号:CVDP榜单会不会被NVIDIA自家的Nemotron+ACE-RTL刷新——刷新了也先去看它考的是非Agentic还是Agentic那半张榜;Si2联盟基准后面还会不会收新的国产工具链题目;以及开源侧RTLCoder(用EDA报错反馈训练、公开宣称超过GPT-3.5的本地模型)、BetterV(华为诺亚方舟团队合作、生成时带"质检员"逐token过滤PPA的ICML 2024工作)这条"让模型真正过综合"的路线,什么时候能接进普通玩家用得起的工具链。知乎

发布会的排名每个月都会换,尺子是留下的。CVDP整套数据开源,Apache 2.0,你把它下载下来,就能用同一套题量一量你手上的AI到底几斤几两——这比看十篇"AI造芯"通稿都管用。知乎
至于"AI画板、AI写芯片"值不值得跟:三成出头的自主通过率,配上一个很能干活但需要人验收的操作工——这就是2026年10月这件事的完整水位。先让自己成为那个验收的人,再谈让AI替你干活。