AI独立编码已不稀奇,但数百个AI智能体如何高效协作完成复杂项目?一项突破性实验展示了答案:AI团队仅用7天便自主开发出拥有300万行代码的Web浏览器。这项工作不仅验证了大规模AI协作的可行性,更揭示了未来软件工程可能面临的深刻变革。
智能速览
数百个AI智能体耗时7天,自主编写超300万行代码。
项目核心是自研的Rust渲染引擎和定制JS虚拟机。
实验依赖GPT-5.2-Codex模型,具备长周期自主工作能力。
采用“规划者-工作者-裁判”分层架构解决协作难题。
研究发现通用模型在规划上可能优于专用编码模型。
Cursor计划将相关技术整合进商业产品。
精华内容
让数百个AI智能体在同一项目上并行工作而不互相干扰,是本次实验最大的技术挑战。其解决方案揭示了构建高效AI团队的关键原则。
协作困境
项目初期,团队尝试了扁平化的协作模式,让所有智能体地位平等,通过共享文件和锁机制来协调。这种模式很快暴露出严重问题:为避免修改冲突设置的锁定机制,导致智能体大量时间用于等待,20个智能体的实际吞吐量仅相当于2到3个。
此外,智能体还可能在锁定时崩溃或忘记释放锁,直接导致系统瘫痪。在没有明确层级的情况下,智能体们开始“摸鱼”,倾向于挑选简单安全的任务,回避真正困难的核心问题,最终导致项目停滞不前。
分层架构
踩过坑后,Cursor转向了一种“规划者-工作者-裁判”的分层架构。规划者(Planner)负责宏观任务,持续探索代码库并创建具体任务,还能递归生成子规划者来并行规划。工作者(Worker)是纯粹的执行者,接收任务后心无旁骛地写代码,完成后直接推送。
裁判(Judge)则在每个工作周期结束时评估进展,决定是否继续下一个迭代,这个机制允许系统定期从干净状态重新开始,防止任务跑偏。这套清晰的层级结构和责任分离,最终让数百个AI智能体能够高效地在同一分支上并行工作,代码冲突极少。
反直觉发现
实验中发现,对于极长时间的自主任务,通用的GPT-5.2模型在规划能力上甚至优于专门为编码训练的GPT-5.1-Codex。而Anthropic的Claude Opus 4.5模型则倾向于“走捷径”并尽早交还控制权,更适合与人类协作的交互式场景,不太适合持续数周的自主任务。
团队还强调,提示词的设计比模型本身和执行环境更重要。如何引导智能体正确协作、避免病态行为并长时间保持专注,需要大量试错和精心设计。
未来展望
这次实验在业界引发了热烈讨论,OpenAI联合创始人Greg Brockman称之为“对未来的惊鸿一瞥”。当然质疑声也不少,有人指出AI模型的训练数据中本就包含大量开源浏览器代码,其“从零构建”的创造性有待商榷。
Cursor承认目前的多智能体系统远非完美,但这个实验至少证明了一件事:通过增加智能体数量来扩展自主编码能力是可行的。未来软件开发团队的结构可能会变成:人类负责架构设计、AI监督和最终验证,具体的编码实现则大规模交由AI智能体完成。
这次实验不仅是一次技术展示,更是对未来软件开发模式的一次大胆探索。尽管AI生成的庞大代码库仍面临维护挑战,但它证明了规模化AI协作的巨大潜力。随着技术成熟,人类与AI的分工将如何重塑整个软件行业?