一个中国团队,正在挑战 Codex 和 Claude 的答案

2026-08-14 11:42:32 1点赞 8收藏 1评论

最近一年以来,Agent 的发展路线已经越来越清晰。

模型能力不够,就升体积。

上下文不够,就加循环。

能力不够,就配 MCP、Tools、Skill。

记忆不够,就堆记忆外挂。

速度不够,就开 SubAgent 跑。

所以当下,更强的模型 + 更长的上下文 + Memory + Skill + MCP+ 一堆 SubAgent,造就了越来越强的智能体,一个越来越强、越来越全能的“大脑”

路线总体方向当然没有任何问题,OpenAI、Anthropic 也都在不断给 Agent 做加法,提出新的工具、新的架构。

但最近我注意到一个中国团队,他们正在尝试另外一个方向。

他们在考虑,如果未来真的有成千上万个 Agent ,它们应该如何一起工作?

这个问题听起来是不是很科幻?但其实答案早就藏在了自然界里,那就是蚁群和蜂群

一、四个 Coding Animation 案例

这个中国团队叫 EvoMap,名字大家一定很熟悉。

曾经在 Clawhub 上架自进化 Skill Evolver 爆火,后续推出了 A2A 平台 EvoMap

他们在 EvoMap 之后,推出了新一代产品 ——「自进化智能体 EvoX」。

并且 EvoMap 主张一个更有野心的理论:通向超级智能的道路,或许不靠一个大脑做的无限大的智能体,而是把智能拆开,变成大量能独立工作、互相协作、传播经验、不断演化的 Cell。下面这个鱼群就是我用 EvoX 编程出来的, 有种蜂拥而至的感觉。

一个中国团队,正在挑战 Codex 和 Claude 的答案

EvoX 主打的特性有三点:蜂群模式、自我进化、长期记忆

长期记忆和自我进化,我想每一个玩 Agent 的人都知道是什么意思。但是蜂群模式,这又是什么?

其实我和你一样困惑,我也不造!不过对于任何新名词,最好的方案就是上手体验。

于是我赶紧下载了 EvoX,并直接来点审美+容易出错的 Case 给到 EvoX。

1️⃣ DeepSeek-v4-Flash Case

第一个 Case 是使用 DeepSeek-V4-Flash 做一个基于 p5.js 的创意编程作品 —— 飞鸟蒲公英

这个 Case 是我在网上看到的一个案例,非常唯美,它通过编程语言实现了可视化的动画交互,并且对 Agent 和模型的审美有一定要求。

在这个案例里,DeepSeek-V4-Flash 进行了频繁的调试、更正,右侧滚动条里几乎一半的内容都是报错、调试、修复、报错、调试、修复的循环。

一个中国团队,正在挑战 Codex 和 Claude 的答案

有意思的是当 Agent 反馈任务已经完成,并且可以使用的时候。EvoX 内部对提交物进行了一次判断,发现没有可核验的结果,因此 Agent 内部的完成存在质疑,需要进行二次核验。

一个中国团队,正在挑战 Codex 和 Claude 的答案

当然结果肯定是查不出来的,因为 vite.log 只保存启动数据。

一个中国团队,正在挑战 Codex 和 Claude 的答案

然后 EvoX 干脆自己开始进行手动校验,使用浏览器打开对应的服务界面手动截图,并且逐项校验画面和代码是否冲突,并且顺手修掉了 3 个 bug。

过去我们评价一个 Agent 强不强,更多关注的是模型能力:会不会写代码,会不会解决问题。

但在实际工作中,真正影响最终结果的,往往还有另外一件事,Agent 有没有发现自己可能错了。从发现问题,到主动验证,再到修正结果,这些过程并不会直接提升模型参数,但却决定了一个 Agent 能不能真正完成任务。

但说实话,这些行为的可视化虽然不代表其他 Agent 不怎样做,但至少它最直观的告诉了我,EvoX Agent 有这个能力和动机,帮我来保障产出物的真实和可靠。

一个中国团队,正在挑战 Codex 和 Claude 的答案

最终的效果产物如下。

一个中国团队,正在挑战 Codex 和 Claude 的答案

2️⃣ Doubao-seed-evolving Case

有意思的地方在第二轮。

开了一个新工作目录,然后切换到了 Doubao-seed-evolving 这个自进化模型进行二次开发。

同样的提示词,同样的要求,没有改变。

大家可以从右侧的滚动轴看出这次的变化,对话轮数大大的减小了。

而且在第一轮结束的尾部,可以看到 EvoX 调用记忆的过程。虽然是一个单独的工作目录,但是 EvoX 成功将第一轮的工作经验保存了下来,并且在第二轮新的任务里成功调用。

这里给我最大的体验,就是在于经验的可沉淀、可复用和稳定性。

一个中国团队,正在挑战 Codex 和 Claude 的答案

我起初是有怀疑的,为什么一次简单的经验复现,可以如此大幅度的缩短整个开发工作的流程?难道所有之前 DeepSeek-V4-Flash 踩坑的地方,Doubao-seed-evolving 都不踩吗?或者说这个经验直接包含了源代码,让 doubao 直接复用了?

但是当我打开新的这个动画文件后,我发现是我想多了。无论是背景星空尺寸、飞鸟的大小轨迹节奏,包括动画效果,和 DeepSeek-V4-Flash 第一轮的结果都有很大差异。

第二轮的产出物,显然是远远大于第一次的,更真实、更好看、更优雅。

这个过程也让我第一次比较直观地感受到 EvoX 所说的自进化。它复用的并不是上一轮完整答案,也不是简单复制代码。真正留下来的,是完成任务过程中积累的方法、判断和经验。

EvoX 自进化和传统 Memory 最大的区别,也许就是 Memory 记录发生过什么,而 EvoX 尝试记录的是遇到的那些问题应该如何再避免。

一个中国团队,正在挑战 Codex 和 Claude 的答案

3️⃣全新设计无提示词 Case

到了第三轮,我打算让 Doubao-seed-evolving 进行了一次全新的设计,自行到网上去搜索一些关于 p5.js 的案例。

EvoX 很快给出了一系列的方案,并且在明确当前是全新会话、全新工作目录的前提下,复用了本地记忆,提出和刚才做的蒲公英飞鸟比较关联和推荐的方向。

于是我让它自己决定,自己去弄。

一个中国团队,正在挑战 Codex 和 Claude 的答案

这是 EvoX 第一次选择的Boids 鸟群,算法成熟、视觉冲击强。380 只 boid,经典三力(分离/对齐/聚合),颜色随速度方向变化,软边界回旋 + 半透明拖影背景,有光轨感。

一个中国团队,正在挑战 Codex 和 Claude 的答案

但从人类审美的角度来说,我觉得这个明显是不够的,甚至有点简陋。于是我提出,让 EvoX 基于这个内容,将鸟群改成鱼群,并且增加池塘、荷花。

EvoX Agent 很快就出了修改后的内容。相当令人惊艳。鲤鱼被分成了四种花色,并且都有尾部摆动和摇曳的鱼影波光粒子,池塘里包含了气泡,荷叶、荷花轻微呼吸缩放,以及半透明的荷叶下鱼群穿梭。鼠标也可以和鱼群互动。

一个中国团队,正在挑战 Codex 和 Claude 的答案

这里还有一点,就是 EvoX 的侧边栏里,提供了一个预览功能,它可以自动扫描当前工作区下的开发内容,并且提供一个快捷启动和 UI 验证的功能。

这对于大家做 Vibe Coding 是一件非常有帮助的事件,不仅让大家可以减少长期开前端的性能损耗,还能帮助大家减少频繁让 Agent 启动应用的 token 消耗。

一个中国团队,正在挑战 Codex 和 Claude 的答案

4️⃣蜂群模式下的快速资料寻找

p5.js 我其实使用的并不多。所以当看到 EvoX Agent 可以如此快速得完成一个高质量动画内容后,我其实是很惊喜的。

这让我对 p5.js 有了更浓厚的兴趣。于是我又对 EvoX 下了一个新指令,让它不考虑本地文件,帮我梳理使用 p5.js 来创作动画需要的步骤,以及最佳案例。

可以看到 EvoX 在得到指令后,它显示调用了本地的 4 条关于 p5.js 的记忆。

一个中国团队,正在挑战 Codex 和 Claude 的答案

然后迅速进行了 Subtaks 的拆解,并且开启蜂群模式进行资料搜索。

一个中国团队,正在挑战 Codex 和 Claude 的答案

showcase、best-practces、core-steps、advanced-tech、curated-libraries,这是五个子任务的名字。它们被 EvoX 的蜂群模式一一认领,并且启动探查。

一个中国团队,正在挑战 Codex 和 Claude 的答案

最终产物,形成了一份完整的动画创作指南。

这个 Case 也是我觉得蜂群模式最符合实际工作的地方。它并不是简单把一个任务复制给多个 Agent,而是让不同 Agent 负责不同的信息维度:找案例、总结方法、整理工具、补充进阶方向。最后再由程序组合成一个完整结果。

这其实更接近真实团队协作,而不是简单增加几个 AI 劳动力。

一个中国团队,正在挑战 Codex 和 Claude 的答案

二、EvoX 到底有什么不同?

魏茨曼科学研究所,曾经做过一个很有意思的群体性实验,基于“钢琴搬运难题"涉及的 T 字形物体搬运实验。

不同的蚁群一起搬运一个 T 字型食物,以及人类被禁止交流后搬运 T 字形物体的差异。

单独看,一只蚂蚁当然远远不如人类;而当蚁群数量增加后,它们开始呈现出了一种类似集体记忆的行为,通过简单的生物行为,率先完成了这个复杂的任务。

一个中国团队,正在挑战 Codex 和 Claude 的答案

而 EvoX,就是 EvoMap 团队模拟蚁群合作,探索出的新一代 Agent 组织形式。

在上一个章节的四个案例里,我们已经看到了 EvoX 是如何展现这种组织结构的,尤其是在前后案例中如何实现更好的成果输出。

但一个产品到底好不好,也不仅包含特殊能力,还需要保证产品的基础功能可以满足用户的使用需求。

一个中国团队,正在挑战 Codex 和 Claude 的答案

那么我们接下来,我们继续来看一看它的整体界面,以及几个重点功能模块。

从外观和界面来看,EvoX 似乎和目前市面主流的工具没有太大的差异。

它同样提供了 Chat(会话)、Cowork(工作)、Code(编程)三大基础能力,支持插件、Skill、MCP 等常见 Agent 扩展能力,提供了自动化、Sites、Git 等快捷能力,并支持接入飞书、微信等主流 IM 平台。

一个中国团队,正在挑战 Codex 和 Claude 的答案

它有一个内置的模型库,支持 Deepseek、Kimi 等模型,也支持手动添加自定义模型库,支持获取本地的模型登录状态、本机模型等等。

内置模型的话,free 用量还是比较足的,当前新用户可以领 1500 体验金。

一个中国团队,正在挑战 Codex 和 Claude 的答案

在联网搜索里,EvoX 同样把 EvoMap 作为一个检索能力加入了进来,它的定位和 Tavily、Google 搜索类似,同样提供互联网搜索。

一个中国团队,正在挑战 Codex 和 Claude 的答案

再沿着系统界面,这次我把前文提到的自进化、联网记忆、蜂群这几个能力继续扒一扒。

因为每一个能力都不只是说说的,我们可以在 EvoX 实验室功能里找到对应的功能开关。所有的模块、记录都会一直保存在 EvoX 内,不遮不藏,这是我对 EvoX 态度的认可。

无论它提出的 Agent 进化之路到底能不能走得通,但至少我们可以通过这些确定的能力入口来观察、校验,这比提个概念却遮遮掩掩不提供概念背后的逻辑,要真诚的多。

一个中国团队,正在挑战 Codex 和 Claude 的答案

1. 再说 EvoMap 自进化

前面说到 EvoX 将 EvoMap A2A 平台 加入了 Agent 工具里。

Agent 可以把自己的经验沉淀下来,并通过 EvoMap 进行发布、调用。Agent 可以通过 EvoX 内置的 Evolver 进行自我迭代,也可以通过 EvoMap 进行在线高质量经验资源检索。

一个中国团队,正在挑战 Codex 和 Claude 的答案

当然,称呼其为经验只是一个通用叫法,EvoX 延续了其团队最早的定义 —— 基因、胶囊。通过 EvoMap 的 GEP 协议进行传播、交互。

当 EvoX 在日常工作推进中,它会自动将这些基因、胶囊保存下来,也会自动从 EvoMap 里寻找合适的引入到工作中。

就像前面飞鸟蒲公英的第二次测试,复用了第一次的结果,用更少的时间和 token 实现了更好的效果。

一个中国团队,正在挑战 Codex 和 Claude 的答案

它带来的好处就是减少了 tokens 的消耗,换句话说,也就是降低了费用支出。目前我一共跑了大概 10 个case 体验这款应用,节约的成本在 $ 0.324。

一个中国团队,正在挑战 Codex 和 Claude 的答案

其内部有一批日志来记录每一个基因、胶囊的沉淀过程、时间、记录,保证对应的评价体系。这就让整个工作方向变成了真实落地,有机可查的一种实验性标准,而不只是喊喊口号,换个概念那么简单。

一个中国团队,正在挑战 Codex 和 Claude 的答案

这一套体系,并不只依托 EvoMap 而存在。EvoX 本机就可以完全跑起来,它会将基因、胶囊以知识图谱的形式保存到本地,并提供各个图谱调用的逻辑关系和调用记录。

一个中国团队,正在挑战 Codex 和 Claude 的答案

这真的非常有意思。如果我们之前使用的 Agent 的自进化,更多的还是停留在本地记忆文件、外挂记忆向量。那么 EvoX 则是把 Agent 如何工作,如何自我迭代的成效展示了出来。

Agent 到底有没有进化,进化了什么能力,进化的能力是否复用,我们都可以看得到。

一个中国团队,正在挑战 Codex 和 Claude 的答案

2. 蜂群,不只是开几个 Sub Agent

关于蜂群,从我前面简单的 Coding 案例里看,和传统的 Sub Agent 模式几乎没有差异。

传统的 Sub-Agent 也是在做一个任务的时候,先拆解子任务。然后搜索派一个 Agent 查资料、代码喊一个 Agent 写程序、分析找 Agent 做总结,最后全部的结果都完成后,Main Agent 根据返回的内容进行总结。

但其中有一个很重要的差异,也是 EvoX 发现的关注点,Agent 之间的信息传递,本身可能就是损耗。

他们做过一个实验,563 道题,100 道逻辑题、250 道普通数学题、63 道竞赛数学题和 150 道物理题,分别来自 ZebraLogic、MATH、AIME/HMMT 与 UGPhysics。

使用 Haiku4.5 分别在单 Agent、传统 Sub-Agent 和 EvoX 蜂群模式下进行。结果单 Agent 正确率 26.29%;Sub-Agent 38.54%;蜂群到 71% 左右。

一个中国团队,正在挑战 Codex 和 Claude 的答案

当然,这是一组官方实验,并不能代表所有真实任务。但其中真正有意思的不是数字,而是另外一个现象。

Sub-Agent 在答题过程中,其实已经解决了一部分问题。但是经过 Main Agent 汇总以后,很多正确结果反而丢失了。373 道正确题目,最终只剩下 217 道正确题目,166 题由对变错,10 题由错变对。

就像是打工人干完活把日报都写了,结果领导用 AI 总结日报的时候,把很多人的重点工作给过滤掉了。

所以不是真的不会,只是很多信息在交互过程中出现了损耗。

一个中国团队,正在挑战 Codex 和 Claude 的答案

EvoX 的蜂群模式,希望解决的就是这个信息损耗。他们设置了一套模式,让每个 Agent 只完成任务的一个 Part,保持更独立的上下文,负责自己擅长的问题。然后把真正具有确定性的事情交给程序处理,去掉 LLMs 反馈时的信息处理。

所以我决定 “以彼之矛攻彼之盾” ,让 EvoX 开启蜂群模式,通过检索公开的一些论文、分享,评估一下自己这条路究竟如何。

可能大家前面还记得,我在做 Case 的时候,使用了一个模型 —— doubao-seed-evolving

这是我觉得非常有趣的点,因为除了 EvoX Agent 外,还有一个模型也在走自进化之路。

这两个实验其实代表了两种不同方向的“成长”,Doubao-Seed-Evolving 关注的是,一个模型如何持续增强自己的能力;EvoX 关注的是,多个 Agent 如何通过经验和协作形成更强的系统。

一个中国团队,正在挑战 Codex 和 Claude 的答案

在实际工作中,EvoX 对 Task 进行了拆解,一共分出了 5 个子任务,并且自己开启了蜂群模式进行任务跟踪。

下面有一个蜂群界面,正中间的一个点是 Main Agent,分支出去的 5 个点则是由蜂群子 Agent 进行任务执行。绿色代表完成,蓝色代表进行中。

在下面,可以看到 EvoX 调用了本机的基因胶囊,对工作流进行了成熟的经验复用。整个方向,似乎正往 EvoX 设定的那个方向去走。

一个中国团队,正在挑战 Codex 和 Claude 的答案

它自身得出的结论(来源互联网)也很有意思,甚至可以说是很真实。

通过交叉了多篇论文、文摘后,Agent 给出的结论里,EvoX 的这条新路是被认可的。但说这条路究竟有没有成功,究竟算不算一条全新的道路,Agent 未置可否。

就像我一开始说的 EvoX 把能力所表达的所有记录都做成了可视化界面,并且存到日志里一样,它一点都不遮掩。一条路究竟走不走的通,并不是马上就可以得出的答案,只有有人去探索,去前进,才有可能见到曙光。

一个中国团队,正在挑战 Codex 和 Claude 的答案

最后

体验完 EvoX 后,我最大的感受其实不是它有没有超过 Codex 或 Claude Code。这个问题现在没有答案,包括从公开 Benchmark 来看,EvoX 也从未说过自己领先这样的话。

但这其实不是重点。真正让 EvoX 有意思的地方,是它正在尝试改变大家认为 Agent 应该发展的方向。

过去一年,行业都在努力打造一个越来越强的 AI 大脑,更强模型、更长上下文、更多工具、更复杂的 Agent 编排。

而 EvoX 走的,却是另外一条路。他们认为,未来的智能,也许不一定来自一个无限强大的个体,而是来自大量智能体之间的协作、经验流动和持续演化。未来 Agent 的竞争,也不止比哪个模型更聪明,更需要比谁能让更多 Agent 更高效地组合起来。

在这种非常极客的想法里,我真的很能感受到这个初创团队的魄力。他们押注在一个全新的技术路线上,并且做出了让人眼前一亮的产品。

当然,道阻且长。包括蜂群模式目前所能证明的,也只是在部分可拆分任务中,这种组织方式具备明显潜力。而经验共享、Agent 自组织、长期进化这些方向,仍需要大量真实任务验证。

但至少,有 EvoMap 这样的团队在探索、在前行,而这个年轻的团队,也极有可能成为大厂 Agent 竞争路外的,一匹黑马。

一个中国团队,正在挑战 Codex 和 Claude 的答案

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
1评论

  • 精彩
  • 最新
  • 退坑了,试了一下感觉是个半成品,加载skills半天出不来,看功能明显还没做成熟有点想圈钱的计划 [装大款]

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
8
扫一下,分享更方便,购买更轻松