你跟AI聊了三个月,它给你记过偏好、记过项目、记过你家猫的名字。然后某天你换个会话开口,它问你:“请问您希望我记住什么?”
这不是段子。"AI失忆"几乎是现在所有Agent用户共同的体验:每一次新会话,都是初次见面。
也正因为痛,“记忆"成了今年Agent圈最热的卖点。但热到什么程度呢?热到各家在基准测试上集体"报喜”:在LongMemEval-S这个赛道上,Chronos报出95.6%登顶,Mastra 94.9%紧随其后,Exabase后来以96.4%刷新纪录,MemPalace干脆自称96.6%“现象级第一”。同一个赛道,四个第一。Zep也曾自报LoCoMo约84%,后来有人复测,结果落在58%到75%之间。知乎当人人都说自己第一的时候,这个行业缺的就不是产品,而是一场统一考试。
第一场统一考试,是Datawhale和30所高校一起出的
8月12日,Datawhale携手清华大学、北京大学等海内外近30所高校和科研机构,上线了Agent Memory Leaderboard(AML,记忆之巅排行榜),官方站点是agentmemories.ai。这是目前第一个把Agent记忆拉到统一协议下做多维度横向对比的公开榜单。热度有点出乎意料:上线两周,官方页面点击量超过20万次,全球136个团队提交注册,还冲上了Hugging Face Spaces周热度榜前三(8月17日当周)。知乎知乎上已经有独立作者用"第一名只考58分"来解读这份榜单——这个说法没有夸张,往下看你就明白了。知乎

放在整个8月的社区氛围里看,这场考试来得正是时候:腾讯云开源了TencentDB-Agent-Memory,给Agent团队搭了一个"记忆中心"。知乎知乎上"记忆模块如何记住与遗忘""Mem0、Zep、MemGPT三条路线怎么比"这类文章在8月密集出现;小红书上教普通人给Claude、Hermes做长期记忆的帖子,收藏动辄上千。记忆正在从Agent的一个附加功能,变成被单独开发、单独采购、单独评估的一层基础设施。
成绩单长什么样:没人敢说自己及格了
先看文本榜工业榜的综合分。MemoraX以58.02分拿下第一——注意,满分是100。它强在显式事实召回,拿了89.89分,但一到关系/多跳组合推理就掉到63.44,记忆治理只有51.19。知乎第二名MemOS 45.89分,与第一名差了12分还多;大家熟悉的Mem0排在第8(41.40分),在LongMemEval-S上自称96.6%的MemPalace,在这张榜上是第9(39.48分)。

再看开源榜。前三名InvMem、Refind、ActiveMemory,综合分是45.06、44.97、44.84——分差不到0.3,谁也没有碾压谁。再往后,分差同样咬得很紧,开源阵营目前是一个"混战区间"。
编程榜更有意思。工业榜里MemoraX以62.00%的总体解决率单独领先,比并列第二的claude-mem、hs v3、MemOS(都是52.00%)高出整整10个百分点,新功能解决率70.59%、缺陷修复解决率57.58%,榜单还同时公开了耗时、返回规模等工程指标。知乎也就是说,在"记住的历史经验能不能真的帮Agent写代码、修Bug"这件事上,头部和追赶者的差距是工程级的。但开源编程榜又是另一幅画面:AM-Link、AMC-Memory、causal-memory等8个方法全部并列第一,总体解决率清一色52.67%。

这张榜单该怎么读:三个反直觉
第一,第一名58分,说明整个领域还在很早期。这不是一场"谁赢了"的考试,而是一次集体摸底:今天最强的记忆系统,在统一的多维度考试里也不及格。所以下次再看到任何产品宣传"长期记忆已解决",先问一句:是在哪张卷子上解决的?
第二,子项比总分诚实。MemoraX的事实召回接近90分,但记忆治理只有51分。这几乎戳中了当前记忆产品的通病:记住不难,难的是知道什么该忘、什么过期了、哪两条记忆互相矛盾。"记得多"和"记得对"是两回事,而用户真正会踩坑的,往往是后者。
第三,同一套系统,换张卷子名次可以差很远。MemPalace在LongMemEval-S上自称96.6%,在AML文本工业榜上是第9。这不是说谁造假,而是说明:基准的出题方式、评测条件、检索范围,本身就是分数的一部分。自报分数最大的问题不是数字真假,而是你无法确认它是在什么条件下得到的。
对你来说,这份榜单能怎么用
如果你只是AI助手的普通用户,不用管榜单细节,但可以拿它的思路做三个小自测:跨会话一周后,它还记得你明确说过的偏好吗?你的信息变了(换了城市、换了项目),它会更新还是抱着旧记忆回答?它有没有一处你能查看、能删除的记忆清单?这三条里任何一条做不到,宣传页上的"长期记忆"就只是个功能开关,不是能力。
如果你在搭Agent、选记忆方案,这张榜值得当成选型参考系,但要按场景读:别只盯综合分,看子项——综合第一的MemoraX,记忆治理也只有51.19分,综合排名不会告诉你短板在哪。开源文本榜前三差距极小,选型时与其追0.1分的综合分,不如看子项结构和你自己场景的权重。

另外别忘了榜单之外的变量:腾讯云开源的TencentDB-Agent-Memory已经在AML工业榜上排到第7,大厂进场会让这个排位在未来一两个季度快速变化;社区里Mem0、Zep、MemGPT三条路线的对比讨论也还在升温。知乎现在押注任何单一方案都嫌早。
榜单不是答案,是共同语言的开始
Datawhale在那篇发布文章里有一句话,我挺认同:Agent Memory真正要解决的,从来不是一道benchmark题,而是如何让一个Agent在数周、数月甚至更长时间的持续交互中,真正记住、理解、更新并合理使用那些与用户和任务有关的信息。知乎
对关注Datawhale的人来说,这份榜单也算这个社区今年继Hello-Agents、Hello-Claw之后拿出的又一个有行业声量的动作——从做教程,到做评测基础设施,它正在往AI学习生态更深处走。接下来值得盯的信号有三个:榜单下一版里头部和追赶者的分差是拉大还是收窄;编程榜开源阵营的并列第一会不会被打破;以及各家自报分数和统一榜单的差距,会不会逼着行业把"评测条件"也一起公开。
等到哪天有人敢把评测条件和原始轨迹一起放出来,AI记忆这场考试,才算真正开考。