Agent的记忆,终于有了一场统考
用Claude Code写了一周代码,关掉终端再打开:它不记得项目架构、不记得你的代码风格、不记得上次调试到哪一行。这不是某一个产品的问题,Agent的失忆早就被社区总结得很扎心了:你骂它一次,它规矩五分钟;新开一个会话,全部清零。知乎这周,这个老毛病终于等来了两件标志性大事:8月12日,首个智能体记忆榜单AML(Agent Memory Leaderboard,中文名「记忆之巅排行榜」)放出首期结果,上线以来官方站点点击量突破20万次,总共136个团队提交注册申请。36氪
失忆的代价不只是体验差。MIT的NANDA报告称,约95%的企业级生成式AI试点没能换来实际回报,症结集中在缺数据基础设施、融不进既有工作流。36氪对个人用户来说,这意味着每次开新会话都要从头交代一遍「我是谁、在做什么项目」;对企业来说,这意味着Agent项目一直卡在试点阶段走不出来。
为什么要统考?因为之前的榜已经乱了
过去评价Agent的记忆,基本是一笔糊涂账:大家依托LoCoMo、LongMemEval这些基准,各家的实现各不相同,分数却都敢往高了报。最夸张的一组对比:Zep曾自报LoCoMo约84%,但后来复测发现结果在58-75%左右。知乎同一个系统、同一套题,分数能差出二十多个百分点。问题不在于谁造假,而在于数据、答题模型、Prompt和评分标准各搞一套,分数高可能只是背后的大模型更会答题,不代表记忆更好。
统考考什么:把「记忆」和「答题」分开
AML由海内外近30所研究机构科研团队联合发起,核心设计是把评测链路切断:参评系统只负责两件事,把历史信息记下来(Add),在问题到来时找回来(Search);至于拿到记忆之后怎么组织答案、怎么打分,全部由平台用同一套模型、同一套标准统一完成。考试科目也拆得很细:文本记忆覆盖事实召回、多跳推理、时间与事件、记忆治理、个性化、上下文执行、安全与隐私七个方向,代码记忆则考察系统能不能复用历史调试和开发经验。36氪这样至少能搞清楚,「记性好」到底是记忆系统的功劳,还是答题模型的功劳。

放榜:冠军七项全第一
首期商业榜的结果:MemoraX以58.02的总分强势夺魁,在7能力维度中均排第一,在显式事实召回、关系/多跳组合推理、记忆治理等维度和子维度与第二名拉开较大差距。知乎

但先别急着膜拜,泼三盆冷水。第一盆,看冠军的成色:公开信息显示,这是一家成立还不到半年的公司——深圳忆纪元科技有限公司,团队在短短5个月内已连续斩获三轮大额融资。36氪资本热度越高,越要把「评测分数」和「生产可用」分开看。再看开源阵营:开源榜前三是InvMem、Refind、ActiveMemory,得分分别是45.06、44.97、44.84,分差较小。知乎商业框架暂时领先,但开源追得很紧。
第二盆,一期榜单说明不了全部。记忆系统真正的考场仍在生产环境:长期运行是否稳定、成本是否可控、能否满足企业级安全与合规要求,都不是一次集中评测能够回答的。36氪Coding榜的结果也一并公开了:MemoraX以62.00%的任务解决率排名第一,领先第二名约10个百分点。知乎另外提醒一句:我看到的两篇放榜文章,都给冠军留了不小篇幅,而冠军公司正在融资窗口期——榜单值得盯,宣传热度要打折看。
百万Token上下文,为什么替代不了长期记忆
有人可能会问:模型的上下文窗口越来越长,把所有东西都塞进去不就行了?不行。短期记忆是一次对话里的工作台,对话结束就清空;长期记忆是跨会话持续积累的信息系统,要分清哪些值得存、哪些已过期、哪些互相矛盾。工作台再大,也替代不了档案库。
更反直觉的一点:长期记忆最难的不是记住,是忘掉。有位带过Agent落地的知乎从业者说得很透:Agent长期记忆最大的工程难题,不是怎么记住,是怎么忘掉,三个月前用户随口说的一句话,可能到现在还在污染上下文。知乎记忆只进不出,新旧信息互相打架,Agent就会越用越「固执」、越用越像个陌生人。所以AML把「记忆治理」单列为考点,考的恰恰是最容易被忽略的能力:删掉过期事实,裁决矛盾信息。
先自测:你的Agent到底有没有「记忆」
在为「长期记忆」功能掏钱之前,建议先用这5个改编自AML考点的问题,测一下你手上的Agent:
事实召回:告诉它一个设定(比如「项目用Python 3.11环境」),过几天改掉,看它能否及时更新。
时间推理:问它「上周我们定了什么方案」这类带时间顺序的事。
记忆治理:故意给它两条互相矛盾的说法,看它是发现冲突来问你,还是混着一起说。
个性化:新开一个会话,看它能否自动沿用你之前声明过的偏好,而不是等你重新交代。
上下文执行:交给它一个跨几天的任务,看它记不记得进度、约定和上次没做完的部分。
5题里挂了3题以上,说明你的Agent现在基本是「每次都从零开始」,为记忆功能付费的价值要打个问号。
现在就能做的三件事
第一,把偏好、约定和项目背景写进CLAUDE.md这类规则文件,让Agent每次会话先读它。前面那位知乎从业者的判断是:这类过程记忆最好的载体不是向量也不是图谱,是规则文件或者结构化的偏好配置。知乎
第二,定期给记忆「倒垃圾」:每月清理一次过期事实,重要结论手动确认。刚开源的MyContext是个可以参考的思路,它在结论层用「三态合并」处理信息:真冲突时两条都留、交由用户裁决,用户手工确认过的结论,模型永远不能覆盖。36氪

第三,盯住两个信号:一是AML第二期放榜时,冠军是否易主、开源与商业的分差是否缩小;二是如果你和很多打工人一样,工作信息大量沉淀在钉钉、飞书这类IM里,可以留意MyContext这类本地化工具接入这些数据源的进展。在行业把记忆这门课补完之前,自己Agent的记忆管理只能自己先动手——好消息是,自己动手的门槛并不高。