今天(8月27日),火山引擎开源了一个叫 OpenViking 的项目,定位是「面向AI智能体的上下文数据库」,官方口径是把 LoCoMo 长对话记忆准确率从 24%–57% 拉到 80%–83%,输入 token 最多砍掉 91%。知乎专栏单看这一条,只是又一个新的开源项目。但把这个月发生的事情串起来,味道就不一样了:
7月29日,牛津、南洋理工、清华、东南大学等 20 多家机构联合发起 Agent Memory Leaderboard(AML),这是智能体记忆的第一次「统一大考」:所有参赛系统答同一套题、用同一个答题模型、同一个评分器;
8月7日首期提交截止,放榜结果有点残酷:满分 100,第一名 MemoraX 只考 58.02;GitHub 6.3 万星的 Mem0 以 41.40 分排第 8,最弱的「时序与事件推理」只有 17.43 分;
也是这个月,MemGPT 创始团队在知乎公开质疑 Mem0 的基准测试数据造假;腾讯云也发布了 Agent 记忆方案 TencentDB-Agent-Memory。
一句话:2026年8月,「智能体记忆」从各玩各的,进入了有榜单、有吵架、有大厂下场的阶段。

这事和 ChromaDB 有什么关系
因为对大多数个人开发者来说,「给AI装上记忆」的起点,就是那行 `pip install chromadb`。LangChain、LlamaIndex 的教程默认用它,B站的 RAG 课程几乎都拿它演示,知乎上做 AI 陪伴机器人的玩家,也是用它给角色装情景记忆——不用云服务、不用配置、数据就在自己的文件夹里,从安装到第一条查询只要 3 分钟。知乎专栏所以社区现在真的有人在问:记忆赛道打起来了,我这套基于 ChromaDB 的记忆方案,要不要跟着换成 Mem0、Letta,或者今天开源的 OpenViking?
先说我的结论:别急着迁。因为很多人把两件不同的事混在了一起。
先分清:存储选型的问题,社区已经吵完了
要不要从 ChromaDB 迁到 Qdrant、Milvus,这是个「存储层」问题——它在7月底就已经被社区用实测数据吵出了共识。一位知乎作者写了自己踩坑的复盘:240 篇文章、5877 个 chunk 全跑在 ChromaDB 上,查询延迟不到 1 秒,内存占用不到 200MB。知乎专栏他之前还架了一个 Qdrant 容器,跑了一个月,CPU 占用稳如老狗,但一次查询都没往那边发过,直接停了。他的原话是:迁移的信号是「体验变差」,不是「数字变大」——10 万条以内放心用,触发查询变慢、内存吃紧、多人写冲突三个信号里的两个,才需要考虑换。
还有一篇对比文的说法更直白:刚玩 RAG 跟风上 Qdrant,折腾部署和调参花了两天,本地几万条文档根本感受不到生产级优势,换回 Chroma 反而省出时间聚焦业务。知乎专栏所以存储这一层,ChromaDB 没什么可焦虑的。这个月真正吵翻天的,是它上面的两层。

记忆其实是三层,ChromaDB 只解决第一层
把这个月十几篇高质量讨论读下来,几乎所有争论都指向同一句话:有向量数据库,不等于有记忆。把「记忆」拆开看,其实是三层:
存储层:记忆放在哪。ChromaDB、Qdrant、SQLite FTS5,甚至一个 markdown 文件夹,都算。解决「存得下、找得到」。ChromaDB 在这一层是好学生。
策略层:什么时候写、写成什么、什么时候忘。情景、语义、偏好、流程四类记忆不该混在同一个检索面里,事实和事件会竞争排序,流程和偏好会互相干扰,噪声越滚越大。记忆还要带来源归因:用户亲口说的,还是模型自己猜的?旧事实应该被新事实「替代」,而不是永远躺着。Mem0、Letta、MemOS 这些记忆框架,做的基本都是这一层。
上下文层:召回的记忆怎么喂给模型。全量塞回去,token 账单起飞,模型还用不好——有实测统计,全上下文硬塞的做法,单次查询大约要烧掉 26,000 个 token。知乎专栏

而 AML 这场大考,考的恰恰是后两层。看它的七个评测维度:显式事实召回、多跳推理、时序理解、记忆治理、个性化、规则执行、认识论安全与隐私——存储层最多回答第一个。今天开源的 OpenViking,主攻的就是上下文层:它自定义了一套 viking:// 协议,把记忆、资源、技能映射成一个虚拟文件系统,让 Agent 像翻文件柜一样用 ls、tree 逐层浏览,确认值得才读全文。知乎专栏这也解释了这个月两个最反直觉的结果。
为什么连最高分都只有 58,名气最大的 Mem0 只排第 8? 因为记忆难的不是「记得住」,而是「现在该想起哪条、它还有没有效」。Mem0 最弱的一项正是时序与事件推理,只有 17.43 分——用榜单文章的话说:你的 AI 记得你说过的话,但分不清哪句是最新的。知乎专栏
还有一个更扎心的佐证:腾讯和港中文 7 月的一项研究系统测试了 LRU、LFU、FIFO 这些教科书级缓存淘汰算法,结论是它们在 AI 记忆上基本失效,甚至起反作用——LRU 假设「最近用过的将来还会用」,但对话话题是跳的;LFU 让早期高频话题即使过时也死占位置,记事本变成「过时话题的积分榜」。知乎专栏
为什么分层记忆成了行业主流,又有人反对? 腾讯云的 TencentDB-Agent-Memory 把对话压成 L0 原文、L1 事实、L2 场景、L3 画像,厂商自测省 61% 以上 token,是目前业内最细致的分层设计之一。知乎

但另一个团队在 LoCoMo 上做消融实验踩了坑:压缩是有损的,抽象层一旦替代原文,多跳推理类问题上涨的同时,细节精准类问题应声下跌,整体掉了 3.4 分;改成「抽象层和原文层共存」之后,召回率才从 47.1% 一路做到 84.6%。知乎讲这两个例子不是分对错,而是说明:策略层目前没有标准答案,谁都没有高到可以照抄的分数。这种时候急着把记忆方案迁到「最火的框架」上,本身就是高风险动作。
要不要迁,看你属于哪个场景
场景一:个人玩具、陪伴机器人、小工具,记忆量在 10 万条以内。 继续用 ChromaDB,别迁。社区有现成案例:知乎一位玩家给自制的角色「冷旭帆」接上 ChromaDB,输入「手腕」这种和之前对话语义相关、但不完全一致的词,系统能自动召回「护腕」相关的旧记忆,角色的独白也在连续四轮对话里保持了意象连贯。知乎专栏这个体量下,你的问题通常不是 ChromaDB 不够强,而是策略层没补——往下看补法。

场景二:个人编程助手,核心需求是「跨会话接着干」。 向量库可能是过度设计。这个月有人开源了 claude-memory-handoff:纯 markdown 加 Claude Code 钩子,召回就是 grep 加新鲜度阈值,一个 embedding 都不用。知乎专栏作者说得挺狠:会话断点要的是「精确接续」,不是「模糊联想」;而且过时上下文比没有上下文更可怕——他被两周前废弃的方案带偏过,白干半小时,所以专门加了「新鲜度门」:过保质期的记忆不准注入。
场景三:真业务、多智能体、Agent 会改代码动环境。 光靠 ChromaDB 确实不够。这个月的讨论里有个案例:两个智能体可以针对同一个实体各写一条互相冲突的记忆,而且彼此毫不知情。知乎专栏这一步你需要记忆框架(Mem0、Letta、TencentDB-Agent-Memory 等)或 OpenViking 这类上下文数据库,还要加记忆审计:新事实先当「候选」,审核通过才生效;旧事实被标记替代,而不是删掉。工程成本高,但这个场景值得。
场景四:企业环境。 看两条线:传统数据库厂商吸收向量与记忆能力(腾讯云这个月就是这条线),以及大平台的托管记忆服务(OpenViking 有 SaaS 版)。展开讲就超纲了。
不迁的话,有四件事现在就能补
如果你决定留在 ChromaDB,下面四件事能把策略层往上拉一档,全部有社区实践可抄:
给每条记忆加四个元数据字段:时间戳、来源、类型、置信度。 「用户说的」和「模型推断的」权重不该一样;检索时先用元数据过滤,再按向量相似度排序。Mem0 的生产团队就是这么做的:用户消息写在 user_id 下,智能体消息写在 agent_id 下,归因在写入阶段就保留。知乎专栏
把记忆作为参考注入,而不是作为指令。 写进 system prompt 的措辞是「你记得这些相关的事」,不是「你必须复述这些事」;位置也有讲究,放在「最近发生的事」和「刚刚发生的事」之间效果更好——这是「冷旭帆」项目实测出来的细节。知乎专栏
设计「遗忘」,别用硬截断。 简单粗暴地只留最近 N 条,会把用户月初提过的硬约束无声无息地砍掉。更稳的做法是按「时间衰减+重要性+相关性」三维打分决定去留,给记忆标上生命周期状态——一条记录可以是 active、superseded、retracted、expired 或 archived,任务默认只拿仍在有效期内的内容。知乎专栏
别把 Agent 记忆和知识库文档混在同一个 collection。 事实会跟事件竞争排序,流程会跟偏好混在一起,召回噪声越来越大。分开集合,就是一行代码的事。
接下来值得盯的三个信号
AML 第二期正在进行,什么时候有系统考过 80 分,Agent 记忆才算真正可用——现在的全行业水平,是没人及格。知乎专栏
OpenViking 的「文件系统式上下文」能不能被社区验证,官方在 openviking.ai/studio 放了在线 Demo;AGPLv3 协议对商用场景略敏感,火山引擎承诺开源版不会被削弱,嫌运维麻烦也有官方托管的 SaaS 版。知乎专栏
Chroma 官方会不会自己做策略层。有作者提到它 1.5 版本已经新增 Rust 客户端支持,演进不算慢——如果存储厂商自己下场做记忆策略,今天这场迁移焦虑基本就消散了。知乎专栏
最后一句:别慌着迁移。ChromaDB 没有落伍,它只是坐在记忆三层里的第一层;这个月真正在打的仗,在它上面两层——而那两层,现在连第一名都没及格。