TencentDB Agent Memory 的 Benchmark 自述:能引用到什么程度
一个 Agent 记忆项目最容易被截图转发的部分,往往是 README 里那张 Benchmark 表。TencentDB Agent Memory 也有这么一张表,而且很短——短到只有一行。
这篇不评价这一行数字好不好,只做两件事:把它原样抄出来、说清它旁边缺了什么;然后拿它和同一个仓库里其它「自述数字」做对照,看看哪些能在仓库内核得上、哪些核不上。结论落在最后一节:引用这类数字时应该带几层限定。
先把口径交代清楚。以下全部基于 TencentCloud/TencentDB-Agent-Memory 在 2026-08-16 的快照 97f9465,分支是该仓库的默认分支 feat/server_team——注意默认分支不是 main 也不是 master,本文提到的每一个文件路径都在这个分支上。该仓库主模块 MemoryCore/package.json 的 version 是 2.0.0-beta.1,另外三个模块 MemoryKnowledge / MemoryPanel / MemoryProxy 的 package.json 版本都还是 0.1.0,README 顶部横幅(README_CN.md:25)自己写着「Team Memory Beta 版本正在快速迭代」。我们没有部署、没有启动过任何一个模块,下面所有内容都是读文件读出来的。
一、原表长什么样
Benchmark 小节在 README_CN.md:271-277,表格逐格照抄如下:
| Benchmark | 无 TencentDB Agent Memory | 启用后 | 相对提升 |
|---|---|---|---|
| PersonaMem | 48% | 76% | +59% |
表下紧跟一句说明(README_CN.md:277):「PersonaMem 检验Agent 能否在长期交互后正确理解和运用用户信息。」(原文「检验Agent」中间无空格,照抄。)
英文 README 的同一张表在 README.md:271-273,三个数字完全一致,说明句在 README.md:275:「PersonaMem tests whether an Agent can correctly understand and apply user information after extended interactions.」
这就是全部。整张表一行、四列、三个数字,中英文两份 README 各出现一次。需要先说清楚的一点是:这三个数字是 README 自述的评测结果,我们没有复现过,评测方法与环境以官方说明为准,本文也不拿它跟任何其它项目做比较。
二、这张表没写什么
把「没写什么」列全,比讨论「48 到 76 意味着什么」有用得多。逐条来:
没写指标是什么。 48% 和 76% 后面跟的是百分号,但 README 没说明这是准确率、召回率还是别的什么评分,也没说满分口径。
没写被测对象。 哪个基座模型、哪个版本、什么参数配置、上下文开多长,README 都没有提。「无 TencentDB Agent Memory」这一列指的是完全不接记忆、还是接了但关掉某些层,同样没有说明。
没写样本与次数。 样本量多少、跑了几轮、取的是均值还是单次结果,表里和表下都没有。
没写日期。 README 未标注该评测的执行时间。而这个仓库在快速迭代中——CHANGELOG.md:13 的最新条目是 [2.0.1-beta.1] — 2026-08-13,我们采集的前一天(2026-08-15)仓库还有 push。数字对应的是哪个版本,从 README 上读不出来。
没写「相对提升」这一列的换算口径。 README 把 48%、76%、+59% 三个数并列在同一行,但没有写明第三列是怎么从前两列得到的。我们照抄这三个数字,不代它做任何换算,也不去推它应该是多少。
没给复现方式。 没有评测脚本路径、没有配置文件、没有运行命令。
最后一条我们做了核对动作,因为它是唯一能在仓库里验证的:在快照根目录下不区分大小写搜索 personamem(排除 .git),命中的文件只有两个——README.md 和 README_CN.md。也就是说,PersonaMem 这个词在整个仓库里只出现在两份 README 的那张表附近,没有任何脚本、配置、数据集或结果文件与之对应。这不是推断,是搜索结果;至于评测是在哪里、以什么方式跑的,仓库外的情况我们没有依据说明,评测方法与环境以官方说明为准。
三、一个对照:同一个仓库里,哪些自述数字核得上
有意思的地方在这儿。这个仓库里的「自述数字」不止 Benchmark 一处,而且相当一部分是能在仓库内核对的。我们核过几处,结果分成两类。
核得上的一类。 MemoryCore/src/metadata/router/v3-meta-schemas.ts:2 的注释自称有「55 公开接口」;我们把该文件里形如 "/v3/...": 的键抓出来数,得到 55 条,去重后仍是 55;再去 v3-meta-router.ts 里数 V3_PREFIX 拼接的路由,同样是 55 条(V3_PREFIX = "/v3/meta")。注释自称与实读一致。
另一处:MemoryKnowledge/src/routes/tools.ts 的源码注释写着「Wiki tools (7)」(:48)和「Code-Graph tools (9)」(:90);把两个数组里的 name: 字段数出来,Wiki 是 7 条、Code-Graph 是 9 条,也对得上。
核不上的一类。 版本号在四处的写法不一致:README_CN.md:299 写「当前版本 v2.0.0」,ROADMAP_CN.md:5 写「当前版本:v2.0.1-beta.1」,MemoryCore/package.json 的 version 是 2.0.0-beta.1,CHANGELOG.md:13 最新条目是 [2.0.1-beta.1]。四处并列在这里,我们只陈述差异,以实读的仓库状态为准。
枚举也有两处对不上:README 的可见性表(README_CN.md:230-235)列了 4 个取值 private / team / restricted / agent,而 MemoryCore/src/metadata/types.ts:25 的 AssetVisibility 是 5 个,多一个 task;README 说 Team 内角色分 Admin 与 Member 两种(README_CN.md:136),types.ts:18 的 TeamRole 是 "admin" | "member" | "reviewer" 三种。同样只陈述差异。
把两类放在一起看,可以得到一条挺朴素的规律:自述数字能不能核,取决于它的依据在不在仓库里。接口条数、工具条数的依据就在源码里,所以一数就清楚;版本号、枚举个数横跨文档与代码两层,就出现了并列多值的情况。而 Benchmark 这一行属于第三种——它的依据根本不在仓库里,所以既不能证实也不能证伪,只能标注为「项目方自述」原样转述。
同一份 README 里还有一张类似性质的表:README_CN.md:196-204 那张「聊天历史 / 普通 RAG / TencentDB Agent Memory」三列对比表,用 ✅ / △ / — 打分。它和 Benchmark 表一样是项目方自述,依据不在仓库里,我们没有做任何验证。
四、README 自己把限制写在了旁边
值得一提的是,Benchmark 表下面紧接着就是「注意事项」小节(README_CN.md:279-283),三条限制:Wiki 和 CodeGraph 异步构建、需要等待处理才能 ready;CodeGraph 当前首先支持公开 HTTPS 仓库,私有仓库与 SSH 凭证接入仍在完善;Hub 已支持人工绑定资产,全自动记忆路由仍在迭代。
这三条我们也回代码核了一遍,结果不齐:
第一条核得上——MemoryKnowledge/src/store/types.ts:18 有 SyncStatus = "pending" | "processing" | "ready" | "failed" 这个状态机。
第二条核得上——MemoryKnowledge/src/source-fetcher/git-fetcher.ts:58-61 的注释写「第一版:仅支持 public HTTPS 仓库」,非 https:// 开头直接报错,错误串原文是「first version only supports public HTTPS repos; SSH/private repo support coming soon」。
第三条我们没能核到——仓库里没有定位到一个明确叫「自动路由」的开关或模块,只找到人工绑定那条链路(/v3/meta/agent-fixed-asset/set 等 4 条路由,见 MemoryCore/src/metadata/router/v3-meta-router.ts:264-273)。照实记录为「未核实到对应实现」,不推断原因。
所以引用这张 Benchmark 表时,把它下面这三条限制一起引用,比只截表格更接近 README 的原意。
五、那么,能引用到什么程度
给一个可以直接照用的引用范式。引这三个数字时,至少要带上四层限定:
- 标明是自述。 写法是「README 自述的评测结果」,不要写成「基准测试显示」,也不要略去主语让读者以为是引用方自己跑出来的。
- 带时间与快照锚点。 写「截至 2026-08-16 的快照
97f9465(分支feat/server_team)」。这个仓库处于 beta 阶段且在快速迭代,数字随时可能改。 - 带缺失项说明。 至少写明「README 未给出评测脚本、模型、样本量、运行次数与日期」,并说明「我们在仓库里未找到 PersonaMem 相关的脚本、配置或结果文件」。
- 不做延伸。 不把它改写成「记忆能力提升 59%」这类泛化表述,不拿它跨项目比较,不把它当成选型的单一依据。
反过来,有几件事不该做:不该把这一行数字加工成柱状图或多项目对比表,因为拼接不同来源的分数没有可比基础;不该由这个数字推断在你自己的场景里会有什么效果,README 没有给出这样的依据;也不该由「能不能核到评测脚本」去评价项目质量或团队水平——这两件事之间我们没有依据建立联系。
如果你需要的是一个能支撑决策的数字,那么可核的那一类反而更有用:接口有多少条、工具有多少个、默认分支是哪个、哪几个模块还在 0.1.0、ROADMAP 上哪些能力还标着计划中(例如 ROADMAP_CN.md:42-53 写「目前面板只能查看和删除,无法修正」,:55-63 把「L0 / L1 记忆搜索」列为下个版本的计划项)。这些你自己 clone 下来就能一条条数完,而且数完之后,数字是你自己的。
延伸阅读
- 从头读起:TencentDB Agent Memory 是什么:团队级 Agent 记忆中枢怎么读
- 本专题共 40 篇,完整分组目录见专题页
- TencentDB Agent Memory 的 config.ts:三处注释默认值与代码不符
- TencentDB Agent Memory 的四类记忆资产各是什么
本文依据 TencentDB Agent Memory 官方仓库(github.com/TencentCloud/TencentDB-Agent-Memory)
feat/server_team 分支上的 README、INSTALL、CHANGELOG、ROADMAP 与四个模块的源码整理,
核对日 2026-08-16,对应仓库快照 97f9465。该仓库的默认分支即为 feat/server_team。
本文内容为仓库源码与文档口径,我们没有部署、也没有运行过该项目的任何一个模块,
因此不涉及运行效果、检索质量与性能的任何描述。
该项目主模块处于 beta 阶段、其余模块版本号仍为 0.1.0,参数与接口随版本变动,请以仓库最新内容为准。
该项目会采集并存储团队的对话、文档与代码,属于敏感数据,是否使用请结合自身合规要求评估。
安全与合规相关做法请结合自身环境评估,本文不构成安全方案建议。