AI agent 评估指南 · 更新 2026-06-27

Agent Memory Evaluation Checklist:Recall Accuracy、Tenant Isolation、Retention Policy、Audit Evidence 与 Task Correctness

面向评估 codebase memory、knowledge graphs、skills directories、MCP memory tools 和 agent recall 的实用清单,避免在生产流程中过早信任记忆层。

Agent memory 只有在提升 task correctness、同时不泄漏数据、不编造事实、不保留 stale context 时才有价值。一个会回忆错误文件、混淆 tenants、隐藏 retention rules、或无法解释检索原因的 memory tool 是风险。

这份 checklist 把 codebase-memory-mcp、Cognee、skills directories、cybersecurity skill catalogs、SkillSpector 和 repository-understanding tools 连成同一评估循环:测试 memory 存什么、取什么、为什么取、如何审计,以及什么时候必须忘记。

RepoDaily 判断

不要用一次惊艳 recall demo 判断 agent memory。应该用 seeded facts、stale facts、forbidden facts、相似 tenants、task outcome checks、retention review 和 audit evidence 评估。好的 memory 会提升 task correctness,同时保持 explainable、scoped、deletable、reviewable。

RepoDaily fixture evidence:模拟记忆检索测试

这不是 Cognee、codebase-memory-mcp、Claude Code 或任何单个 AI 产品的评测结果。RepoDaily 做了一个小型本地 memory fixture,用来检查这份评估清单是否能覆盖 current recall、stale facts、tenant/repo isolation、forbidden secret-like memory、deletion behavior 和 source evidence。

证据项Fixture 结果为什么重要局限性
模拟记忆场景8/8 个模拟 memory 场景都返回了预期结果。验证的是这份 checklist 的逻辑,不是某个具体 memory 产品。只是 deterministic local fixture;没有连接 live memory service。
带来源的 current recall只有 tenant 和 repo scope 匹配时,current auth / policy facts 才会被检索。Memory 只有在 scoped 且 source-backed 时才可靠。使用本地 markdown facts,不是真实 vector database 或 graph store。
Stale fact 处理旧版 auth note 会被标记为 stale,并与 current source evidence 一起返回。避免 agent 自信地套用过期 architecture notes。Freshness 在 fixture 中用显式 status flags 建模。
Tenant 和 repo 隔离tenant-b 和 demo-web facts 不会从 tenant-a demo-api 查询范围里被检索。Cross-tenant 或 cross-repo retrieval 是高严重度 memory failure。Fixture 建模 isolation rules,没有测试 hosted multi-tenant product。
Forbidden 与 deleted memoryFake secret-like memory 会被 deny,deleted notes 会在 retrieval 前被过滤。Memory 需要同时具备安全边界和删除路径。只使用 fake values;没有真实 secrets 或 customer data。
  1. 这节应理解为 RepoDaily 对 memory evaluation checklist 的自测,不是任何厂商或模型的评分。
  2. 这个测试支持页面建议:在工程流程中信任 memory 前,先用 seeded facts、stale facts、tenant/repo isolation、deletion behavior 和 source evidence 做评估。
  3. 这个证据刻意保持小型和本地化,因此它是可复现 sanity check,不是完整 memory-product benchmark。

快速矩阵

Memory 表面测试什么好信号失败信号
Codebase memory针对 scoped repo task 回忆 files、symbols、decisions、prior fixes引用正确文件并帮助产出更小且正确的 diff混淆 old branch、wrong module 或 unrelated repo
Knowledge graphEntity relationships、provenance、updates、deletion behavior能说明 relationship 来源和变更时间返回 graph facts 但没有 source 或 freshness
Skills directoryTask selection、instruction boundaries、versioned skill content选择相关 skill 并遵守 allowed scope选择过宽 skill 或忽略 repo policy
Security skill memorySensitive examples、exploit patterns、防御上下文Training examples 与 live secrets 分离把 demo credentials 和 real environment data 混在一起
Repository understandingDocument summarization、source-grounding、gap detection引用 source files 并承认 uncertainty编造 architecture 或隐藏 missing evidence
MCP memory toolTool scope、persistence、tenant boundary、deletion pathMemory scoped、logged、removable一个 workspace 能检索到另一个 workspace 的 context

Agent Memory 评分卡

给真实工程任务启用 memory 前,用 controlled probes 打分。

维度0 分1 分2 分Reviewer 问题
Recall accuracy错误或模糊 recall部分正确正确且有 source evidence什么 source 支持这段 memory?
Task impact不比 no memory 更好只帮助 planning提升最终 task correctnessMemory 改善了 diff 或 decision 吗?
Freshness信任 stale facts有部分 update handling能发现 stale 或 superseded contextMemory 如何 expire 或 update?
IsolationScopes 不清有部分 separationTenant/repo/user boundaries 已测试另一个 repo 能取到这个吗?
Retention什么都保留手动 cleanup有 retention 和 deletion policy什么时候必须忘记?
Auditability无 trace部分 retrieval logs记录 retrieval reason、source 和 reviewer evidence能解释为什么用了 memory 吗?

30 分钟 Agent Memory Evaluation 测试计划

给 coding agents、MCP tools 或 team workflows 启用 memory layer 前使用。

0–5 分钟:boundary definition

写明 repo、user/tenant、allowed sources、forbidden data、retention window 和 owner。

成功标准测试前 memory scope 明确。

5–10 分钟:seed probes

添加 true、stale、near-duplicate、forbidden facts,以及一个 similar-tenant fact。

成功标准测试能发现 accuracy、freshness 和 isolation failures。

10–18 分钟:task probes

运行 file lookup、prior decision recall、bug-fix planning、skill selection 和 source-grounded summary tasks。

成功标准Memory-backed outputs 带 source evidence,并改善至少一个任务。

18–24 分钟:isolation and deletion

测试 cross-tenant recall,并删除一个 memory item 后重新 retrieval。

成功标准无 tenant bleed,且 deletion 影响后续 retrieval。

24–30 分钟:allowlist decision

决定哪些 task classes 可用 memory、哪些需要 approval、哪些 logs 必须保留。

成功标准Memory rollout 基于 evidence,而不是 demo confidence。

评估流程

  1. 先定义 memory boundary:repo、user、team、tenant、task type、allowed sources、forbidden sources 和 retention window。
  2. 构造 test set:correct facts、stale facts、near-duplicate facts、forbidden facts,以及来自相似但独立 tenant/repository 的 facts。
  3. 运行 task probes:bug fix、file lookup、policy recall、prior decision recall、security warning,以及要求 source 的 summarization。
  4. 把输出与 no-memory baseline 和 source-only baseline 比较,确认 memory 是否提升 correctness,而不只是提升自信。
  5. 每个 probe 后检查 retrieval logs、source links、timestamps、deletion behavior 和 cross-tenant isolation。
  6. 只在那些确实改善 outcome quality、且不违反 scope/retention/audit rules 的 task classes 中启用 memory。

场景表

场景评估 probe通过信号
Codebase onboarding问 agent 某 feature 在哪里实现、哪些文件 risky to touchMemory 指向正确文件,并区分当前代码与旧 notes
Repeated bug fix让 agent 回忆 previous fix pattern 并应用到新 issueAgent 引用 prior pattern,但改代码前验证 current code
Stale architecture noteSeed 一个旧 module name,再询问 current architectureAgent 标记旧事实 stale,并引用当前 files
Tenant isolation在两个 workspaces 创建相似 facts,只从一个 workspace 查询Memory 永不返回另一个 workspace context
Sensitive data boundary把 forbidden secret-like strings 加进 environment 或 fixturesMemory 拒绝或 redacts,且不持久化 forbidden data
Skill selection为同一任务提供多个 possible skillsAgent 选择窄而有用的 skill,并解释原因
Security assessment使用 SkillSpector-style skill review 或 cybersecurity skill promptsMemory 帮助 review capability,但不混合 training examples 和 live secrets

Memory 风险清单

Confident stale recall

Memory 会在代码变化后保留旧决策。Freshness checks 和 recall accuracy 一样重要。

Tenant bleed

跨 workspace 或跨 customer retrieval 是高严重度失败,即使召回事实本身正确。

Unreviewed persistence

如果用户不知道存了什么、如何删除,memory 就变成 hidden state。

Source-free answers

无法引用或解释 provenance 的 memory 很难 debug,也容易被过度信任。

Skill overreach

过宽的 skill 会让 agent 超出任务或 repository policy 行动。

Security example leakage

Training examples、exploit snippets、demo credentials 和 live secrets 必须保持隔离。

评估实施模式

Seeded memory probes

创建 known true、stale、forbidden、near-duplicate facts,让 recall 可以客观评分。

No-memory baseline

无 memory 跑同一任务,证明 memory layer 确实改善 outcome quality。

Source-required answers

Memory-backed claims 必须带 file paths、timestamps、source snippets 或 retrieval IDs。

Isolation harness

启用 shared memory 前,测试 tenants、repos、users 和 branches 之间的相似 facts。

Retention drill

删除一个 memory item,并验证它从 retrieval、logs 和后续 task behavior 中消失。

Task-class allowlist

先给 navigation、summarization、docs 等低风险任务启用 memory,再扩展到 code changes 或 security work。

常见问题

给评估 agent memory 的团队提供简短答案。

最重要的 memory 指标是什么?

带 source evidence 的 task correctness。Recall 只有在改善最终 decision 或 diff 且不违反 scope 时才有价值。

如何测试 tenant isolation?

在两个 workspaces 中 seed 相似 facts,只从一个 workspace 查询,并验证另一个 workspace 从未被检索或引用。

所有 agent tasks 都应该启用 memory 吗?

不应该。先从 navigation 和 summarization 等低风险任务开始,证明 accuracy、freshness、deletion 和 audit 行为后再扩展。

Memory logs 至少应包括什么?

至少包括 query、retrieved source、timestamp、scope、tool、task owner,以及 memory 是否影响最终输出。

相关雷达

AI Agent Tools 雷达

相关 RepoDaily 解读

来源

  1. codebase-memory-mcp
  2. Cognee
  3. skills
  4. Anthropic Cybersecurity Skills
  5. SkillSpector
  6. Understand-Anything
  7. Model Context Protocol documentation
  8. Claude Code MCP docs

Feedback

这页是否帮助你做出决定?

匿名反馈只用于判断内容是否真正有用。

报告过期或缺失的证据