仓库感知代码智能 · 更新 2026-07-20

代码智能评估清单:准确率、新鲜度、来源追踪、隐私与 Agent 结果

在编程 Agent 依赖仓库图谱、代码记忆、GraphRAG 或 MCP 上下文工具前使用的可重复评估清单。

代码智能工具应按是否减少开发者或 Agent 的错误修改来评估,而不是按图谱是否漂亮。

在同一个代表性仓库、分支和预设变更任务上运行清单,同时记录检索质量和后续修改结果。

RepoDaily 判断

在工具证明符号覆盖、新鲜度、来源追踪、隐私边界,并能减少错误文件修改或无关上下文前,不应正式采用仓库智能层。

复用这份清单

将 Markdown 版本复制到 issue、架构决策记录或团队评估文档。

RepoDaily 评估方法证据

确定性本地 fixture 已通过 10/10 项检查。该结果只验证评估方法,不是任何候选工具的 benchmark,也不会提升候选项目的证据等级。

编号领域预期实际结果
CI01覆盖率found_with_provenancefound_with_provenance通过
CI02变更影响caller_and_test_visiblecaller_and_test_visible通过
CI03多语言python_and_typescript_visiblepython_and_typescript_visible通过
CI04已知缺口unsupported_explicitunsupported_explicit通过
CI05分支隔离branch_scopedbranch_scoped通过
CI06重命名新鲜度old_removed_new_addedold_removed_new_added通过
CI07删除新鲜度deleted_removeddeleted_removed通过
CI08来源追踪completecomplete通过
CI09产物清单documented_local_onlydocumented_local_only通过
CI10基线baseline_and_added_value_recordedbaseline_and_added_value_recorded通过
  1. 该方法能够区分覆盖率与来源追踪,并显式暴露不支持文件。
  2. 重命名、删除和分支隔离测试可防止外观可信但内容过期的索引通过。
  3. fixture 保留无工具 baseline,并记录全部本地产物。
  4. 真实产品仍需分别安装、记录版本并测试任务结果,才能达到 L2。

快速矩阵

领域最低证据失败信号决策
覆盖率关键符号、导入、调用和所有权路径可见重要文件或关系缺失Hold
新鲜度修改后能按文档刷新分支或文件变化后旧边仍存在Hold
来源追踪回答能指向文件、符号或提交解释无法追溯Watch
隐私产物、缓存和网络调用清楚私有代码离开批准边界Hold
Agent 结果错误文件修改或无关上下文减少只增加延迟而不改善决策不要采用
退出成本索引和本地产物可干净删除卸载后仍有不透明状态谨慎评估

代码智能证据评分卡

评证据,不评营销。受控试用前建议至少达到 8/12。

维度0 分1 分2 分审查问题
符号覆盖关键符号缺失部分覆盖代表性符号和关系已验证哪些重要代码不可见?
新鲜度重建方式不清刷新偶尔有效分支和增量变化可靠上下文多久变旧?
来源追踪无来源链接仅文件级文件、符号、变化可追溯每个结论能核查吗?
隐私数据路径未知默认本地但产物不清本地、网络、存储边界明确私有代码可能去哪里?
Agent 结果未测效果主观改善可重复减少错误修改或上下文Agent 是否做出更好决策?
运行适配安装脆弱需要人工维护安装、刷新、清理可重复团队能持续维护吗?

60 分钟冒烟测试

这是 L2 smoke test,不代表生产就绪。

0–10 分钟:baseline

不用工具回答五个仓库问题。

成功标准记录答案、延迟和上下文。

10–20 分钟:安装索引

安装、索引并记录产物与网络行为。

成功标准安装可复现且数据边界清楚。

20–35 分钟:准确率

测试符号、调用、依赖、所有权和测试。

成功标准回答引用正确文件并明确缺口。

35–45 分钟:新鲜度

重命名、删除并切换分支。

成功标准按文档刷新后 stale 关系消失。

45–60 分钟:Agent 任务

用相同 prompt 运行一次修 bug 或重构。

成功标准文件选择更好或无关上下文更少,且没有新增严重错误。

评估流程

  1. 选择包含多语言、生成文件、测试和非平凡依赖路径的代表性仓库。
  2. 安装前预设五个问题和三个变更任务,确保候选接受相同测试。
  3. 先用 grep、LSP、repo map 或未接入工具的 Agent 记录 baseline。
  4. 在记录明确的环境中安装和索引,记录时间、磁盘、网络调用和产物。
  5. 测试符号查找、依赖路径、所有权、分支变化、删除文件和 stale index 恢复。
  6. 运行相同编程任务,比较错误文件修改、无关上下文、工具调用、延迟和 reviewer 修正。
  7. 记录未验证内容,并在 release 或仓库结构变化后安排复核。

场景表

场景必须测试通过条件
新人上手找到入口与业务流程来源正确,无需读完整文件树
Agent 修 bug找到 owner、调用方和测试编辑正确文件并说明依赖路径
重构影响面修改共享符号找到调用方和测试,不制造虚假确定性
分支隔离两个分支使用冲突符号回答反映活动分支
新鲜度恢复重命名与删除文件按文档刷新后旧关系消失
私有仓库检查存储和网络行为代码与产物不越过批准边界

风险清单

图谱漂亮但不完整

用已知符号和不支持语言验证 parser 缺口。

上下文过期

测试分支、重命名和删除,避免 Agent 自信地改错文件。

摘要不可追溯

没有具体文件和符号来源的生成解释只能作为提示。

私有代码产物

使用敏感仓库前检查索引、embedding、日志、导出和远程 API。

基准表演

仅减少 token 不够,还要测错误修改、reviewer 修正和任务成功。

评估模式

预设事实集

测试前写下预期答案,避免移动目标。

先做 baseline

与 grep、LSP、repo-map 或无辅助 Agent 比较。

产物清单

记录数据库、缓存、embedding、导出、日志和网络目的地。

故障注入

重命名、删除、切分支并加入不支持语法。

结果审查

由人工 reviewer 评价文件选择、依赖推理和修正成本。

常见问题

用于统一评估预期。

token 更少就算通过吗?

不算。只有任务成功率、文件选择和 reviewer 成本不下降时,减少上下文才有价值。

每个仓库都需要图谱吗?

不需要。小仓库可能更适合 grep、LSP 或轻量 repo map。

完成清单是什么证据等级?

完成冒烟测试可支持 L2;重复场景测试支持 L3;长期类生产证据为 L4。

RepoDaily 直接测试了什么?

RepoDaily 已用合成的本地仓库直接测试清单方法,但尚未完成四个候选产品的统一动手测试。

相关雷达

AI Agent 工具雷达

相关 RepoDaily 解读

来源

  1. DeusData/codebase-memory-mcp
  2. Egonex-AI/Understand-Anything
  3. safishamsi/graphify
  4. tirth8205/code-review-graph

Feedback

这页是否帮助你做出决定?

匿名反馈只用于判断内容是否真正有用。

报告过期或缺失的证据