0–10 分钟:baseline
不用工具回答五个仓库问题。
成功标准记录答案、延迟和上下文。
仓库感知代码智能 · 更新 2026-07-20
在编程 Agent 依赖仓库图谱、代码记忆、GraphRAG 或 MCP 上下文工具前使用的可重复评估清单。
代码智能工具应按是否减少开发者或 Agent 的错误修改来评估,而不是按图谱是否漂亮。
在同一个代表性仓库、分支和预设变更任务上运行清单,同时记录检索质量和后续修改结果。
RepoDaily 判断
在工具证明符号覆盖、新鲜度、来源追踪、隐私边界,并能减少错误文件修改或无关上下文前,不应正式采用仓库智能层。
先用横评选择候选,再到 Radar 查看基于证据的当前状态。
将 Markdown 版本复制到 issue、架构决策记录或团队评估文档。
确定性本地 fixture 已通过 10/10 项检查。该结果只验证评估方法,不是任何候选工具的 benchmark,也不会提升候选项目的证据等级。
| 编号 | 领域 | 预期 | 实际 | 结果 |
|---|---|---|---|---|
| CI01 | 覆盖率 | found_with_provenance | found_with_provenance | 通过 |
| CI02 | 变更影响 | caller_and_test_visible | caller_and_test_visible | 通过 |
| CI03 | 多语言 | python_and_typescript_visible | python_and_typescript_visible | 通过 |
| CI04 | 已知缺口 | unsupported_explicit | unsupported_explicit | 通过 |
| CI05 | 分支隔离 | branch_scoped | branch_scoped | 通过 |
| CI06 | 重命名新鲜度 | old_removed_new_added | old_removed_new_added | 通过 |
| CI07 | 删除新鲜度 | deleted_removed | deleted_removed | 通过 |
| CI08 | 来源追踪 | complete | complete | 通过 |
| CI09 | 产物清单 | documented_local_only | documented_local_only | 通过 |
| CI10 | 基线 | baseline_and_added_value_recorded | baseline_and_added_value_recorded | 通过 |
| 领域 | 最低证据 | 失败信号 | 决策 |
|---|---|---|---|
| 覆盖率 | 关键符号、导入、调用和所有权路径可见 | 重要文件或关系缺失 | Hold |
| 新鲜度 | 修改后能按文档刷新 | 分支或文件变化后旧边仍存在 | Hold |
| 来源追踪 | 回答能指向文件、符号或提交 | 解释无法追溯 | Watch |
| 隐私 | 产物、缓存和网络调用清楚 | 私有代码离开批准边界 | Hold |
| Agent 结果 | 错误文件修改或无关上下文减少 | 只增加延迟而不改善决策 | 不要采用 |
| 退出成本 | 索引和本地产物可干净删除 | 卸载后仍有不透明状态 | 谨慎评估 |
评证据,不评营销。受控试用前建议至少达到 8/12。
| 维度 | 0 分 | 1 分 | 2 分 | 审查问题 |
|---|---|---|---|---|
| 符号覆盖 | 关键符号缺失 | 部分覆盖 | 代表性符号和关系已验证 | 哪些重要代码不可见? |
| 新鲜度 | 重建方式不清 | 刷新偶尔有效 | 分支和增量变化可靠 | 上下文多久变旧? |
| 来源追踪 | 无来源链接 | 仅文件级 | 文件、符号、变化可追溯 | 每个结论能核查吗? |
| 隐私 | 数据路径未知 | 默认本地但产物不清 | 本地、网络、存储边界明确 | 私有代码可能去哪里? |
| Agent 结果 | 未测效果 | 主观改善 | 可重复减少错误修改或上下文 | Agent 是否做出更好决策? |
| 运行适配 | 安装脆弱 | 需要人工维护 | 安装、刷新、清理可重复 | 团队能持续维护吗? |
这是 L2 smoke test,不代表生产就绪。
不用工具回答五个仓库问题。
成功标准记录答案、延迟和上下文。
安装、索引并记录产物与网络行为。
成功标准安装可复现且数据边界清楚。
测试符号、调用、依赖、所有权和测试。
成功标准回答引用正确文件并明确缺口。
重命名、删除并切换分支。
成功标准按文档刷新后 stale 关系消失。
用相同 prompt 运行一次修 bug 或重构。
成功标准文件选择更好或无关上下文更少,且没有新增严重错误。
| 场景 | 必须测试 | 通过条件 |
|---|---|---|
| 新人上手 | 找到入口与业务流程 | 来源正确,无需读完整文件树 |
| Agent 修 bug | 找到 owner、调用方和测试 | 编辑正确文件并说明依赖路径 |
| 重构影响面 | 修改共享符号 | 找到调用方和测试,不制造虚假确定性 |
| 分支隔离 | 两个分支使用冲突符号 | 回答反映活动分支 |
| 新鲜度恢复 | 重命名与删除文件 | 按文档刷新后旧关系消失 |
| 私有仓库 | 检查存储和网络行为 | 代码与产物不越过批准边界 |
用已知符号和不支持语言验证 parser 缺口。
测试分支、重命名和删除,避免 Agent 自信地改错文件。
没有具体文件和符号来源的生成解释只能作为提示。
使用敏感仓库前检查索引、embedding、日志、导出和远程 API。
仅减少 token 不够,还要测错误修改、reviewer 修正和任务成功。
测试前写下预期答案,避免移动目标。
与 grep、LSP、repo-map 或无辅助 Agent 比较。
记录数据库、缓存、embedding、导出、日志和网络目的地。
重命名、删除、切分支并加入不支持语法。
由人工 reviewer 评价文件选择、依赖推理和修正成本。
用于统一评估预期。
不算。只有任务成功率、文件选择和 reviewer 成本不下降时,减少上下文才有价值。
不需要。小仓库可能更适合 grep、LSP 或轻量 repo map。
完成冒烟测试可支持 L2;重复场景测试支持 L3;长期类生产证据为 L4。
RepoDaily 已用合成的本地仓库直接测试清单方法,但尚未完成四个候选产品的统一动手测试。
Feedback
匿名反馈只用于判断内容是否真正有用。