核心问题: 你的 AI 编码 Agent 是否已接触生产系统、代码仓库或客户数据?你是否需要一个能理解 Agent 工具调用链而非仅分析提示文本的检测层?
RepoDaily 采用评分
RepoDaily 将该项目的采用分评为 91/100(强):分数来自文章来源、安装路径、生产风险、差异化、许可证清晰度以及 AI/Agent 适配度。
包含 5 个来源、覆盖 4 类来源;如有 RepoDaily 独有模块,会进一步提高证据分。
检测到 5 个工作流步骤、6 个下一步动作,以及 5 个命令/安装信号。
趋势热度为 +321 stars;如内容中有 release、issue 或维护信号,会提高维护可信度。
采纳风险标记为 medium,并包含 5 条安全说明与 4 条跳过条件。
3 个机会视角、4 个替代方案,以及 3 个类型化模块支撑差异化判断。
文章中包含许可证来源或许可证表述。
文章正文和元数据中检测到 9 个 AI/Agent 相关信号。
项目概览
ADR(Agentic AI Detection and Response)是 Uber 推出的企业级安全系统,针对大多数组织刚开始面对的问题:AI Agent 在企业环境中自主调用工具、执行代码和传输数据,却几乎没有人工审查。该仓库随 MLSys 2026 论文一同发布,将 ADR 四大组件中的三个开源:用于遥测采集的 Sensor、用于安全评估的 ADR-Bench、以及用于识别风险会话的 Detector。第四个组件 Prevention 在论文中有描述,但明确未包含在本次发布中。
ADR 与传统提示注入扫描器的关键区别在于其双层检测架构:高召回率的第一层先对所有会话进行初筛标记,然后更深入的 Agent 推理层对可疑会话进行详细调查。这种设计旨在不遗漏新型攻击向量的前提下控制误报量——正是 ADR-Bench 基准(303 个任务、133 个 MCP 服务器、17 种 Agent 攻击技术)要严格衡量的权衡。
Sensor 组件将 macOS、Linux 和 Windows 上 7 种以上 AI 编码工具的遥测数据标准化,以统一 Schema 采集 Agent 意图、工具调用和执行轨迹。这让安全团队跨异构编码助手获得一致的视图,而非按工具各自为政的日志孤岛。Uber 表示 ADR 已在内部生产环境部署,覆盖面向员工的编码 Agent 和面向客户的支持 Agent。
为什么现在变热
- 被 MLSys 2026 接收并发布完整论文和幻灯片,在被厂商营销主导的领域提供了学术可信度。
- 在 Uber 生产环境中部署,覆盖面向员工的编码 Agent(Cursor、Claude Code、Codex)和面向客户的支持 Agent。
- ADR-Bench 是本次发布中规模最大的开源 Agent 安全基准:303 个任务、133 个 MCP 服务器、覆盖全部 17 种已知 Agent 攻击技术。
- Sensor 将三种操作系统上 7+ AI 编码工具的遥测统一为单一标准化 Schema——大多数团队目前只能临时自建此能力。
- Apache 2.0 许可证和清晰的组件边界使企业安全团队能够直接采用并构建下游工具。
解决什么问题
- AI 编码 Agent 以广泛权限自主调用 shell、文件系统、MCP 服务器和 Web API,且缺少逐操作审查,创造了传统 DLP 和端点工具无法建模的新攻击面。
- Agent 会话不透明:没有标准化遥测,安全团队无法在可疑事件后重建 Agent 的意图、调用了哪些工具或访问了哪些数据。
- 目前缺少广泛采用的基准来评估 Agent 特定攻击技术(提示注入、工具投毒、通过 MCP 提权),使得检测器之间难以公平比较。
- 误报量是已知障碍:对 Agent 轨迹进行简单的关键词或模式匹配会产生大量噪声,淹没安全分析师,因此需要初筛加推理的双层流水线。
工作原理
- Sensor 在 macOS、Linux 和 Windows 上挂钩 AI 编码工具(Claude Code、Cursor、Codex 等),以 Sensor/ 目录下存储的统一 Schema 采集 Agent 意图、工具调用和执行轨迹。
- Detector 的初筛层对传入会话执行高召回率筛查,标记任何需要深入调查的会话。
- Detector 的 Agent 推理层对标记会话进行深入分析——读取完整的工具调用链、MCP 服务器交互和执行上下文,对行为进行分类。
- ADR-Bench 提供评估基础设施:133 个 MCP 服务器上的 303 个基准任务,覆盖全部 17 种 Agent 攻击技术,附带基线检测器和绘图脚本以实现可复现比较。
- 完整复现流程记录在 docs/REPRODUCIBILITY.md 中:解压打包的基准、运行检测器、绘制论文图表。
仓库结构与组件边界
仓库由两个主要代码目录和文档组成。Sensor/ 包含可观测性层——从 Claude Code、Cursor、Codex 等受支持工具摄取遥测数据的解析器和 Schema 标准化器。Detection/ 包含基准基础设施(ADR-Bench 任务、133 个 MCP 服务器、基线检测器实现)以及双层 Agent 检测器本身。
值得注意的是,ADR Prevention 引擎(实时阻断不安全操作)和 ADR Explorer(通过预部署红队演练加固检测的离线工具)均未包含在开源发布中。两者在 MLSys 2026 论文中有描述,但在仓库中被保留,README 标注 Prevention 为'Stay tuned'。
Detection/ 目录还包含第三方代码:Detection/benchmark/agentdojo/ 是 MIT 许可的 AgentDojo 代码,独立于仓库的 Apache 2.0 条款。Detection/ 中的所有基准数据均为合成数据——虚假凭证和模拟环境——因此不会暴露真实企业数据。
快速上手:克隆、同步、运行
- 克隆:`git clone https://github.com/uber/ADR`,然后 `cd ADR/Detection`。
- 安装依赖:`uv sync`(项目使用 uv 作为 Python 包管理器)。
- 设置 API 密钥:`export ANTHROPIC_API_KEY="..." OPENAI_API_KEY="..."`——默认的 `adr` 双层检测器需要两个密钥。
- 免密冒烟测试:`--detector llamafirewall` 无需付费 API 密钥即可运行基线比较。
- 完整评估:按照 docs/REPRODUCIBILITY.md 解压打包的基准、运行检测器、生成论文图表。
- 组件文档:Sensor/README.md 涵盖遥测 Schema;Detection/README.md 涵盖基准任务、MCP 基础设施和检测器基线。
ADR 与相关安全工具的对比
- 对比 LlamaFirewall:ADR 将 LlamaFirewall 作为内置基线检测器(`--detector llamafirewall`)。LlamaFirewall 是提示注入和内容过滤器;ADR 额外提供完整工具调用链分析、303 任务基准和初筛加推理双层流水线。
- 对比 AgentDojo:AgentDojo 被封装在 ADR-Bench 内作为基准底座。ADR 在此基础上扩展了 133 个 MCP 服务器、双层 Agent 检测器和来自生产编码工具的企业遥测。
- 对比传统 DLP:DLP 工具检查数据载荷;ADR 建模 Agent 意图和工具调用链——Agent 尝试做什么以及为什么,而不仅仅是传输了哪些字节。
- 对比纯提示注入扫描器:ADR 的检测覆盖全部 17 种 Agent 攻击技术(包括工具投毒和通过 MCP 提权),而非仅限提示文本中的注入。
谁适合关注
适合关注
- 你的工程组织已采用 AI 编码 Agent(Cursor、Claude Code、Codex),它们执行代码、访问仓库或调用 MCP 服务器接触生产或预发布系统。
- 你需要一个可复现的基准来评估和比较 Agent 安全检测器,再决定选择供应商或自研。
- 你需要跨多种编码工具的标准化 Agent 遥测,而非分析师需要手动关联的按工具分散日志。
- 你是安全研究人员,需要 133 个 MCP 服务器的基准基础设施来研究新的 Agent 攻击技术。
可以先跳过
- 你在生产环境中没有 AI Agent,仅需评估聊天机器人响应的提示级输入/输出过滤。
- 你需要实时阻断——该组件不在开源发布中,也没有承诺的时间线。
- 你的环境无法运行 Python 配合 uv,或无法为默认双层检测器配置 ANTHROPIC_API_KEY 和 OPENAI_API_KEY。
- 你需要开箱即用的 SIEM 或 SOAR 替代品——ADR 是检测和基准工具包,不是完整的应急响应平台。
风险与注意事项
基准和检测组件已完全开源并有文档记录,但 Prevention 和 Explorer 被保留,双层检测器需要付费 API 密钥,且仓库仅提供 Sensor 和 Detection,不包含部署编排。
- 默认的 `adr` 检测器需要 ANTHROPIC_API_KEY 和 OPENAI_API_KEY,产生持续的生产检测推理成本。
- ADR Prevention——阻断不安全操作的组件——未包含在本次发布中,团队获得检测能力但没有自动化处置。
- ADR Explorer 离线红队引擎也被保留,限制了外部采用者的预部署加固能力。
- 未包含 Docker 镜像、Helm Chart 或部署清单;团队必须自建生产部署路径。
- 项目由单一组织(Uber)新近开源;长期维护节奏和社区治理尚待验证。
- ADR-Bench 覆盖全部 17 种已知 Agent 攻击技术,跨 303 个任务和 133 个 MCP 服务器,是本次发布中最全面的开源 Agent 安全基准。
- 双层检测流水线(高召回初筛加 Agent 推理)旨在抑制困扰简单模式匹配检测器的误报。
- Detection/ 中的所有基准数据均使用合成数据——虚假凭证和模拟环境——不泄露真实机密或企业数据。
- Sensor 在 macOS、Linux 和 Windows 上采集 7+ AI 编码工具的执行轨迹,为应急响应人员提供事后会话重建能力。
- Detection/benchmark/agentdojo/ 中封装的 AgentDojo 代码为 MIT 许可,独立于 Apache 2.0 主许可证单独披露。
替代方案比较
| 方案 | 适用场景 | 代价 |
|---|---|---|
LlamaFirewall | 需要轻量级、免密钥的提示注入基线,不需要完整的双层 Agent 推理流水线。ADR 已将其作为 `--detector llamafirewall` 内置。 | 免费 / 开源 |
AgentDojo | 需要独立的 Agent 基准底座。ADR-Bench 封装了 AgentDojo 并扩展了 133 个 MCP 服务器和企业任务覆盖。 | 免费 / 开源 |
NeMo Guardrails | 关注点是 LLM 聊天机器人的对话输入/输出护栏,而非编码 Agent 的自主工具调用检测。 | 免费 / 开源 |
企业级 DLP 平台(如 Symantec、Forcepoint) | 需要传统文件传输和网络外泄的数据防泄漏能力,但不需要 Agent 意图建模。 | 商业许可 |
这个趋势说明了什么
MCP 服务器红队演练实验室
ADR-Bench 提供 133 个 MCP 服务器和 303 个覆盖 17 种攻击技术的任务。安全团队可以用镜像内部工具的自定义 MCP 服务器扩展基准,创建针对特定 Agent 部署的红队实验室。
克隆 Detection/,按照 Detection/README.md 第 3 部分'Enriching the benchmark'的指引添加自定义 MCP 服务器和恶意测试服务器。
统一 Agent 遥测管道
Sensor 已将 7+ 编码工具的遥测标准化为统一 Schema。运行混合 Agent 车队(macOS 上的 Cursor、Linux 上的 Claude Code、Windows 上的 Codex)的组织可以将 Sensor 作为单一摄取层,对接现有 SIEM 或数据湖。
查看 Sensor/README.md 中的统一 Schema 定义和解析器约定;按照 Sensor/CONTRIBUTING.md 为不受支持的工具添加解析器。
Agent 安全学术合作
MLSys 2026 论文、CITATION.cff 和复现工作流使 ADR 成为安全研究的可信基础。研究人员可以复现论文图表,并将新攻击技术或检测器基线贡献回 ADR-Bench。
按照 docs/REPRODUCIBILITY.md 端到端操作,使用提供的 BibTeX 引用,通过 CONTRIBUTING.md 流程提交新任务或 MCP 服务器(需签署 CLA)。
RepoDaily 判断
ADR 是迄今为止面向企业 AI Agent 安全的最具实质性的开源发布——一个在 Uber 生产环境部署的检测系统,有 MLSys 2026 论文支撑,附带覆盖 133 个 MCP 服务器和 17 种攻击技术的 303 任务基准。未发布的 Prevention 和 Explorer 组件以及默认检测器的 API 密钥成本是真实约束,但对于任何在真实系统上运行 Cursor、Claude Code 或 Codex 的团队来说,仅 ADR-Bench 和 Sensor 就值得评估。