AI agent evaluation guide · 更新 2026-06-30

Agent Evaluation Dataset Checklist:SWE-bench、WebArena、OSWorld、GAIA、τ-bench、MCP-Bench、安全探针与回归节奏

在比较 web agents、coding agents、MCP tools、memory layers 和 self-hosted agent runtimes 前,用这份 checklist 选择或构建 agent evaluation dataset。

Agent 评估最容易失败在只测一个漂亮 demo。好的数据集应该把任务领域、工具权限、隐藏状态、预期证据、pass/fail oracle、安全探针、延迟/成本日志和回归节奏拆开。

这份 checklist 把 RepoDaily 已覆盖的 Agent-Reach、Firecrawl、Playwright、Jina Reader、codebase memory、Cognee、skills、SkillSpector、AI Website Cloner Template、DeerFlow,与 SWE-bench、WebArena、VisualWebArena、OSWorld、GAIA、τ-bench、MCP-Bench 以及 MCP eval notebook 的公开评估模式连接起来。

目标不是选出一个万能 benchmark,而是为当前要审查的行为选择最小可用数据集:代码补丁、网页任务、GUI control、tool use、memory recall、permission boundary、协作式用户交互,或生产回归。

RepoDaily 判断

把 benchmark leaderboard 当作方向参考,不要当作 rollout gate。真正可用于生产决策的 agent evaluation set 应该包含领域匹配任务、确定性 oracle、来源证据要求、unsafe-action probes、成本/延迟日志,并在 tools、models、prompts、memory 或 permissions 变化时重复运行。

RepoDaily fixture evidence:synthetic task-card evaluation 测试

这不是 SWE-bench、WebArena、OSWorld、GAIA、τ-bench、MCP-Bench 或任何模型的 benchmark。RepoDaily 构建了一个确定性的本地 fixture,用 machine-readable task cards 和 simulated run records 检查 checklist 是否能区分 valid runs、missing evidence、stale sources、unsafe tool use、wrong-tenant memory 与 regression drift。

证据项Fixture 结果为什么重要限制
Task-card 与 run cases10/10 simulated evaluation cases 返回了预期分类。说明 checklist 可以落成 machine-checkable task cards 与 run artifacts。仅为 synthetic deterministic fixture;没有连接 live model 或 benchmark environment。
Evidence 与 artifact enforcementMissing evidence 可以和成功 run 分开分类。当 expected artifact 缺失时,阻止只靠自然语言叙述宣布成功。Fixture 只检查存在性与 identity,不评价真实 artifact 的语义质量。
Freshness 与 scope probesStale source 和 wrong-tenant cases 被识别为独立失败类型。Agent evaluation 必须区分普通 correctness 问题与 scope/freshness violation。Tenant 和 freshness state 是模拟元数据,不是 live retrieval system。
Tool safety 与 regression driftForbidden tool use 和 mismatched regression keys 可以被检测。Run 即使完成表面任务,也可能违反 policy 或失去 baseline 可比性。Fixture 不测 model capability、latency、cost 或 benchmark difficulty。
  1. Evaluation task 应保存为 machine-readable contract,包含 allowed tools、forbidden tools、expected artifacts、source freshness、tenant scope 和 regression identity。
  2. Release gate 应分别分类 failure modes,而不是把所有失败压成单一 accuracy score。
  3. 生产 rollout 决策前,应把公开 benchmark 结果与 private task cards、regression records 结合。

快速矩阵

评估面优先参考模式能暴露什么容易漏掉什么
Coding-agent patch qualitySWE-bench / SWE-bench Verified 模式agent 是否能修改真实仓库并通过 issue-like tasks 的测试团队 policy、secret handling、PR review burden,以及非 Python 或内部代码差异
Browser 和网站自动化WebArena / VisualWebArena 模式agent 是否能完成 realistic self-hosted websites 或 visual web tasks私有 auth flows、供应商限流、cookies 和 prompt-injection 暴露面
Full computer-use agentsOSWorld 模式agent 是否能在真实 desktop applications 中执行并通过 execution-based checks企业桌面策略、human approval rules 和设备特定约束
General assistant tool useGAIA 模式assistant 是否能组合 reasoning、web browsing、multimodality 和 tool use可复现性、成本控制和任务级操作安全
Collaborative user-facing agentsτ-bench 模式agent 是否能和模拟用户协作完成共享目标真实客户歧义、policy escalation 和 abuse handling
MCP 和 tool-selection behaviorMCP-Bench / MCP eval 模式agent 是否能发现工具、选择参数、使用中间证据并完成多步任务你自己的 MCP server 语义、权限、日志和 incident paths
Agent memory 和 skillsRepoDaily fixture + seeded dataset 模式memory、skills 或 context compression 是否在不泄漏的前提下提升任务正确率除非显式测试,否则容易漏掉 retention、deletion、cross-tenant isolation 和 stale facts

Agent evaluation dataset 评分卡

先评分数据集,再用它比较模型或工具。一个吸引眼球的 benchmark 如果无法复现失败或映射到 rollout 决策,价值有限。

维度0 分1 分2 分Reviewer 问题
任务领域匹配只有通用 demo部分任务匹配任务贴近将要上线的 agent job-to-be-done这个数据集测的是我们要发布的行为吗?
Oracle 质量只有主观 review有部分 rubric有确定性 pass/fail 或边界清晰的人工 rubric我们如何知道任务通过?
证据要求没有来源或日志可选引用强制 source、tool、diff、screenshot 或 state evidence什么 artifact 能证明答案?
权限与安全探针没有 unsafe-action cases部分人工审查明确的 deny/prompt/allow 与 abuse probes数据集能抓住有害成功吗?
可复现性一次性运行只 pin prompt/modelpin data、environment、tools、seeds 和 evaluation scripts另一个 reviewer 能重跑吗?
回归节奏没有重复计划大改后手动跑model、tool、prompt、memory、policy 改动时强制跑什么时候 eval 是 mandatory?
成本和延迟可见性不测量只有 run-level totals记录每 task tokens、wall time、retries、tool calls 和 failures能比较运营成本,而不是只看 accuracy 吗?

30 分钟 agent evaluation dataset 测试计划

在信任公开 benchmark、改造成内部数据集或比较 production agent tools 前先跑这组检查。

0–5 分钟:选择行为

选择一个要评估的行为:repo patching、website navigation、computer use、MCP tool use、memory recall、skill selection 或 permission gating。

成功标准eval 只有一个主要行为,而不是模糊的“agent quality”。

5–10 分钟:映射公开模式

选择最接近的公开 benchmark 模式,例如 SWE-bench、WebArena、OSWorld、GAIA、τ-bench 或 MCP-Bench。

成功标准所选模式匹配 interaction mode 和 oracle style。

10–15 分钟:定义通过证据

每个 task 至少要求一种 pass artifact:test result、final state check、source citation、browser state、screenshot、tool trace 或 reviewer rubric。

成功标准Reviewer 不依赖模型叙述,也能解释为什么 run 通过。

15–20 分钟:加入失败探针

加入 stale data、forbidden tool、wrong tenant、unsafe command、prompt injection、partial extraction 或 irrelevant tool distractor。

成功标准数据集能抓住危险或误导性的成功。

20–25 分钟:跑两个 baseline

在同一 task subset 上比较 no-tool/no-memory baseline 和 candidate agent stack。

成功标准评估能显示工具层是否真正提升结果质量。

25–30 分钟:设置回归规则

定义何时重跑:model upgrade、prompt change、MCP server change、memory schema change、permission policy change 或新数据源。

成功标准数据集变成 release gate,而不是一次性 demo。

数据集选择流程

  1. 先从 rollout 决策出发:哪些 agent 行为会被允许,什么失败会要求阻断上线?
  2. 选择 interaction mode:code patch、web browsing、desktop control、MCP tool use、memory retrieval、user collaboration 或 multi-agent orchestration。
  3. 只有当公开 benchmark 的环境和 oracle 与该 interaction mode 匹配时才采用;否则先构建小型内部 fixture。
  4. 为 task record 定义 instruction、allowed tools、forbidden actions、starting state、expected evidence、pass oracle、cost budget 和 reviewer owner。
  5. 加入 negative probes:stale facts、wrong tenant、unsafe command、credential-like strings、prompt injection、missing source 和 irrelevant tool distractors。
  6. 比较 headline success rate 前,至少跑两个 baseline,并记录 tool traces、tokens、latency、retries 和 final artifacts。
  7. 把数据集变成每次 model、prompt、memory、MCP server、permission 和 source-pack 改动后的 regression gate。

场景表

场景数据集设计通过信号
Coding-agent rollout使用 issue-like tasks、repository snapshots、tests、patch diff review 和 forbidden command probesPatch 通过测试,且没有违反 command 或 secret policy
带 web access 的 research agent使用 web tasks,并要求 source freshness、conflicting pages、prompt injection 和 citations答案引用正确当前来源,并忽略页面注入指令
Browser automation agent使用带账号状态、表单、文件上传和 final-state checks 的 self-hosted website tasks最终状态匹配预期,且所有 browser actions 被记录
Computer-use agent使用 desktop tasks、screenshots、app state、setup scripts 和 cleanup checksExecution artifacts 证明 GUI task 完成,且没有隐藏人工介入
MCP tool server pilot使用 fuzzy user requests、distractor tools、parameter validation 和 intermediate evidence captureAgent 选择正确 tool chain,并基于 tool outputs 回答
Agent memory layer种入 true、stale、forbidden、deleted 和 cross-tenant factsAgent 只回忆 scoped/current facts,并拒绝或忽略 forbidden/stale data
Skill library rollout对同一 task variant 比较 with/without skill injection,并 pin repo contextSkill 改善 task outcome,且没有越权或冲突 repo policy

数据集风险清单

Leaderboard mismatch

公共 benchmark 高分仍可能漏掉你的私有工具、权限、客户流程或合规边界。

Subjective oracle drift

如果 reviewer 临时判断 pass/fail,改进可能只是 reviewer 情绪,而不是 agent 行为变化。

Task leakage

公开任务可能被记忆或针对性调优。rollout 决策要保留 private holdout set。

Unsafe success

agent 可能完成了用户可见任务,却使用 forbidden tools、泄漏数据或绕过 approvals。

Environment fragility

Browser、OS、MCP 和 package environments 可能因环境原因失败,和模型质量无关。要单独记录环境失败。

Cost-blind comparison

只有 accuracy 而没有 tool-call count、latency、retry 和 token cost,会掩盖运营上不可用的 agent。

实现模式

Task card schema

为每个 task 存 instruction、starting state、allowed tools、forbidden tools、expected artifact、oracle、owner 和 rerun trigger。

Evidence-first scoring

标记正确前,要求 source links、patches、screenshots、final-state JSON、tool traces 或 test output。

Negative probes

加入应该 prompt、refuse 或 safe-fail 的任务,而不是只放期望成功的任务。

Public + private split

公共 benchmark 用来定位方向,私有 fixture set 用于 rollout 和 regression 决策。

Baseline ladder

比较 no-tool、source-only、tool-enabled、memory-enabled 和 full-agent runs,隔离到底是哪一层有效。

Regression registry

每次 eval 记录 model、prompt、tool version、MCP server version、memory schema、policy version 和 run artifacts。

常见问题

给正在选择 agent evaluation dataset 的团队提供简短答案。

一个 benchmark 能评估所有 agent 吗?

不能。Coding agents、browser agents、MCP tool agents、memory agents 和 user-collaboration agents 需要不同 interaction modes 和 oracles。

应该信任公开 leaderboard 吗?

可以用来判断方向,但不要直接作为 rollout 决策。上线前要加入 private tasks、safety probes 以及 cost/latency logging。

最小可用内部数据集需要多大?

10 到 20 个任务也可以有价值,前提是包含清晰 pass artifacts、negative probes,以及绑定真实 rollout 决策的 regression rules。

Agent eval 应该多久重跑一次?

每当 model、prompt、tool permissions、MCP server、memory schema、data source 或 allowed action policy 改动时都应该重跑。

相关雷达

AI Agent Tools 雷达

相关 RepoDaily brief

来源

  1. SWE-bench official site
  2. SWE-bench GitHub repository
  3. WebArena GitHub repository
  4. VisualWebArena GitHub repository
  5. OSWorld official site
  6. GAIA leaderboard
  7. τ-bench official site
  8. MCP-Bench GitHub repository
  9. OpenAI Cookbook MCP evaluation notebook

Feedback

这页是否帮助你做出决定?

匿名反馈只用于判断内容是否真正有用。

报告过期或缺失的证据