从评估标准反推基础设施架构诉求 —— 覆盖 OpenAI、Anthropic、Google、Meta、字节、阿里、腾讯、美团、京东等业界实践
评估 Agent 的广度与通用性,强调多步推理、工具组合与真实世界信息获取。GAIA 因"人类级难度"成为最常被引用的通用助手基准。
| Benchmark | 权威度 | 发布方 | 任务数 | 核心特征 | 大厂采用 |
|---|---|---|---|---|---|
| GAIA | ⭐⭐⭐⭐⭐ | Meta + Hugging Face | 466 | 真实世界多步推理,需搜索/文件解析/代码;分 3 级难度,人类约 92% | Google Anthropic OpenAI 阿里 字节 |
| AgentBench | ⭐⭐⭐⭐ | 清华/多机构 | 1,014+ | 跨 8 环境(OS、DB、KG、游戏、具身等)评估通用 Agent | 腾讯 百度 阿里 |
| MINT | ⭐⭐⭐ | 多机构 | 多轮交互 | 多轮工具使用与语言反馈整合能力 | OpenAI Anthropic |
| ARC-AGI-2 | ⭐⭐⭐⭐ | ARC Prize | 1,000+120 | 流体智能测试,抽象推理与规则组合 | OpenAI/o3 |
SWE-bench 系列是 2026 年最具影响力的代码 Agent 基准,直接测试 Agent 在真实代码库中的端到端 Bug 修复能力。中国大厂在此领域已形成自研基准体系。
| Benchmark | 权威度 | 发布方 | 任务数 | 核心特征 | 大厂采用 |
|---|---|---|---|---|---|
| SWE-bench | ⭐⭐⭐⭐⭐ | OpenAI + 多机构 | 2,294 | 真实 GitHub Issue,端到端 Bug 修复,需理解代码库、定位 Bug、生成 Patch 并通过测试 | OpenAI Codex Claude Code Gemini CLI 阿里 Qwen 腾讯 Hy3 字节 Moonshot |
| SWE-bench Verified | ⭐⭐⭐⭐⭐ | OpenAI | 500 | 人工验证子集,排除无解/模糊任务,当前最权威代码 Agent 排行榜 | OpenAI Anthropic 阿里 |
| SWE-bench Pro | ⭐⭐⭐⭐ | 多机构 | 731 | 多语言、标准化脚手架,减少数据污染风险 | OpenAI Anthropic |
| SWE-Universe | ⭐⭐⭐⭐⭐ | 阿里 Qwen 团队 | 807,693 | 百万级真实 SWE 可验证环境,支持 Agent 中训与 RL;Qwen3-Max-Thinking 达 75.3% | 阿里 |
| Terminal-Bench | ⭐⭐⭐⭐ | 多机构 | 多任务 | 真实 Shell 命令行端到端任务,评估命令行 Agent | 阿里 Qwen 3.6 腾讯 Hy3 |
| LiveCodeBench | ⭐⭐⭐⭐ | 多机构 | 动态更新 | 竞赛编程,防训练数据污染 | 阿里 Qwen DeepSeek |
| Phoenix-bench | ⭐⭐⭐ | 多机构 | 511 | 硬件工程 (Verilog/SystemVerilog),评估 EDA 验证下的代码 Agent | Claude Code Codex Gemini CLI |
| QwenClawBench | ⭐ | 阿里巴巴 | 内部 | 真实用户分布的 Claw Agent 工具使用基准,计划开源 | 阿里内部 |
| QwenWebBench | ⭐ | 阿里巴巴 | 内部 | 前端代码生成与 Web 交互,Elo 评分体系 | 阿里内部 |
cd、pip install、rm -rf 需可追溯,用于失败归因与安全审计。WebArena 是浏览器 Agent 的事实标准,区分 DOM-based Agent 与 Visual Agent。2026 年 OpenAI Operator 在该基准上约 61%,Anthropic Computer Use 约 77.5%。
| Benchmark | 权威度 | 发布方 | 任务数 | 核心特征 | 大厂采用 |
|---|---|---|---|---|---|
| WebArena | ⭐⭐⭐⭐⭐ | 多机构 | 812 | 自托管真实网站,多步目标,长时程规划,稀疏奖励 | OpenAI Operator Anthropic Google 字节 |
| Visual WebArena | ⭐⭐⭐⭐ | 多机构 | 812 | WebArena 视觉版本,需基于截图进行视觉定位与操作 | OpenAI Anthropic |
| Mind2Web | ⭐⭐⭐⭐ | 多机构 | 2,350 | 137 个真实网站上的任务,覆盖复杂网页交互 | OpenAI Google Anthropic |
| BrowseComp | ⭐⭐⭐⭐ | OpenAI | 多任务 | 复杂信息检索与浏览能力 | OpenAI 腾讯 Hy3 |
| WebVoyager | ⭐⭐⭐ | 多机构 | 数百 | 大规模真实网站动态内容评估,强调自然交互与鲁棒性 | Skyvern 等 |
OSWorld 是最难、最真实的 Agent 基准之一,测试跨应用、低级别鼠标键盘控制。人类基线约 72%,2026 年 SOTA 约 82% (Coasty),OpenAI Operator 约 38%。
| Benchmark | 权威度 | 发布方 | 任务数 | 核心特征 | 大厂采用 |
|---|---|---|---|---|---|
| OSWorld | ⭐⭐⭐⭐⭐ | HKU + Salesforce + CMU | 369 | 真实 Ubuntu/Windows/macOS,跨应用工作流(浏览器、Office、终端、图像编辑) | Anthropic Computer Use OpenAI Operator Google Mariner 字节 |
| OSWorld-Verified | ⭐⭐⭐⭐ | 官方 | 更严格子集 | 更严格评估标准,防止通过配置泄露等作弊 | Anthropic OpenAI |
| Windows Agent Arena | ⭐⭐⭐ | Microsoft | 多任务 | Windows 桌面 Agent 评估 | Microsoft |
BFCL 是函数调用的事实标准,τ-bench 是工具+对话+策略合规的生产级基准。两者结合可全面评估 Agent 的工具使用能力。C3-Bench 是腾讯混元在 ICLR 2026 发表的多任务鲁棒性基准。
| Benchmark | 权威度 | 发布方 | 任务数 | 核心特征 | 大厂采用 |
|---|---|---|---|---|---|
| BFCL | ⭐⭐⭐⭐⭐ | UC Berkeley | 2,000+ | 函数选择、参数填充、并行调用、多轮调用、跨语言 (Python/Java/JS/REST) | OpenAI Anthropic Google 阿里 腾讯 智谱 |
| τ-bench | ⭐⭐⭐⭐ | Sierra AI | 165 | 多轮客服对话,需遵守领域策略(零售/航空),状态ful 工具使用 | Google 阿里 Moonshot |
| τ²-bench / τ³-bench | ⭐⭐⭐ | Sierra AI | 50,114+ | τ-bench 扩展版本,更多领域与任务 | Google Moonshot |
| ToolBench | ⭐⭐⭐ | 多机构 | 16,464 APIs | 大规模真实 API 调用,多步交互,3 级难度 | OpenAI Anthropic |
| C3-Bench | ⭐⭐⭐⭐ | 腾讯混元 | 1,024 | 三项挑战:复杂工具关系、隐藏信息、动态决策路径;混元 A13B 官方报告,SuperClue Agent 国内第一 | 腾讯混元 |
| T-Eval | ⭐⭐⭐ | 多机构 | 多维度 | 六维度细粒度工具使用诊断(选择、参数、排序、对话等) | 阿里 OpenAI |
τ-bench 是客服 Agent 的首选基准,WorkArena 针对企业知识工作,VoiceAgentEval 是美团自研的语音外呼评估体系。
| Benchmark | 权威度 | 发布方 | 任务数 | 核心特征 | 大厂采用 |
|---|---|---|---|---|---|
| τ-bench 系列 | ⭐⭐⭐⭐ | Sierra AI | 见上 | 客服场景多轮对话+策略合规 | Google 阿里 Moonshot |
| TravelPlanner | ⭐⭐⭐ | 多机构 | 1,225 | 旅行规划,长时程规划与约束满足 | OpenAI Google |
| WorkArena | ⭐⭐⭐ | ServiceNow | 33 | ServiceNow 知识工作原子任务 | Microsoft ServiceNow |
| VoiceAgentEval | ⭐⭐ | 美团 + xbench | 150 人设 × 30 子场景 | AI 外呼智能体评测,用户模拟器,拟人度评估 | 美团 |
| EcomBench | ⭐⭐ | 多机构(含字节) | 多任务 | 真实电商场景,动态更新,人机闭环 | 京东 字节 |
LoCoMo + LongMemEval + BEAM 构成 2026 年记忆评估的黄金三角。BEAM 的 10M token 规模是生产级 Agent 记忆的真实压力测试。
| Benchmark | 权威度 | 发布方 | 规模 | 核心特征 | 大厂采用 |
|---|---|---|---|---|---|
| LoCoMo | ⭐⭐⭐⭐ | Snap Research | ~9K tokens, 35 sessions | 多会话对话记忆,单跳/多跳/时序/开放域召回 | Zep |
| LongMemEval | ⭐⭐⭐⭐ | 多机构 | 115K–1.5M tokens | 五维记忆:提取、多会话推理、知识更新、时序、弃权 | OpenAI Anthropic |
| BEAM | ⭐⭐⭐⭐ | 多机构 | 1M / 10M tokens | 十维记忆能力,生产级上下文规模,不能仅靠扩大上下文窗口解决 | OpenAI Anthropic Google |
| MemoryBank | ⭐⭐ | 多机构 | ~5K tokens | 300 会话,194 探测问题 | OpenAI |
AgentHarm 是 2026 年 Agent 安全的事实标准,被所有前沿实验室模型卡引用。它填补了"单轮安全"与"多步 Agent 有害行为"之间的评估空白。
| Benchmark | 权威度 | 发布方 | 任务数 | 核心特征 | 大厂采用 |
|---|---|---|---|---|---|
| AgentHarm | ⭐⭐⭐⭐⭐ | UK AISI + Gray Swan | 110 (440 增强) | 多步有害任务,11 类危害,测试越狱后 Agent 能力保持 | Anthropic OpenAI Google DeepMind |
| HarmBench | ⭐⭐⭐⭐ | Center for AI Safety | 510 | 对抗性有害请求,7 类危害 | OpenAI Anthropic Google |
| AgentDojo | ⭐⭐⭐ | 多机构 | 97 任务 / 629 安全用例 | 动态环境评估提示注入与工具安全 | OpenAI Anthropic |
| CyberSecEval | ⭐⭐⭐ | Meta | 多维度 | 网络安全评估套件,覆盖代码安全与漏洞利用 | |
| GT-HarmBench | ⭐⭐ | 多机构 | 1,535 | 博弈论视角多 Agent 安全,囚徒困境/猎鹿博弈 | OpenAI |
| MCPTox | ⭐⭐ | 多机构 | 多案例 | MCP 服务器工具投毒攻击 | OpenAI Anthropic |
多 Agent 评估仍处于早期,缺乏统一基准。AgentBoard 和 REALM-Bench 是目前较系统的评估框架,Cemri et al. 提供了全面的失败模式分类学。
| Benchmark / 框架 | 权威度 | 发布方 | 核心特征 | 大厂采用 |
|---|---|---|---|---|
| AgentBoard | ⭐⭐⭐ | 多机构 | 多轮 LLM Agent 分析评估板,细粒度诊断 | OpenAI Google |
| REALM-Bench | ⭐⭐⭐ | 多机构 | 真实世界规划基准,面向 LLM 与多 Agent 系统 | OpenAI |
| AutoGen | ⭐⭐⭐ | Microsoft | 可配置多 Agent 对话框架 | Microsoft |
| MetaGPT | ⭐⭐⭐ | 多机构 | 结构化工件替代对话,真实测试执行 | OpenAI Google |
| Cemri et al. (2025) | ⭐⭐⭐ | UC Berkeley | 14 种多 Agent 系统失败模式,1,600 人工标注轨迹 | OpenAI Anthropic |
网络安全 Agent 评估是 2025–2026 快速增长的方向,从 CTF 挑战扩展到真实 CVE 利用和零日漏洞响应。
| Benchmark | 权威度 | 发布方 | 核心特征 | 大厂采用 |
|---|---|---|---|---|
| NYU CTF Bench | ⭐⭐⭐ | NYU | 可扩展开源 CTF 评估 | OpenAI |
| CVE-Bench | ⭐⭐⭐ | 多机构 | 真实 CVE 漏洞利用评估 | OpenAI Google |
| CAIBench | ⭐⭐ | 多机构 | AI 网络安全 Agent 综合元基准 | OpenAI |
| HackSynth | ⭐⭐ | 多机构 | 自主渗透测试评估框架 | OpenAI |
| PentestGPT | ⭐⭐ | 多机构 | LLM 赋能自动渗透测试 | OpenAI |
TimeSeek 和 WC2026-Agents 开创了实时、无污染的 Agent 预测评估范式,强调校准、决策质量与自我认知。FINSEARCHCOMP 是字节自研的金融数据搜索基准。
| Benchmark | 权威度 | 发布方 | 核心特征 | 大厂采用 |
|---|---|---|---|---|
| TimeSeek | ⭐⭐ | 多机构 | 150 个 CFTC 监管 Kalshi 二元市场,5 个生命周期检查点 | OpenAI |
| FINSEARCHCOMP | ⭐⭐ | 字节跳动 Seed | 635 问题,金融数据搜索,需编排 SQL/API/搜索 | 字节 |
| WC2026-Agents | ⭐⭐ | 多机构 | 2026 世界杯 104 场比赛,无污染真实未来事件 | OpenAI Anthropic |
| MLGym | ⭐⭐⭐ | 多机构 | 13 个开放式 AI 研究任务,博弈论/数据科学/CV/NLP/RL | OpenAI |
PaperBench 是 OpenAI 推出的"AI 研究 Agent"旗舰基准,当前 SOTA 约 21%,人类基线约 41.4%。EdgeBench 是字节自研的长期学习基准,ReportBench 评估深度研究 Agent 的引用质量。
| Benchmark | 权威度 | 发布方 | 核心特征 | 大厂采用 |
|---|---|---|---|---|
| PaperBench | ⭐⭐⭐⭐ | OpenAI | 复现 20 篇 ICML 2024 论文,8,316 个可评分原子任务 | OpenAI |
| EdgeBench | ⭐⭐⭐⭐ | 字节跳动 Seed | 134 真实任务,12–72 小时长期学习,log-sigmoid 缩放律 | 字节 |
| ReportBench | ⭐⭐⭐ | 字节跳动 BandAI | 学术综述任务,评估引用质量与陈述忠实度 | 字节 |
| MLGym | ⭐⭐⭐ | 多机构 | 13 个开放式 AI 研究任务,标准化框架 | OpenAI |
| MLAgentBench | ⭐⭐ | 多机构 | 13 个 ML 实验任务,评估效果与效率 | OpenAI |
中国大厂已从"采用国际基准"演进为"自研基准 + 基础设施"的双轮驱动模式,在代码、语音、电商、长期学习等维度形成差异化优势。
| 大厂 | 核心自研基准 | 基础设施特征 | 代表成果 |
|---|---|---|---|
| 字节跳动 | EdgeBench、ReportBench、FINSEARCHCOMP、EcomBench | Seed Edge 平台(12–72h 长期学习调度)、BandAI 深度研究平台(引用验证)、金融数据网关 | EdgeBench: Claude Opus 4.8 领先 51.3% |
| 阿里巴巴 | SWE-Universe、QwenClawBench、QwenWebBench | 百万级沙盒集群(K8s 动态调度 + 镜像预热)、Schema 注册中心、Claw Agent 工具网关 | Qwen3-Max-Thinking SWE-Bench Verified 75.3% |
| 腾讯 | C3-Bench (ICLR 2026)、ArtifactsBench | 混元 Hy3 评估平台、工具依赖图引擎、浏览器实例池、Office 插件生态 | Hy3 SWE-bench Verified 78.0;WorkBuddy 任务成功率 90% |
| 美团 | VoiceAgentEval (xbench) | xbench 语音评估平台、150 用户人设模拟器、实时成本监控 | 外呼 Agent 拟人度评估体系 |
| 京东 | 商家智能助手 Multi-Agents (内部)、EcomBench | ReAct 全链路监控、人机闭环系统、电商垂域数据管道 | 内部 ReAct 监控体系 |
| 华为 | 盘古 DeepDiver、WebPuzzle、C-simpleQA、FRAMES-zh | 搜索 Agent 检索增强流水线、昇腾芯片推理优化 | DeepDiver-Pangu-7B 媲美 671B DeepSeek-R1 |
| 百度 | 文心助手任务 Agent (内部)、MMLU/C-Eval | 文心大模型评估平台、多模态 Agent 流水线 | 文心助手登顶国际 Agent 榜单 |
| Moonshot | SWE-bench、τ²-bench、Agent Swarm | 多 Agent 编排平台、长上下文优化 | 国内第一梯队 |
| 智谱 (GLM) | BFCL、SWE-bench、C3-Bench | GLM 评估平台、工具使用优化 | GLM-5.2 多维度评估 |
| DeepSeek | SWE-bench、LiveCodeBench | 高效推理基础设施、MoE 架构优化 | DeepSeek-R1 系列 |
| Benchmark 暴露的问题 | 基础设施架构诉求 | 关键技术方案 | 量化目标 |
|---|---|---|---|
| 环境配置漂移(SWE-bench) | 不可变沙盒 + 快照恢复 | Docker/Pod 独立调度 + VM 快照 + 分层缓存 | 沙盒启动 < 5s |
| 长时程任务失败(EdgeBench) | Checkpoint/Restore + 弹性调度 | K8s Jobs + Checkpoint 卷 + 自动重试 | 恢复时间 < 30s |
| 多轮上下文爆炸(BrowseComp) | 分层 KV Cache + 外部记忆检索 | H2O/StreamingLLM + Milvus/RocksDB | 检索延迟 < 100ms |
| 工具调用并发雪崩(BFCL) | API 网关限流 + 依赖图执行引擎 | 令牌桶限流 + 拓扑排序执行 | 并发限制 10 QPS/Agent |
| 多 Agent 消息风暴(AutoGen) | Pub/Sub 消息总线 + 分布式追踪 | Kafka/Redis Streams + OpenTelemetry | 消息延迟 < 50ms |
| 视觉定位延迟高(Visual WebArena) | 浏览器实例池 + 多模态推理加速 | Playwright 常驻 + 视觉 Token 压缩 | 截图→动作 < 500ms |
| 有害行为多步渗透(AgentHarm) | 轨迹级审计 + 零信任沙盒 | 全链路日志 + 气隙环境 + 自动销毁 | 审计覆盖率 100% |
| 评估成本不透明(HAL) | Token/API/计算成本实时核算 | 成本归因系统 + 实时仪表盘 | 成本精度 < 1% |
| 数据污染与作弊(SWE-bench Pro) | 气隙环境 + 行为审计 + 人工验证 | 断网集群 + Syscall 监控 + 众包验证 | 污染检测率 > 95% |
| 语音实时交互(VoiceAgentEval) | 流式 ASR-LLM-TTS 流水线 | WebRTC + 流式推理 + 中断处理 | 端到端延迟 < 2s |
EdgeBench 的 12–72 小时长期学习标志着 Agent 评估从"单次推理"向"持续学习"演进。基础设施必须支持有状态、可中断、可恢复的长时程任务调度,而非无状态的 API 调用。
AgentHarm 证明:单轮拒绝率 ≠ 多步安全。基础设施必须提供轨迹级审计、动态红队、零信任沙盒,而非仅依赖输入过滤。
C3-Bench (ICLR 2026)、SWE-Universe (百万级环境)、EdgeBench (长期学习) 等由中国团队主导的基准正在形成与 SWE-bench、GAIA 并行的评估体系。基础设施需支持多基准并行的异构评估流水线。
UC Berkeley 2026 年研究显示,SWE-bench、WebArena、Terminal-Bench 等均可被利用达到近 100% 分数而不解决任何任务。基础设施必须内置行为审计、气隙环境、人工验证三层防御。
BEAM 的 10M token 证明:记忆不能仅靠扩大上下文窗口解决。基础设施必须提供外部记忆服务(Memory-as-a-Service),支持结构化存储、向量检索、增量索引与一致性保障。