AI Agent 评估 Benchmark 全景洞察

从评估标准反推基础设施架构诉求 —— 覆盖 OpenAI、Anthropic、Google、Meta、字节、阿里、腾讯、美团、京东等业界实践

📅 2024–2026 全景梳理 📊 80+ Benchmark 🏗️ 基础设施视角 🌏 中外大厂实践
⭐⭐⭐⭐⭐ 工业界事实标准
⭐⭐⭐⭐ 学术界权威(顶会)
⭐⭐⭐ 社区流行
⭐⭐ 前沿探索
垂直/内部基准

一、通用能力 / 综合助手类

Foundation

评估 Agent 的广度与通用性,强调多步推理、工具组合与真实世界信息获取。GAIA 因"人类级难度"成为最常被引用的通用助手基准。

Benchmark 权威度 发布方 任务数 核心特征 大厂采用
GAIA ⭐⭐⭐⭐⭐ Meta + Hugging Face 466 真实世界多步推理,需搜索/文件解析/代码;分 3 级难度,人类约 92% Meta Google Anthropic OpenAI 阿里 字节
AgentBench ⭐⭐⭐⭐ 清华/多机构 1,014+ 跨 8 环境(OS、DB、KG、游戏、具身等)评估通用 Agent 腾讯 百度 阿里
MINT ⭐⭐⭐ 多机构 多轮交互 多轮工具使用与语言反馈整合能力 OpenAI Anthropic
ARC-AGI-2 ⭐⭐⭐⭐ ARC Prize 1,000+120 流体智能测试,抽象推理与规则组合 OpenAI/o3

基础设施诉求

  • 多环境沙盒编排:AgentBench 跨 8 个异构环境(OS、DB、游戏等)要求基础设施支持异构计算资源的统一调度与隔离。
  • 真实世界数据管道:GAIA 依赖实时搜索与文件解析,需构建可靠的搜索 API 聚合层与文档解析服务(PDF/Excel/图片 OCR)。
  • 人类基线复现环境:人类 92% 的基线要求评估环境具备完整的交互式前端,支持人工标注与复现。

二、软件工程 / 代码 Agent 类

Software Engineering

SWE-bench 系列是 2026 年最具影响力的代码 Agent 基准,直接测试 Agent 在真实代码库中的端到端 Bug 修复能力。中国大厂在此领域已形成自研基准体系。

Benchmark 权威度 发布方 任务数 核心特征 大厂采用
SWE-bench ⭐⭐⭐⭐⭐ OpenAI + 多机构 2,294 真实 GitHub Issue,端到端 Bug 修复,需理解代码库、定位 Bug、生成 Patch 并通过测试 OpenAI Codex Claude Code Gemini CLI 阿里 Qwen 腾讯 Hy3 字节 Moonshot
SWE-bench Verified ⭐⭐⭐⭐⭐ OpenAI 500 人工验证子集,排除无解/模糊任务,当前最权威代码 Agent 排行榜 OpenAI Anthropic 阿里
SWE-bench Pro ⭐⭐⭐⭐ 多机构 731 多语言、标准化脚手架,减少数据污染风险 OpenAI Anthropic
SWE-Universe ⭐⭐⭐⭐⭐ 阿里 Qwen 团队 807,693 百万级真实 SWE 可验证环境,支持 Agent 中训与 RL;Qwen3-Max-Thinking 达 75.3% 阿里
Terminal-Bench ⭐⭐⭐⭐ 多机构 多任务 真实 Shell 命令行端到端任务,评估命令行 Agent 阿里 Qwen 3.6 腾讯 Hy3
LiveCodeBench ⭐⭐⭐⭐ 多机构 动态更新 竞赛编程,防训练数据污染 阿里 Qwen DeepSeek
Phoenix-bench ⭐⭐⭐ 多机构 511 硬件工程 (Verilog/SystemVerilog),评估 EDA 验证下的代码 Agent Claude Code Codex Gemini CLI
QwenClawBench 阿里巴巴 内部 真实用户分布的 Claw Agent 工具使用基准,计划开源 阿里内部
QwenWebBench 阿里巴巴 内部 前端代码生成与 Web 交互,Elo 评分体系 阿里内部
核心洞察:代码 Agent 的本质是"不可信代码的安全执行"。SWE-bench 的 2,294 个真实 GitHub Issue 要求基础设施从"批处理推理"演进为"交互式、有状态、可回滚的计算单元调度"。阿里 SWE-Universe 的百万级环境验证了:环境即数据(Environment-as-Data)——沙盒本身需版本化、可快照、可批量克隆。

基础设施诉求

  • 容器化沙盒编排:每个 Agent 任务需独立 Docker/Pod,预装精确依赖快照;pytest 结果不可污染宿主机。
  • 大规模并行沙盒集群:SWE-Universe 的 80 万+环境要求 K8s 动态调度 + 镜像预热 + 环境快照化(VM 快照恢复替代从头构建)。
  • RL 训练闭环:Agent 动作 → 环境执行 → 奖励回传需低延迟 (<5s),要求推理与执行环境的高速互联。
  • 不可变文件系统沙盒:Terminal-Bench 的命令执行副作用(文件污染、网络请求、权限提升)要求每次任务从只读基线克隆。
  • 审计日志全量采集:每个 cdpip installrm -rf 需可追溯,用于失败归因与安全审计。
  • 许可证浮动服务器:Phoenix-bench 的 EDA 工具链(FlexLM 等)需授权池化调度。

三、Web / 浏览器 Agent 类

Web & Browser

WebArena 是浏览器 Agent 的事实标准,区分 DOM-based Agent 与 Visual Agent。2026 年 OpenAI Operator 在该基准上约 61%,Anthropic Computer Use 约 77.5%。

Benchmark 权威度 发布方 任务数 核心特征 大厂采用
WebArena ⭐⭐⭐⭐⭐ 多机构 812 自托管真实网站,多步目标,长时程规划,稀疏奖励 OpenAI Operator Anthropic Google 字节
Visual WebArena ⭐⭐⭐⭐ 多机构 812 WebArena 视觉版本,需基于截图进行视觉定位与操作 OpenAI Anthropic
Mind2Web ⭐⭐⭐⭐ 多机构 2,350 137 个真实网站上的任务,覆盖复杂网页交互 OpenAI Google Anthropic
BrowseComp ⭐⭐⭐⭐ OpenAI 多任务 复杂信息检索与浏览能力 OpenAI 腾讯 Hy3
WebVoyager ⭐⭐⭐ 多机构 数百 大规模真实网站动态内容评估,强调自然交互与鲁棒性 Skyvern 等

基础设施诉求

  • 浏览器实例池化:Playwright/Puppeteer 实例常驻内存,避免冷启动;每个 Agent 独占隔离浏览器进程,支持 DOM 访问、截图、下载、弹窗处理,且能秒级重置。
  • 浏览器状态持久化:Cookie/LocalStorage 快照管理;网站镜像固化(Wayback Machine 或静态镜像替代真实站点,防止库存变化、UI 改版导致评估漂移)。
  • DOM 与视觉双通道编码:需同时维护 HTML 解析流和截图流,Visual WebArena 要求多模态编码加速(视觉 Token 压缩,如 Qwen2-VL 的图像切分策略)。
  • GPU 显存管理:高分辨率截图的 KV Cache 膨胀要求显存精细化调度。
  • 长上下文 KV Cache 分层存储:多步搜索导致上下文长度爆炸(>100K tokens),热数据在 HBM,冷数据 offload 到 SSD。

四、计算机使用 / 桌面 OS Agent 类

Computer Use

OSWorld 是最难、最真实的 Agent 基准之一,测试跨应用、低级别鼠标键盘控制。人类基线约 72%,2026 年 SOTA 约 82% (Coasty),OpenAI Operator 约 38%。

Benchmark 权威度 发布方 任务数 核心特征 大厂采用
OSWorld ⭐⭐⭐⭐⭐ HKU + Salesforce + CMU 369 真实 Ubuntu/Windows/macOS,跨应用工作流(浏览器、Office、终端、图像编辑) Anthropic Computer Use OpenAI Operator Google Mariner 字节
OSWorld-Verified ⭐⭐⭐⭐ 官方 更严格子集 更严格评估标准,防止通过配置泄露等作弊 Anthropic OpenAI
Windows Agent Arena ⭐⭐⭐ Microsoft 多任务 Windows 桌面 Agent 评估 Microsoft
核心洞察:桌面 Agent 的基础设施是"云桌面的 Agent 化改造"。OSWorld 的高难度背后是桌面虚拟化 + 视觉感知 + 精确控制的三重 infra 挑战。字节、阿里在内部评估中均需维护数百个云桌面实例池。

基础设施诉求

  • VNC/RDP 低延迟流:<100ms 的屏幕传输 + 鼠标键盘注入;GUI 元素检测服务(常驻 OCR + 图标识别模型)。
  • 跨应用状态同步:剪贴板、文件系统、窗口管理器的全局状态捕获与重置。
  • 零信任沙盒:OSWorld-Verified 要求隐藏文件、环境变量、网络接口完全隔离;行为审计需达到 syscall 级监控。
  • Windows UI Automation (UIA) 桥接:Windows Agent Arena 需统一 UWP、Win32、WPF 混合生态的元素树访问。
  • Azure Virtual Desktop 集成:云桌面池化调度,支持秒级重置与快照恢复。

五、工具使用 / 函数调用类

Tool Use

BFCL 是函数调用的事实标准,τ-bench 是工具+对话+策略合规的生产级基准。两者结合可全面评估 Agent 的工具使用能力。C3-Bench 是腾讯混元在 ICLR 2026 发表的多任务鲁棒性基准。

Benchmark 权威度 发布方 任务数 核心特征 大厂采用
BFCL ⭐⭐⭐⭐⭐ UC Berkeley 2,000+ 函数选择、参数填充、并行调用、多轮调用、跨语言 (Python/Java/JS/REST) OpenAI Anthropic Google 阿里 腾讯 智谱
τ-bench ⭐⭐⭐⭐ Sierra AI 165 多轮客服对话,需遵守领域策略(零售/航空),状态ful 工具使用 Google 阿里 Moonshot
τ²-bench / τ³-bench ⭐⭐⭐ Sierra AI 50,114+ τ-bench 扩展版本,更多领域与任务 Google Moonshot
ToolBench ⭐⭐⭐ 多机构 16,464 APIs 大规模真实 API 调用,多步交互,3 级难度 OpenAI Anthropic
C3-Bench ⭐⭐⭐⭐ 腾讯混元 1,024 三项挑战:复杂工具关系、隐藏信息、动态决策路径;混元 A13B 官方报告,SuperClue Agent 国内第一 腾讯混元
T-Eval ⭐⭐⭐ 多机构 多维度 六维度细粒度工具使用诊断(选择、参数、排序、对话等) 阿里 OpenAI

基础设施诉求

  • Schema 注册中心:函数元数据版本化管理,BFCL 的跨语言支持要求统一的 Schema 描述与演化机制。
  • 并发调用限流:防止 Agent 同时触发 10+ API 导致服务雪崩;需令牌桶/漏桶算法的网关级限流。
  • 依赖图执行引擎:工具间有依赖关系时需拓扑排序执行(C3-Bench 的复杂工具关系直接测试此能力)。
  • 会话状态机:τ-bench 的状态ful 工具调用要求副作用持久化到数据库,支持补偿事务与回滚机制。
  • 领域策略引擎:零售/航空的策略规则需外置化(类似 OPA/Open Policy Agent),而非硬编码在 Prompt 中。
  • 工具发现与治理:C3-Bench 的隐藏信息挑战要求 Agent 只能看到权限范围内的工具;工具描述需向量化,支持语义检索替代精确匹配。
  • Mock 工具服务:评估时需模拟下游 API 响应,要求基础设施支持 HTTP/TCP 级别的流量拦截与 Mock。

六、对话 / 客服 / 工作流 Agent 类

Conversation & Workflow

τ-bench 是客服 Agent 的首选基准,WorkArena 针对企业知识工作,VoiceAgentEval 是美团自研的语音外呼评估体系。

Benchmark 权威度 发布方 任务数 核心特征 大厂采用
τ-bench 系列 ⭐⭐⭐⭐ Sierra AI 见上 客服场景多轮对话+策略合规 Google 阿里 Moonshot
TravelPlanner ⭐⭐⭐ 多机构 1,225 旅行规划,长时程规划与约束满足 OpenAI Google
WorkArena ⭐⭐⭐ ServiceNow 33 ServiceNow 知识工作原子任务 Microsoft ServiceNow
VoiceAgentEval ⭐⭐ 美团 + xbench 150 人设 × 30 子场景 AI 外呼智能体评测,用户模拟器,拟人度评估 美团
EcomBench ⭐⭐ 多机构(含字节) 多任务 真实电商场景,动态更新,人机闭环 京东 字节

基础设施诉求

  • 用户模拟器服务:VoiceAgentEval 的 150 用户人设要求可编程的用户行为模拟器,支持情感、意图、打断等动态行为。
  • 流式语音流水线:ASR 流式输出 → LLM 流式生成 → TTS 流式合成,端到端延迟需 <2s。
  • 中断处理机制:用户插话时的上下文截断与快速响应,要求推理引擎支持取消(cancellation)与快速重入。
  • 人机闭环系统:EcomBench 的人机闭环要求 Agent 失败时秒级转人工,需无缝切换与上下文继承。
  • 实时成本监控:语音 Agent 的每分钟成本需实时可观测,支持 A/B 测试平台对比不同模型/策略。

七、记忆 / 长期上下文类

Long-Term Memory

LoCoMo + LongMemEval + BEAM 构成 2026 年记忆评估的黄金三角。BEAM 的 10M token 规模是生产级 Agent 记忆的真实压力测试。

Benchmark 权威度 发布方 规模 核心特征 大厂采用
LoCoMo ⭐⭐⭐⭐ Snap Research ~9K tokens, 35 sessions 多会话对话记忆,单跳/多跳/时序/开放域召回 Mem0 Zep
LongMemEval ⭐⭐⭐⭐ 多机构 115K–1.5M tokens 五维记忆:提取、多会话推理、知识更新、时序、弃权 OpenAI Anthropic
BEAM ⭐⭐⭐⭐ 多机构 1M / 10M tokens 十维记忆能力,生产级上下文规模,不能仅靠扩大上下文窗口解决 OpenAI Anthropic Google
MemoryBank ⭐⭐ 多机构 ~5K tokens 300 会话,194 探测问题 OpenAI
核心洞察:记忆不是"更大的上下文窗口",而是"外部化的知识库 + 智能检索"。BEAM 的 10M token 挑战证明:infra 必须提供记忆即服务(Memory-as-a-Service)——支持时间戳、重要性、关联关系的结构化记忆存储,而非简单字符串拼接。

基础设施诉求

  • 向量检索 + 重排序:记忆需 Embedding 化并建立索引(Milvus/Pinecone/Weaviate);会话摘要压缩要求分层摘要(短期/长期/语义)。
  • 记忆一致性保障:多会话间的事实冲突检测与合并,要求记忆存储支持版本控制与冲突解决策略。
  • KV Cache 压缩与驱逐:LongMemEval 的 1.5M token 要求 H2O、StreamingLLM 等算法工程化;分层 Attention(近期全量,远期摘要)。
  • 稀疏注意力架构:BEAM 的 10M token 要求 Ring Attention、MoE 稀疏化;外部记忆数据库(RocksDB/Milvus)替代全量上下文。
  • 增量索引:新信息实时写入向量索引,要求索引更新延迟 <100ms,不影响在线服务。

八、安全 / 对齐 / 红队类

Safety & Alignment

AgentHarm 是 2026 年 Agent 安全的事实标准,被所有前沿实验室模型卡引用。它填补了"单轮安全"与"多步 Agent 有害行为"之间的评估空白。

Benchmark 权威度 发布方 任务数 核心特征 大厂采用
AgentHarm ⭐⭐⭐⭐⭐ UK AISI + Gray Swan 110 (440 增强) 多步有害任务,11 类危害,测试越狱后 Agent 能力保持 Anthropic OpenAI Google DeepMind
HarmBench ⭐⭐⭐⭐ Center for AI Safety 510 对抗性有害请求,7 类危害 OpenAI Anthropic Google
AgentDojo ⭐⭐⭐ 多机构 97 任务 / 629 安全用例 动态环境评估提示注入与工具安全 OpenAI Anthropic
CyberSecEval ⭐⭐⭐ Meta 多维度 网络安全评估套件,覆盖代码安全与漏洞利用 Meta
GT-HarmBench ⭐⭐ 多机构 1,535 博弈论视角多 Agent 安全,囚徒困境/猎鹿博弈 OpenAI Meta
MCPTox ⭐⭐ 多机构 多案例 MCP 服务器工具投毒攻击 OpenAI Anthropic

基础设施诉求

  • 多步轨迹审计:不仅看最终输出,需检查中间步骤;要求全链路日志采集与轨迹回放能力。
  • 动态红队生成:用红队模型自动生成变体攻击,要求对抗性样本生成服务与自动化评估流水线。
  • 隔离执行环境:有害 Agent 必须在完全隔离的沙盒运行(无网络、无持久存储),评估后自动销毁。
  • 工具输出消毒:AgentDojo 的提示注入通过工具返回通道污染 Agent,要求所有工具返回值经内容安全扫描(关键词/Embedding 分类器)。
  • 权限最小化:Agent 默认无网络/文件系统权限,需显式授权;MCPTox 要求 MCP 供应链安全(工具签名验证、沙箱执行、行为基线监控)。
  • 气隙环境(Air-gapped):安全评估需在完全断网的评估集群进行,防止评估过程本身造成危害。

九、多智能体协作类

Multi-Agent

多 Agent 评估仍处于早期,缺乏统一基准。AgentBoard 和 REALM-Bench 是目前较系统的评估框架,Cemri et al. 提供了全面的失败模式分类学。

Benchmark / 框架 权威度 发布方 核心特征 大厂采用
AgentBoard ⭐⭐⭐ 多机构 多轮 LLM Agent 分析评估板,细粒度诊断 OpenAI Google
REALM-Bench ⭐⭐⭐ 多机构 真实世界规划基准,面向 LLM 与多 Agent 系统 OpenAI Meta
AutoGen ⭐⭐⭐ Microsoft 可配置多 Agent 对话框架 Microsoft
MetaGPT ⭐⭐⭐ 多机构 结构化工件替代对话,真实测试执行 OpenAI Google
Cemri et al. (2025) ⭐⭐⭐ UC Berkeley 14 种多 Agent 系统失败模式,1,600 人工标注轨迹 OpenAI Anthropic

基础设施诉求

  • 消息总线(Message Bus):AutoGen 的 N 个 Agent 两两通信导致 O(N²) 流量,需 Pub/Sub 架构替代点对点(如 Redis Streams/Kafka)。
  • 对话窗口管理:每个 Agent 的上下文窗口独立管理,需智能裁剪与摘要服务,防止上下文爆炸。
  • 状态一致性:共享工件的版本冲突(如两个 Agent 同时编辑同一文件)要求分布式锁或 CRDT 数据结构。
  • 分布式追踪(Distributed Tracing):Cemri et al. 的失败归因要求每个 Agent 动作携带 Trace ID,支持跨 Agent 的调用链分析(OpenTelemetry)。
  • 结构化数据流:MetaGPT 的工件事务要求 Protocol Buffers/Avro 替代 JSON,降低序列化开销。
  • 工作流编排引擎:DAG 执行依赖管理,支持条件分支、循环、超时与重试(如 Temporal/Cadence)。

十、网络安全 / CTF / 渗透测试类

Cybersecurity

网络安全 Agent 评估是 2025–2026 快速增长的方向,从 CTF 挑战扩展到真实 CVE 利用和零日漏洞响应。

Benchmark 权威度 发布方 核心特征 大厂采用
NYU CTF Bench ⭐⭐⭐ NYU 可扩展开源 CTF 评估 OpenAI
CVE-Bench ⭐⭐⭐ 多机构 真实 CVE 漏洞利用评估 OpenAI Google
CAIBench ⭐⭐ 多机构 AI 网络安全 Agent 综合元基准 OpenAI
HackSynth ⭐⭐ 多机构 自主渗透测试评估框架 OpenAI
PentestGPT ⭐⭐ 多机构 LLM 赋能自动渗透测试 OpenAI

基础设施诉求

  • 隔离靶场网络:CTF/CVE 评估需在完全隔离的 VLAN 中进行,防止 Agent 逃逸或横向移动。
  • 漏洞镜像库:需维护含已知 CVE 的 Docker 镜像库,支持快速部署与快照恢复。
  • 网络流量镜像:所有 Agent 产生的网络流量需完整 PCAP 捕获,用于攻击链分析。
  • 蜜罐集成:评估环境中需部署蜜罐检测 Agent 的异常行为与逃逸尝试。

十一、预测 / 决策 / 金融类

Prediction & Finance

TimeSeek 和 WC2026-Agents 开创了实时、无污染的 Agent 预测评估范式,强调校准、决策质量与自我认知。FINSEARCHCOMP 是字节自研的金融数据搜索基准。

Benchmark 权威度 发布方 核心特征 大厂采用
TimeSeek ⭐⭐ 多机构 150 个 CFTC 监管 Kalshi 二元市场,5 个生命周期检查点 OpenAI
FINSEARCHCOMP ⭐⭐ 字节跳动 Seed 635 问题,金融数据搜索,需编排 SQL/API/搜索 字节
WC2026-Agents ⭐⭐ 多机构 2026 世界杯 104 场比赛,无污染真实未来事件 OpenAI Anthropic
MLGym ⭐⭐⭐ 多机构 13 个开放式 AI 研究任务,博弈论/数据科学/CV/NLP/RL OpenAI Meta

基础设施诉求

  • 实时数据管道:TimeSeek 要求接入 Kalshi 等预测市场 API,实时获取赔率与结果;需低延迟数据同步(<1s)。
  • 金融数据网关:FINSEARCHCOMP 需编排 SQL 查询、API 调用与网页搜索,要求统一的金融数据抽象层(支持 Bloomberg、Wind、内部数据库)。
  • 无污染评估隔离:WC2026-Agents 要求评估期间 Agent 无法访问未来结果,需时间锁定的数据访问控制。
  • 校准与决策质量监控:Brier Score、对数损失等概率校准指标需实时计算与可视化。

十二、科学研究 / 自主实验 / 深度研究类

Scientific Research

PaperBench 是 OpenAI 推出的"AI 研究 Agent"旗舰基准,当前 SOTA 约 21%,人类基线约 41.4%。EdgeBench 是字节自研的长期学习基准,ReportBench 评估深度研究 Agent 的引用质量。

Benchmark 权威度 发布方 核心特征 大厂采用
PaperBench ⭐⭐⭐⭐ OpenAI 复现 20 篇 ICML 2024 论文,8,316 个可评分原子任务 OpenAI
EdgeBench ⭐⭐⭐⭐ 字节跳动 Seed 134 真实任务,12–72 小时长期学习,log-sigmoid 缩放律 字节
ReportBench ⭐⭐⭐ 字节跳动 BandAI 学术综述任务,评估引用质量与陈述忠实度 字节
MLGym ⭐⭐⭐ 多机构 13 个开放式 AI 研究任务,标准化框架 OpenAI Meta
MLAgentBench ⭐⭐ 多机构 13 个 ML 实验任务,评估效果与效率 OpenAI
核心洞察:研究 Agent 的 infra 是"AI 驱动的 CI/CD 流水线"。EdgeBench 的 12–72 小时长期学习要求支持小时级到天数级的任务执行、自动重试、结果持久化、资源弹性伸缩——本质上是把 ML 实验管理(MLflow)扩展到 Agent 工作流。

基础设施诉求

  • 长时程任务调度:支持 checkpoint/restore 的批处理系统(如 Kubernetes Jobs + Checkpoint 卷);单任务耗时数小时至数天,GPU 集群利用率波动大,需弹性资源伸缩。
  • 实验结果持久化:中间产物(模型权重、日志、TensorBoard)需对象存储(S3/OSS)与元数据索引。
  • 内存泄漏监控:EdgeBench 的长时间运行导致内存泄漏、状态膨胀,需 Agent 进程的 RSS/VMS 实时监控与自动重启。
  • 引用验证服务:ReportBench 要求与 Google Scholar/Semantic Scholar API 集成,验证引用真实性;网页快照存档防止链接失效。
  • 日志压缩与归档:72 小时运行产生 GB 级日志,需实时压缩与结构化存储(如 Loki/Elasticsearch)。

十三、中国大厂 Agent 评估基础设施实践映射

China Practice

中国大厂已从"采用国际基准"演进为"自研基准 + 基础设施"的双轮驱动模式,在代码、语音、电商、长期学习等维度形成差异化优势。

大厂 核心自研基准 基础设施特征 代表成果
字节跳动 EdgeBench、ReportBench、FINSEARCHCOMP、EcomBench Seed Edge 平台(12–72h 长期学习调度)、BandAI 深度研究平台(引用验证)、金融数据网关 EdgeBench: Claude Opus 4.8 领先 51.3%
阿里巴巴 SWE-Universe、QwenClawBench、QwenWebBench 百万级沙盒集群(K8s 动态调度 + 镜像预热)、Schema 注册中心、Claw Agent 工具网关 Qwen3-Max-Thinking SWE-Bench Verified 75.3%
腾讯 C3-Bench (ICLR 2026)、ArtifactsBench 混元 Hy3 评估平台、工具依赖图引擎、浏览器实例池、Office 插件生态 Hy3 SWE-bench Verified 78.0;WorkBuddy 任务成功率 90%
美团 VoiceAgentEval (xbench) xbench 语音评估平台、150 用户人设模拟器、实时成本监控 外呼 Agent 拟人度评估体系
京东 商家智能助手 Multi-Agents (内部)、EcomBench ReAct 全链路监控、人机闭环系统、电商垂域数据管道 内部 ReAct 监控体系
华为 盘古 DeepDiver、WebPuzzle、C-simpleQA、FRAMES-zh 搜索 Agent 检索增强流水线、昇腾芯片推理优化 DeepDiver-Pangu-7B 媲美 671B DeepSeek-R1
百度 文心助手任务 Agent (内部)、MMLU/C-Eval 文心大模型评估平台、多模态 Agent 流水线 文心助手登顶国际 Agent 榜单
Moonshot SWE-bench、τ²-bench、Agent Swarm 多 Agent 编排平台、长上下文优化 国内第一梯队
智谱 (GLM) BFCL、SWE-bench、C3-Bench GLM 评估平台、工具使用优化 GLM-5.2 多维度评估
DeepSeek SWE-bench、LiveCodeBench 高效推理基础设施、MoE 架构优化 DeepSeek-R1 系列

十四、Benchmark → 基础设施需求推导总表

Infra Mapping
Benchmark 暴露的问题 基础设施架构诉求 关键技术方案 量化目标
环境配置漂移(SWE-bench) 不可变沙盒 + 快照恢复 Docker/Pod 独立调度 + VM 快照 + 分层缓存 沙盒启动 < 5s
长时程任务失败(EdgeBench) Checkpoint/Restore + 弹性调度 K8s Jobs + Checkpoint 卷 + 自动重试 恢复时间 < 30s
多轮上下文爆炸(BrowseComp) 分层 KV Cache + 外部记忆检索 H2O/StreamingLLM + Milvus/RocksDB 检索延迟 < 100ms
工具调用并发雪崩(BFCL) API 网关限流 + 依赖图执行引擎 令牌桶限流 + 拓扑排序执行 并发限制 10 QPS/Agent
多 Agent 消息风暴(AutoGen) Pub/Sub 消息总线 + 分布式追踪 Kafka/Redis Streams + OpenTelemetry 消息延迟 < 50ms
视觉定位延迟高(Visual WebArena) 浏览器实例池 + 多模态推理加速 Playwright 常驻 + 视觉 Token 压缩 截图→动作 < 500ms
有害行为多步渗透(AgentHarm) 轨迹级审计 + 零信任沙盒 全链路日志 + 气隙环境 + 自动销毁 审计覆盖率 100%
评估成本不透明(HAL) Token/API/计算成本实时核算 成本归因系统 + 实时仪表盘 成本精度 < 1%
数据污染与作弊(SWE-bench Pro) 气隙环境 + 行为审计 + 人工验证 断网集群 + Syscall 监控 + 众包验证 污染检测率 > 95%
语音实时交互(VoiceAgentEval) 流式 ASR-LLM-TTS 流水线 WebRTC + 流式推理 + 中断处理 端到端延迟 < 2s

参考文献

  1. Mialon, G., Fourrier, C., Swift, C., Wolf, T., LeCun, Y., & Scialom, T. (2024). GAIA: A Benchmark for General AI Assistants. ICLR 2024. arXiv:2311.12983
  2. Liu, X., Yu, H., Zhang, H., Xu, Y., Lei, X., Lai, H., Gu, Y., Ding, H., Men, K., Yang, K., Zhang, S., Deng, X., Zeng, A., Du, Z., Zhang, C., Shen, S., Zhang, T., Su, Y., Sun, H., Huang, L., Dong, Y., & Tang, J. (2024). AgentBench: Evaluating LLMs as Agents. ICLR 2024. arXiv:2308.03688
  3. Jimenez, C., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O., & Narasimhan, K. (2024). SWE-bench: Can Language Models Resolve Real-World GitHub Issues? ICLR 2024. arXiv:2310.06770
  4. Chen, Y., et al. (2026). SWE-Universe: Scale Real-World Verifiable Environments to Millions. arXiv:2602.02361
  5. Merrill, W., et al. (2026). Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces. ICLR 2026. arXiv:2601.11868
  6. Zhou, S., Xu, Y., Dong, H., Zhang, C., Cheng, J., Li, B., Li, Y., & Li, Y. (2024). WebArena: A Realistic Web Environment for Building Autonomous Agents. arXiv:2307.13854
  7. Xie, T., Zhang, D., Chen, J., Li, X., Cheng, S., Zhan, X., Xu, S., Zhou, R., Cheng, Z., Yang, Y., & Luo, J. (2024). OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments. arXiv:2404.07972
  8. Patil, S., et al. (2025). BFCL: From Tool Use to Agentic Evaluation of Large Language Models. ICML 2025.
  9. Yao, S., et al. (2024). τ-Bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. arXiv:2406.12045
  10. Yu, X., et al. (2026). C³-Bench: The Things Real Disturbing LLM based Agent in Multi-Tasking. ICLR 2026. arXiv:2505.18746
  11. Maharana, A., et al. (2024). LoCoMo: Long Conversational Memory Benchmark for Multi-Session Dialogues. ACL 2024. arXiv:2402.17753
  12. Wu, C., et al. (2025). LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory. ICLR 2025. arXiv:2410.10813
  13. Tavakoli, F., et al. (2025). Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs. arXiv:2510.27246
  14. Andriushchenko, M., et al. (2025). AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents. ICLR 2025. arXiv:2410.09024
  15. Mazeika, M., et al. (2024). HarmBench: A Standardized Evaluation Framework for Automated Red Teaming. arXiv:2402.04249
  16. Debenedetti, E., et al. (2024). AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents. NeurIPS 2024.
  17. Wu, Q., et al. (2023). AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv:2308.08155
  18. Hong, S., et al. (2023). MetaGPT: Meta Programming for Multi-Agent Collaborative Framework. arXiv:2308.00352
  19. Qian, C., et al. (2023). ChatDev: Communicative Agents for Software Development. arXiv:2307.07924
  20. Cemri, M., et al. (2025). Why Do Multi-Agent LLM Systems Fail? arXiv:2503.13657
  21. Starace, K., et al. (2025). PaperBench: Evaluating AI's Ability to Replicate AI Research. arXiv:2504.01848
  22. Zhu, J., et al. (2026). EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments. arXiv:2607.05155
  23. Li, Y., et al. (2025). ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks. arXiv:2508.15804
  24. Hu, Y., et al. (2025). FINSEARCHCOMP: The First Fully Publicly Available Benchmark for Financial Data Search. arXiv:2509.13160
  25. Xu, Y., et al. (2025). VoiceAgentEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Voice-Agent Evaluation. arXiv:2510.21244
  26. Min, Y., et al. (2025). EcomBench: Towards Holistic Evaluation of Foundation Agents in E-commerce. arXiv:2512.08868
  27. Deng, X., Gu, Y., Zheng, B., Chen, S., Stevens, S., Wang, B., Sun, H., & Su, Y. (2023). Mind2Web: Towards a Generalist Agent for the Web. arXiv:2306.06070
  28. Xie, Y., et al. (2024). TravelPlanner: A Benchmark for Real-World Planning with Language Agents. ICML 2024.
  29. Bonatti, R., et al. (2024). Windows Agent Arena. arXiv:2404.07972
  30. Qin, Y., Liang, S., Ye, Y., Zhu, K., Yan, L., Lu, Y., Lin, Y., Cong, X., Tang, X., Qian, B., Zhao, S., Hong, L., Tian, R., Xie, R., Zhou, J., Gerstein, M., Li, D., Liu, Z., & Sun, M. (2023). ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs. arXiv:2307.16789
  31. Zhong, W., et al. (2024). MemoryBank: Enhancing Large Language Models with Long-Term Memory. AAAI 2024.
  32. Chen, Z., et al. (2024). T-Eval: Evaluating the Tool Utilization Capability of Large Language Models. arXiv:2405.1214
  33. Wang, Y., et al. (2024). MINT: Evaluating LLMs in Multi-Turn Interaction with Tools. arXiv:2309.10691
  34. Meta AI. (2024). CyberSecEval: A Benchmark for Evaluating the Cybersecurity Risks of AI Models. Meta AI Research.
  35. Chollet, F., et al. (2025). ARC-AGI-2: A New Benchmark for Fluid Intelligence. ARC Prize Foundation.
  36. OpenAI. (2024). Introducing SWE-bench Verified. OpenAI Blog.
  37. OpenAI. (2025). BrowseComp: Measuring AI Browsing Capabilities. OpenAI Research.
  38. UK AISI. (2024). Inspect Evals: A Framework for AI Safety Evaluations. UK Department for Science, Innovation and Technology.
  39. Princeton NLP. (2025). Holistic Agent Leaderboard (HAL): Cross-Auditing Models, Scaffolds, and Benchmarks.