AI AGENT BENCHMARK LANDSCAPE · PAGE 1 / 2 · 2026-07-29

权威 Benchmark 版图:测能力的归学术与模型大厂,测系统的归标准机构,测可信度的归安全实验室

按测试目的分为十大方向,逐一给出「核心测什么 · 关键指标 · 发起方/使用方」。全部条目经 arXiv 与官方一手资料核实;已弃用基准如实标注,引用分数前请先核对状态。
01
编码与软件工程
目的:验证 Agent 能否修复真实代码库 issue / 完成终端任务
SWE-bench 家族 Princeton(ICLR 2024);Verified 由 OpenAI 制作 Verified 已弃用
SWE-bench Pro Scale AI Terminal-Bench Stanford / Laude
SWE-Universe 阿里 Qwen × 浙大 ArtifactsBench 腾讯混元
核心指标
Resolve Rate(%):隐藏测试通过率。Pro 前沿仅 ~23–25%;Verified 因 59.4% 难题测试缺陷+金补丁全污染被官方停用
使用方:OpenAI / Anthropic / Google / 阿里 / DeepSeek 等一切编码模型发版;SWE-Universe 另作训练环境工厂(807,693 环境)
02
推理服务与硬件能效
目的:测「系统」而非模型——单位资源能服务多少 Agent
AA-AgentPerf Artificial Analysis(第三方评测机构)
MLPerf Agentic Inference MLCommons(行业标准联盟,2026-07 征集期)
核心指标
Agents per Megawatt(固定三级 SLO:P25 tok/s 20/60/180、P95 TTFT 10/5/3s);GB300 NVL72 61,354 vs H200 2,594。MLPerf:轨迹级 Pareto 前沿+三级准确性门禁
使用方:NVIDIA(已提交 GB300/B300 成绩)、AMD(MI355X 自测)、数据中心采购方与推理云
03
长时程学习与自我进化
目的:测 Agent 连续工作 12–72 小时的「学习速率」
EdgeBench 字节跳动 Seed(2026-07,arXiv:2607.05155);开源 SForge 评测框架
核心指标
Score@t 曲线(2h…12h 六时点)+ log-sigmoid 三参数(Smax/tmid/β,R²=0.998)+ 学习速度(固定 2h 预算增益,前沿约每 3 个月翻倍)
使用方:模型代际研究;Opus 4.8 / GPT-5.5 / GLM-5.1 / DS-V4-Pro 首轮参评。学术探索期,尚无独立复现
04
工具与函数调用
目的:测 API 选择、参数生成与多轮工具-用户协作
BFCL UC Berkeley(ICML 2025,V4 持续更新)
τ-bench / τ²-bench Sierra(AI 客服公司)
ToolLLM 清华等(ICLR 2024,16,000+ 真实 API)
核心指标
AST/执行准确率(BFCL,程序化判分);领域任务成功率(τ²:双控环境下状态变更正确率,Kimi K2 报告 66.1%)
使用方:函数调用模型选型首选公开榜;Moonshot(Kimi K2 技术报告引用 τ²);客服/订票类 Agent 验收
05
计算机操作(GUI / Web)
目的:测真实 OS / 浏览器中的开放式任务完成能力
OSWorld / Verified xLang Lab(NeurIPS 2024)
Windows Agent Arena Microsoft
WebArena / VisualWebArena CMU(ICLR/ACL 2024)
核心指标
任务成功率:以系统状态判分(非字符串匹配)。OSWorld 369 任务跑完整 VM;Verified 版 AWS 并行全量评测 <1 小时
使用方:Anthropic(Computer Use)、OpenAI(Operator 类)发版对照;桌面自动化/RPA 产品选型
06
记忆与长上下文
目的:测跨会话长期记忆的保持、更新与拒答
LongMemEval ICLR 2025(~1.5M token)
BEAM / LIGHT 2025(10M token 会话)
LoCoMo / MemoryBank ACL / AAAI 2024(早期基线)
核心指标
五类记忆能力分项准确率(提取/更新/推理/时效/拒答)。BEAM 实测:1M 上下文+RAG 在 10M 规模仍随对话变长退化
使用方:个人助理/记忆服务(Memory-as-a-Service)产品的能力验收与架构论证
07
安全与对抗
目的:测注入攻击、有害执行、工具投毒与基准可破解性
AgentDojo ETH SPY Lab(NeurIPS 2024 D&B)
AgentHarm / HarmBench ICLR 2025 / ICML 2024
CyberSecEval 3 Meta Purple Llama MCPTox AAAI 2026
BenchJack UC Berkeley(基准审计)
核心指标
攻击下效用保持 vs 攻击成功率(AgentDojo:GPT-4o 69%→50%);基准可破解率(BenchJack:10 个主流基准 9 个可刷分,修复后 <10%)
使用方:模型发布安全审查、上线门禁、监管合规(EU AI Act 类证据);MCP 生态供应链审计
08
多智能体协作
目的:诊断多 Agent 系统的失败模式与多任务干扰
MAST UC Berkeley(2025,Why Do Multi-Agent LLM Systems Fail?)
C³-Bench 腾讯(2025,多任务干扰)
框架侧:AutoGen(Microsoft)、MetaGPT、ChatDev
核心指标
失败模式分类占比(MAST 归纳 14 种失败模式、3 大类,轨迹级归因);并发任务完成率(C³-Bench)
使用方:多智能体框架设计复盘、编排器/调度器验证;腾讯混元 Agent 迭代
09
垂直行业与职业
目的:复刻岗位工作流,验收「能上岗」的交付质量
FinSearchComp / ReportBench 字节 Seed / BandAI
EcomBench 阿里通义 VoiceAgentEval 声网 × 美团 × xbench
BrowseComp OpenAI xbench 职业系列 红杉中国
核心指标
行业任务准确率/引用忠实度:FinSearchComp 635 题·70 位金融专家标注(Grok 4 领跑全球子集、豆包领跑大中华子集);语音外呼 15 项语音指标·150 人设模拟
使用方:金融/电商/外呼行业 POC 验收;京东 JoyAgent 以 GAIA 验证集 75.15% 作发版对照
10
评测基础设施与元评测
目的:测「评测本身」——成本、过程质量、可复现性
HAL Princeton 等(2025)
Inspect / inspect_evals UK AI Security Institute(政府安全机构)
AgentProcessBench 2026 CUARewardBench 腾讯优图
核心指标
三维(模型×脚手架×成本)对比:HAL 以 21,730 次 rollout、≈$40K、2.5B token 日志证明换脚手架可差 20–30 分;步级过程标注一致性 89.1%
使用方:严肃对比研究、第三方审计与企业内评测平台建设(Inspect 已聚合 70+ 评测实现)

学术与研究机构

Princeton · UC Berkeley · Stanford · CMU · ETH · 清华 · 浙大——能力与方法论基准的策源地:SWE-bench、BFCL、Terminal-Bench、WebArena、AgentDojo、MAST、BenchJack、HAL 均出自学术实验室。

模型与产业大厂

OpenAI · Microsoft · Meta · 阿里 · 字节 · 腾讯 · 华为 · 京东 · 美团 · 声网 · Moonshot——既是发起方(自建 Benchmark 定义规格)也是最重度使用方(发版对标、训练环境、行业验收)。

标准机构与第三方

MLCommons · Artificial Analysis · Scale AI · Sierra · 红杉中国 xbench · UK AISI——承接「从学术榜到生产榜」的转移:行业标准(MLPerf)、第三方硬件评测(AA-AgentPerf)、抗污染商业榜(SWE-bench Pro)、政府审计框架(Inspect)。