01
编码与软件工程
评测目标:检验 Agent 修复真实代码库问题、完成终端任务的能力
SWE-bench 家族 普林斯顿大学(ICLR 2024);Verified 子集由 OpenAI 制作 Verified 已停用
SWE-bench Pro Scale AI Terminal-Bench 斯坦福大学
SWE-Universe 阿里巴巴 Qwen 团队与浙江大学 ArtifactsBench 腾讯混元
核心指标
问题修复率(%):以隐藏测试通过率计分。SWE-bench Pro 前沿模型得分约 23%–25%,区分度良好;Verified 因 59.4% 难题存在测试缺陷、答案可被逐字复述而被官方停用
发起与使用:OpenAI、Anthropic、谷歌、阿里、DeepSeek 等模型厂商发版时的主要对照基准;SWE-Universe 同时承担训练环境供给职能(807,693 个可验证环境)
02
推理服务与硬件能效
评测目标:衡量推理系统与硬件平台的服务能力和能源效率
AA-AgentPerf Artificial Analysis(第三方评测机构,2026 年 6 月)
MLPerf Agentic Inference MLCommons(行业标准联盟,2026 年 7 月发布,处于首轮结果征集阶段)
核心指标
每兆瓦智能体数(Agents per Megawatt):在固定服务水平下的最大并发数除以实测功耗。NVIDIA GB300 NVL72 取得 61,354,约为 H200(2,594)的 23.7 倍;MLPerf 采用轨迹级 Pareto 前沿与三级准确性门槛
发起与使用:NVIDIA 已提交 GB300 与 B300 成绩,AMD MI355X 由评测方自测;面向数据中心采购与推理云容量规划
03
长时程学习与自我进化
评测目标:衡量 Agent 连续工作 12–72 小时期间的学习与改进速率
EdgeBench 字节跳动 Seed 团队(2026 年 7 月,arXiv:2607.05155),配套开源评测框架 SForge
核心指标
分时段得分曲线(2 至 12 小时六个时点)与 log-sigmoid 拟合参数(拟合精度 R²=0.998);按模型发布日期排列的学习速度显示,前沿水平约每 3 个月提升一倍
发起与使用:字节 Seed 发布并首轮评测 Claude Opus 4.8、GPT-5.5、GLM-5.1、DeepSeek-V4-Pro 五个模型;2026 年 7 月发布,第三方复现尚未出现
04
工具与函数调用
评测目标:检验 API 选择、参数生成与多轮工具协作的准确性
BFCL 加州大学伯克利分校(ICML 2025,V4 榜单持续更新)
τ-bench / τ²-bench Sierra(人工智能客服企业)
ToolLLM 清华大学等(ICLR 2024,覆盖 16,000 余个真实 API)
核心指标
函数调用准确率(BFCL,程序化判分);领域任务完成率(τ²-bench 双控环境,Kimi K2 技术报告成绩 66.1%)
发起与使用:函数调用能力选型的首选公开榜单;Moonshot 在 Kimi K2 技术报告中引用 τ²-bench;广泛用于客服、订票类产品验收
05
计算机操作(图形界面与网页)
评测目标:检验真实操作系统与浏览器环境中的开放式任务完成能力
OSWorld / OSWorld-Verified xLang 实验室(NeurIPS 2024)
Windows Agent Arena 微软
WebArena / VisualWebArena 卡内基梅隆大学(ICLR/ACL 2024)
核心指标
任务成功率:以系统实际状态判定,而非文本匹配。OSWorld 含 369 个真实计算机任务,需在完整虚拟机中运行;Verified 版本通过 AWS 并行将全量评测时间控制在 1 小时以内
发起与使用:Anthropic(Computer Use)、OpenAI(Operator)等产品发布时的公开对照基准;桌面自动化与 RPA 产品选型参考
06
记忆与长上下文
评测目标:检验跨会话长期记忆的保持、更新与拒答能力
LongMemEval ICLR 2025(约 150 万 token 对话规模)
BEAM / LIGHT 2025 年(1,000 万 token 会话规模)
LoCoMo / MemoryBank ACL / AAAI 2024(早期基线)
核心指标
五类记忆能力分项准确率:信息提取、知识更新、多会话推理、时效性、拒答。BEAM 实验表明,100 万 token 上下文配合检索增强,在 1,000 万 token 规模下仍随对话变长而性能下降
发起与使用:个人助理与记忆类产品的能力验收依据,也是记忆服务架构设计的核心参考
07
安全与对抗
评测目标:检验注入攻击抵抗、有害任务拒绝、工具投毒防护与评测抗操纵能力
AgentDojo 苏黎世联邦理工学院(NeurIPS 2024)
AgentHarm / HarmBench ICLR 2025 / ICML 2024
CyberSecEval 3 Meta MCPTox AAAI 2026
BenchJack 加州大学伯克利分校(评测体系审计工具)
核心指标
攻击下效用保持率与攻击成功率:AgentDojo 中 GPT-4o 效用从 69% 降至 50%;评测可破解率:BenchJack 审计显示 10 个主流基准中 9 个可在不完成任务的情况下获得接近满分,经三轮修复后降至 10% 以下
发起与使用:模型发布安全审查、产品上线前安全门禁、监管合规材料;MCP 生态接入方的供应链安全审计
08
多智能体协作
评测目标:诊断多智能体系统的协作失败模式与多任务并行干扰
MAST 加州大学伯克利分校(2025 年,多智能体失败归因研究)
C³-Bench 腾讯(2025 年,多任务干扰)
相关框架:AutoGen(微软)、MetaGPT、ChatDev
核心指标
失败模式分类占比:MAST 归纳 3 大类 14 种失败模式,按执行轨迹归因;并发任务完成率(C³-Bench)
发起与使用:多智能体框架的设计复盘与回归测试;腾讯用于混元 Agent 迭代验证
09
垂直行业与职业能力
评测目标:复刻岗位真实工作流,检验行业级交付质量
FinSearchComp / ReportBench 字节跳动 Seed / BandAI
EcomBench 阿里通义实验室 VoiceAgentEval 声网、美团与 xbench 联合发布
BrowseComp OpenAI xbench 职业系列 红杉中国
核心指标
行业任务准确率与引用忠实度:FinSearchComp 由 70 位金融专家标注 635 题(Grok 4 领先全球子集、豆包领先大中华子集);语音外呼评测含 15 项语音指标与 150 人设用户模拟
发起与使用:金融、电商、语音外呼等行业的产品验收;京东开源多智能体产品 JoyAgent 以 GAIA 验证集 75.15% 作为发布对照
10
评测基础设施与过程质量
评测目标:衡量评测活动本身的成本、过程质量与可复现性
HAL 普林斯顿大学等(2025 年)
Inspect / inspect_evals 英国人工智能安全研究所(政府安全机构)
AgentProcessBench 2026 年 CUARewardBench 腾讯优图实验室
核心指标
模型、脚手架与成本的三维对比:HAL 以 21,730 次运行、约 4 万美元、25 亿 token 日志证明,同一模型更换脚手架后得分可相差 20–30 分;AgentProcessBench 步级标注一致性 89.1%
发起与使用:学术对比研究、第三方审计与企业评测平台建设;Inspect 已汇聚 70 余项社区评测实现