基于本报告体系对 SWE-bench 家族、AA-AgentPerf、MLPerf Agentic、EdgeBench、OSWorld、AgentDojo、BEAM 等 30 余项权威评测的调查,将 AI Agent 的落地形态归纳为六大业务场景,逐一给出「场景特征 → 可引用的权威 Benchmark → 业务方真正应关注的指标体系」。所有指标均锚定已核实的实测数据;尚无公开基准的指标均如实说明。
选型逻辑:先确定业务属于哪个场景,再决定引用哪些 Benchmark 作为能力证据,最后用业务指标定义验收标准——三者不可混用。
| 业务场景 | 业务价值主张 | 可引用的权威 Benchmark(机构) | 业务方最应关注的三项指标 | 主要风险(已核实) |
|---|---|---|---|---|
| S1 编码与研发提效 | 缩短修复周期、降低人力投入 | SWE-bench Pro(Scale AI)、Terminal-Bench(Stanford)、SWE-Universe(阿里 Qwen);SWE-bench Verified 已停用 | ① 修复采纳率 ② 单任务 token 成本 ③ 沙箱构建通过率 | 训练污染与测试缺陷——Verified 59.4% 难题测试有缺陷 |
| S2 对话服务与业务办理 | 7×24 在线、替代人工坐席 | τ²-bench(Sierra)、BFCL(UC Berkeley)、VoiceAgentEval(声网×美团×xbench) | ① 服务水平达标率 ② 单会话 token 成本 ③ 并发会话容量 | 政策执行偏差与多轮状态错乱 |
| S3 知识研究与报告生成 | 研究人力外包、交付物提速 | FinSearchComp(字节)、ReportBench(字节)、BrowseComp(OpenAI)、EcomBench(阿里通义) | ① 引用忠实度 ② 单份交付物成本 ③ 交付周期 | 「看起来专业但引用编造」——ReportBench 逐句核查的设计初衷 |
| S4 桌面与流程自动化 | RPA 智能化升级、跨系统打通 | OSWorld-Verified(xLang)、Windows Agent Arena(微软)、WebArena(CMU) | ① 任务成功率 ② 全量评测时长 ③ 环境适配成本 | BenchJack 审计:修复前可被 100% 破解;VM 驱动成本高 |
| S5 长时程自主任务 | 数小时连续工作、自主改进 | EdgeBench(字节 Seed)、AA-AgentPerf(Artificial Analysis)、MLPerf Agentic(MLCommons) | ① 学习曲线斜率 ② 会话连续运行率 ③ 每兆瓦智能体数 | 服务中断计入成绩;38,000 小时成本未公开 |
| S6 个人助理与记忆服务 | 越用越懂用户、隐私可管 | LongMemEval(ICLR 2025)、BEAM/LIGHT(2025)、LoCoMo(ACL 2024) | ① 记忆五类分项准确率 ② 上下文窗口规格 ③ 拒答正确率 | 1M 上下文+RAG 在 10M 规模下仍退化——纯窗口路线不可持续 |
| Benchmark | 机构 | 实测数据 |
|---|---|---|
| SWE-bench Pro | Scale AI | 1,865 题;前沿模型仅 23%–25%——区分度良好,可作选型对照 |
| SWE-bench Verified | OpenAI | 已停用 59.4% 难题测试有缺陷、答案可被逐字复述,历史分数不宜再引用 |
| Terminal-Bench | Stanford | 真实终端任务;文件污染与权限提升成为沙箱设计考察点 |
| SWE-Universe | 阿里 Qwen | 807,693 个可验证环境;构建成功率 78.44%(Qwen-Next-80A3) |
| Benchmark | 机构 | 实测数据 |
|---|---|---|
| τ²-bench | Sierra | 双控环境(用户与 Agent 均可改变状态);Kimi K2 技术报告成绩 66.1% |
| BFCL | UC Berkeley | V4 榜单持续更新;函数调用程序化判分,客服类工具链选型首选 |
| VoiceAgentEval | 声网×美团×xbench | 30 子场景、150 人设用户模拟、15 项语音指标——语音通道专项 |
| AA-AgentPerf | Artificial Analysis | 三级服务水平(P25 20/60/180 tok/s、P95 TTFT ≤10/5/3s)——并发容量的服务级定义 |
| Benchmark | 机构 | 实测数据 |
|---|---|---|
| ReportBench | 字节 BandAI | 100 任务;以 arXiv 综述反向工程,平均 153 篇参考文献作 ground truth,逐句验证引用忠实度 |
| FinSearchComp | 字节 Seed | 635 题、70 位金融专家标注;Grok 4 领先全球子集、豆包领先大中华子集 |
| BrowseComp | OpenAI | 「难找但可验证」的深度检索能力 |
| EcomBench | 阿里通义 | 电商全链路(商品理解、客服、运营决策)行业验收 |
| Benchmark | 机构 | 实测数据 |
|---|---|---|
| OSWorld / Verified | xLang | 369 个真实计算机任务;Verified 版 AWS 并行将全量评测压到 1 小时以内 |
| Windows Agent Arena | 微软 | 150+ Windows 任务;Azure VM 集成与 UI Automation 桥接 |
| WebArena / VWA | CMU | 自托管真实 Web 应用(电商/论坛/GitLab);以结果状态判分 |
| BenchJack 审计 | UC Berkeley | OSWorld/WebArena 修复前可被 100% 破解,修复信任边界后降至 0% |
| Benchmark | 机构 | 实测数据 |
|---|---|---|
| EdgeBench | 字节 Seed | 134 任务连续 12–72 小时;log-sigmoid 拟合 R²=0.998;经验连续性同预算 +6.9 分 |
| AA-AgentPerf | Artificial Analysis | 每兆瓦智能体数:GB300 NVL72 61,354 vs H200 2,594(约 23.7 倍) |
| MLPerf Agentic | MLCommons | 613 条真实轨迹、30,335 轮;三级准确性门槛+Pareto 前沿(首轮结果征集中) |
| 服务稳定性证据 | EdgeBench 附录 9 | GPT-5.4 后半程 API 中断显著更多,部分任务有效运行不足 3 次 |
| Benchmark | 机构 | 实测数据 |
|---|---|---|
| LongMemEval | ICLR 2025 | 约 150 万 token 对话;记忆拆为五类可单独考核的能力 |
| BEAM / LIGHT | 2025 | 会话规模推至 1,000 万 token;1M 上下文+RAG 仍随对话变长退化 |
| LoCoMo / MemoryBank | ACL / AAAI 2024 | 早期基线;带遗忘曲线的记忆注入机制 |
| 上下文消融 | EdgeBench | 1M vs 200k 上下文全程稳定 +4.4~+5.8 分——窗口与外部记忆互补而非替代 |
Benchmark 分数是「能力证据」,业务指标是「价值验收」——前者由评测方发布,后者必须由业务方自己定义并测量。以下原则从六大场景的实测数据中归纳。
模型能力引用 S1–S6 对应的能力榜(SWE-bench Pro、τ²-bench、OSWorld 等);系统容量引用服务级榜(AA-AgentPerf、MLPerf);可信度引用对抗榜(AgentDojo、BenchJack)。不存在一个能同时证明三者的单一分数。
「最大并发」「吞吐」只有附带服务水平(P25 输出速度、P95 首 token 时延)才有采购意义。AA-AgentPerf 的教训:不带服务水平的吞吐数字可以用堆并发刷高,不能作为容量承诺。
HAL 证明同一模型换脚手架可差 20–30 分;SWE-bench 单任务成本 0.34–2.51 美元(7 倍差)。「每任务/每会话/每份报告多少美元」必须与具体配置一同记录,否则无法横向比较也无法复算。
SWE-bench Verified 已被官方停用;BenchJack 证明 10 个主流基准中 9 个可被刷分;OSWorld/WebArena 修复前可 100% 破解。引用任何分数前,确认版本、修复状态与污染状况——过期的分数比没有分数更误导决策。