AI AGENT 权威评测体系全景 · 第二篇 · 2026 年 7 月

基础设施性能五类指标:能效看每兆瓦智能体数,时延看服务水平,隔离看双容器架构,可靠性看长会话连续运行

第一篇回答「模型能力如何评价」,本篇回答「支撑 Agent 运行的系统如何评价」。下列数字均取自各评测方的公开结果或论文;尚无公开结果与统一标准之处,均如实说明。
一、能效与成本
衡量单位电力与单位资金投入所能获得的 Agent 服务能力
AA-AgentPerf Artificial Analysis,2026 年 6 月 · 专题分析
核心指标每兆瓦智能体数:NVIDIA GB300 NVL72 为 61,354,B300 为 21,053,AMD MI355X 为 3,551,H200 为 2,594(第一档服务水平)。功耗按加速器实测(GPU 核心与显存),不含 CPU、网络与制冷部分。
MLPerf Agentic · 边缘子集 MLCommons,2026 年 7 月 · 专题分析
边缘部署的显存门槛:量化后模型 16.5GB,全精度为 54GB;参考准确率 86.23%。
成本透明度案例 普林斯顿大学 HAL / SWE-bench 系列
HAL 评测全程公开成本:21,730 次运行约 4 万美元;SWE-bench 单任务评测成本 0.34–2.51 美元,不同配置相差约 7 倍。
成本信息不完整:EdgeBench 约 38,000 小时的运行未公布费用明细,评测投入与产出难以直接换算,成本核算目前是五类指标中数据最薄弱的一项。
二、时延、并发与运行环境效率
衡量固定服务水平下的响应速度、并发容量与环境运行效率
AA-AgentPerf Artificial Analysis · 专题分析
三档服务水平(SLO):输出速度第 25 百分位 20/60/180 tok/s,首 token 时延第 95 百分位 不超过 10/5/3 秒;通过指数爬坡与二分查找确定不突破服务水平上限的最大并发数。
MLPerf Agentic Inference MLCommons · 专题分析
以 30,335 轮真实 Agent 轨迹重放;以并发—速度 Pareto 前沿代替单一吞吐指标;会话路由(X-Session-ID)与缓存加盐机制使 KV Cache 命中率成为可复现的评分变量。
OSWorld-Verified / SWE 系列 xLang / 普林斯顿 / 阿里 Qwen
OSWorld-Verified 通过 AWS 并行将全量评测压缩至 1 小时以内;SWE-bench 全量串行评测曾需 78 小时,后全面转向容器化并行;SWE-Universe 为每个构建任务分配独立云沙箱虚拟机,由 MegaFlow 系统编排 807,693 个环境。
标准尚未统一:「沙箱启动时间」目前缺乏统一测量口径,各评测体系只公布总评测时长,容器与虚拟机的启动效率数据散落在工程博客中。
三、Token 消耗与状态容量
衡量真实负载的 token 量级,以及上下文、缓存与工作区的容量约束
负载规模实测 MLCommons / 字节 Seed / 普林斯顿
MLPerf 单条轨迹上下文 262,144 token;EdgeBench 单任务最多 200 轮交互、超 10 万 token;BEAM 会话规模 1,000 万 token;HAL 公开 Agent 日志 25 亿 token。
容量价值的实验证据 EdgeBench 论文第 5.2/5.3 节 · 专题分析
100 万与 20 万 token 上下文对比:成绩全程稳定高出 4.4–5.8 分;保持经验连续(会话状态不丢失)在同等预算下高出 6.9 分——状态容量可以直接折算为任务成绩。
缓存复用计入评分 MLCommons / Artificial Analysis
两项服务级评测均明确允许 KV Cache 复用、推测解码与分离式推理——缓存工程的优劣从后台实现细节转变为榜单成绩的组成部分。
单位成本指标缺失:现有评测体系均不公布「每完成一个任务消耗多少 token」,任务级 token 成本核算目前只有 HAL 一家实践。
四、安全与隔离性
衡量攻击下的服务能力保持、沙箱隔离强度与评分通道的抗操纵能力
对抗性评测 苏黎世联邦理工 / AAAI 2026 / 加州大学伯克利分校
AgentDojo:GPT-4o 在攻击下效用从 69% 降至 50%;MCPTox:首个面向真实 MCP 服务器的工具投毒评测;BenchJack:10 个主流基准中 9 个存在绕过任务直接得分的通道,修复后降至 10% 以下。
SForge 双容器隔离 字节 Seed · 专题分析
工作容器与评分容器物理隔离,配合按任务网络隔离与多组隐藏随机种子;论文记录的五类操纵行为中,一例通过 400 余次提交反推隐藏答案获得 1.000 分,而合规路线最高仅 0.165 分。
沙箱最小权限实践 斯坦福 / 阿里 Qwen
Terminal-Bench 对文件污染与权限提升的考察,推动沙箱采用不可变文件系统与最小权限网络;SWE-Universe 部署环内作弊检测器拦截虚假验证脚本,环境构建成功率从 82.6% 提升至 94%;SWE-bench 的历史教训显示,9 行配置文件即可操纵评分。
分级标准待建立:双容器、网络隔离、隐藏种子的工程方案已经成熟,但面向不同评测体系的「隔离等级」统一分级标准尚未形成。
五、可靠性与可用性
衡量长会话连续运行、中断恢复与服务稳定性对任务成绩的影响
服务稳定性计入成绩 EdgeBench 论文附录 9 · 专题分析
GPT-5.4 在评测后半程遭遇的 API 中断明显更多,部分任务有效运行次数不足 3 次(成绩表以星号标注);论文明确指出,长时程评测不可避免地会把服务稳定性计入最终成绩。
SForge 长会话保障机制 字节 Seed 开源框架
退出拦截防止 Agent 提前结束任务;断点续跑在断连或崩溃后通过原生会话机制恢复(如 claude --continue);自动评估每 300 秒对工作区快照评分——三项机制共同保障 12 小时以上会话的有效运行时间。
容量定义中的可靠性要求 Artificial Analysis / xLang
AA-AgentPerf 的容量指标以「服务水平不下降」为前提——可靠性直接写入指标定义;OSWorld 评测需在 VMware、AWS、Azure、Docker 多种后端上稳定运行。
行业指标待统一:「会话级服务等级」(12 小时连续运行率、断点恢复损耗)目前缺乏行业统一指标,仅 EdgeBench 以「有效运行覆盖」的形式间接披露。
六、三个有待补齐的方向
截至 2026 年 7 月,五类指标均有实测数据,但仍存在三处结构性短板
  • 「同一模型 × 不同硬件」的对照数据不存在。能力评测不区分硬件平台,硬件评测不更换模型——采购决策只能拼接两类证据,缺乏公开的交叉对照表。
  • CPU 性能处于测量范围之外。AA-AgentPerf 以「代表性的 CPU 处理时间」(中位 1 秒)模拟工具调用,真实 CPU 工具执行性能的评测仅列入官方后续计划——目前任何关于「CPU 厂商评测成绩」的说法都缺乏事实依据。
  • MLPerf Agentic 尚未产生公开结果。规范已于 2026 年 7 月 8–9 日发布,目前处于首轮结果征集阶段,其指标体系的实际检验有待首批提交公布。
数据来源:各评测方公开结果与论文原文;尚无公开结果之处均已注明 指标一览:每兆瓦智能体数 · 输出速度分位数 · 首 token 时延 · 最大并发 · 轨迹 token 量 · 攻击下效用保持 · 可破解率 · 有效运行覆盖 相关阅读:第一篇 · 能力评测 · 全景图鉴(13 页版)