AI AGENT INFRASTRUCTURE BENCHMARKS · PAGE 2 / 2 · 2026-07-29

基础设施性能怎么测:能效看 Agents/MW、时延看 SLO、隔离看双容器、可靠性看 12 小时不中断——但 TCO 与硬件对照仍是盲区

五族指标、九个测试套/框架的实测数字。能力基准(P1)回答「模型能不能做对」,本页回答「供养 Agent 的系统快不快、省不省、稳不稳、漏不漏」。全部数字来自官方实测或论文披露;「征集期/未披露」如实标注。
① 能效与 TCO
测:单位电力/单位美元的 Agent 容量与评测成本
AA-AgentPerf Artificial Analysis,2026-06 · 专题调查
主指标 Agents per Megawatt:GB300 NVL72 61,354 vs B300 21,053 vs AMD MI355X 3,551 vs H200 2,594(SLO Tier 1)。分母为实测加速器功耗(GPU die+HBM,刻意不含 CPU/网络/冷却)。
MLPerf Agentic · Edge MLCommons,2026-07 征集期 · 专题调查
边缘部署的量化门槛:Q4_K_M 16.5GB vs BF16 54GB;参考准确率 86.23%(BFCL)。
HAL / SWE-bench 成本证据 Princeton / OpenAI 系
HAL:21,730 次 rollout ≈ $40K(罕见的成本透明案例);SWE-bench 单任务评测成本 $0.34–$2.51(7 倍差,取决于重试与轨迹长度)。
盲区:EdgeBench 38,000 小时交互的美元成本未披露——「每分成本」无法折算 ROI,TCO 记账是五族指标中最弱一环。
② 时延 · 沙箱时延 · 并发
测:固定服务水平下的响应速度、最大并发与环境启动效率
AA-AgentPerf Artificial Analysis · 专题调查
三级 SLO:P25 输出速度 20/60/180 tok/s,P95 TTFT ≤10/5/3s;用指数爬坡+二分查找搜索不跌破 SLO 的最大并发 Agent 数。
MLPerf Agentic Inference MLCommons · 专题调查
30,335 轮真实轨迹重放;并发-速度 Pareto 前沿替代单一吞吐;X-Session-ID 会话路由+缓存加盐,使「KV Cache 命中率」成为可复现的计分变量。
OSWorld-Verified / SWE 系 xLang / Princeton / 阿里 Qwen
OSWorld-Verified:AWS 并行把全量评测压到 <1 小时;SWE-bench 全量串行曾需 78 小时(倒逼容器化并行);SWE-Universe:每个构建任务分发独立 ECS 沙盒 VM,MegaFlow 编排 807,693 环境。
注意:「沙箱冷启动」目前没有统一公开指标——各基准只披露总评测时长,容器/VM 启动延迟散落在工程博客里,未见标准化测量。
③ Token 消耗与状态容量
测:真实负载的 token 量级,及上下文/KV Cache/工作区的容量瓶颈
负载侧实测 MLPerf / 字节 Seed / Princeton
MLPerf 单条轨迹上下文 262,144 token;EdgeBench 轨迹 200 轮、>100K token;BEAM 会话规模 10M token;HAL 公开日志 2.5B token。
容量价值消融 EdgeBench,论文 §5.2/5.3 · 专题调查
1M vs 200k 上下文:全程稳定 +4.4~+5.8 分;经验连续性(状态不丢)同预算 +6.9 分——状态容量直接折算为成绩。
KV Cache 复用的计分化 MLCommons / Artificial Analysis
两大服务级基准均明确允许 KV Cache 复用、推测解码、分离式推理——「缓存工程」从后台优化变为榜单竞争力。
缺口:没有基准直接报告「每完成任务消耗多少 token」(token/resolved task)——成本归因目前只有 HAL 一家在做。
④ 安全与隔离性
测:攻击下效用保持、沙箱隔离强度、评分通道抗作弊能力
对抗基准 ETH / AAAI 2026 / UC Berkeley
AgentDojo:GPT-4o 攻击下效用 69%→50%;MCPTox:首个真实 MCP Server 投毒基准;BenchJack:9/10 主流基准可「不解题刷分」,修复后 <10%。
SForge 双容器隔离 字节 Seed · 专题调查
Work/Judge 物理隔离+按任务网络隔离+多隐藏种子;论文实测 5 类作弊:如 400+ 次提交反解隐藏答案刷到 1.000 vs 正当路线仅 0.165。
沙箱最小权限实践 Stanford / 阿里 Qwen
Terminal-Bench:副作用考察倒逼不可变文件系统+最小权限网络;SWE-Universe:环内 hacking 检测器拒绝 grep 式假验证器,构建成功率 82.6%→94%。SWE-bench 教训:9 行 conftest.py 即可刷分。
结论:隔离强度已有工程答案(双容器+网络隔离+隐藏种子),但跨基准的「隔离等级」分级标准尚未出现。
⑤ 可靠性与可用性
测:天级会话不中断、断点可续跑、服务稳定性可被计入成绩
服务稳定性被「折叠」进成绩 EdgeBench 论文 Appendix 9 · 专题调查
GPT-5.4 后半程 API 中断显著更多,部分任务有效运行不足 3 次(成绩表 * 标注);论文明言长时程任务「不可避免地把服务稳定性折叠进它所测量的东西」。
SForge 长时程三件套 字节 Seed 开源框架
stop-hook 拦截提前退出;auto-resume 断连后用原生会话机制(如 claude --continue)拉起;auto-eval 每 300 秒自动快照评分——保障 ≥12h 会话的「有效运行时长」。
容量定义的可靠性内含 Artificial Analysis / xLang
AA-AgentPerf 的容量=「SLO 不跌破」前提下的最大并发——可靠性被写进指标定义;OSWorld 评测需稳定驱动 VMware/AWS/Azure/Docker 多后端。
缺口:「会话级 SLA」(12h 不中断率、resume 损耗率)尚无行业标准指标——目前只有 EdgeBench 以「有效运行覆盖」间接披露。
⑥ 三个尚未补上的洞
2026-07 现状:五族指标都有实测,但三处结构性缺口
  • 「同模型 × 不同硬件」对照不存在。能力基准(P1 各领域)不测硬件,硬件基准(AA-AgentPerf/MLPerf)不换模型——采购决策只能拼接两类证据,无公开交叉表。
  • CPU 是被刻意隔离的测量盲区。AA-AgentPerf 用「代表性 CPU 处理时间」模拟工具调用(中位 1 秒),真实 CPU 工具执行性能测试仅是官方「What's next」计划——当前任何「CPU 厂商测试成绩」的说法均为误读。
  • MLPerf Agentic 仍处征集期。规范已发布(2026-07-08/09),但尚无公开提交结果;其指标体系的实战检验要等首轮提交放榜。
深入阅读:AA-AgentPerf · MLPerf · EdgeBench · SWE-bench · SWE-Universe · 瓶颈诊断
口径声明:实测=官方/论文直接披露;征集期=规范已发但无公开结果;未见公开数据=如实标注 指标速查:Agents/MW · P25 tok/s · P95 TTFT · 最大并发 · token/轨迹 · 攻击下效用 · 可破解率 · 有效运行覆盖 配套:P1 能力版图 · 全景图鉴(13 页版)