Benchmark Investigation · Artificial Analysis · 2026-06

AA-AgentPerf 深度调查
——「每兆瓦智能体数」重新定义推理基础设施的竞争力

2026 年 6 月 12 日,Artificial Analysis 发布 AA-AgentPerf——业界首个专为 AI Agent 设计的硬件推理基准。它不再问「每秒多少 token」,而是问「每兆瓦电力能同时养活多少个智能体」。首轮结果(NVIDIA GB300 NVL72 61,354 agents/MW vs H200 2,594 agents/MW,20 倍差距)将「能效」推为 Agent 时代基础设施的第一竞争力。本调查基于 Artificial Analysis 官方文章与 NVIDIA 官方博客全文,拆解其设计选择、测试指标与基础设施含义。

日期:2026 年 7 月 27 日 调查对象:AA-AgentPerf 首轮结果(DeepSeek V4 Pro) 状态:开放提交中,AMD/Intel 结果待更新 ← 返回主报告 MLPerf Agentic 调查 基础设施瓶颈诊断

一、基准概览与核心数字Overview

AA-AgentPerf 是 Artificial Analysis(独立 AI 评测机构)于 2026 年 6 月 12 日发布的硬件基准,定位为「业界首个专为 AI Agent 设计的推理基准」。其核心主张是:2026 年的主流 AI 负载与旧基准设计时瞄准的东西早已不同——编码 Agent 运行数百轮、穿插推理与工具调用、上下文常态化超过 100K token,而旧基准测量的是定长合成请求、且关闭了生产环境真实开启的优化[1]。

61,354
GB300 NVL72 每兆瓦并发 Agent 数(SLO 20 tok/s)[2]
20×
GB300 NVL72 vs HGX H200 的每兆瓦 Agent 数倍数[2]
200 轮
单条 Agent 轨迹最大轮数(编码任务)[1]
>100K token
单条轨迹最大序列长度[1]
12+ 语言
轨迹覆盖的编程语言数[1]
2 模型
发布时支持:DeepSeek V4 Pro 与 gpt-oss-120b(后者结果待发布)[1]
调查结论AA-AgentPerf 暴露的核心基础设施瓶颈不是「GPU 算力不够」,而是「Agent 工作负载的结构性特征与旧推理栈不匹配」:长共享前缀要求 KV Cache 复用成为一等公民;短输出突发要求调度器处理「大量小请求」;200 轮轨迹要求系统维持「闭环进度」而非「并发请求数」。其主指标 Agents per Megawatt 将「电力」推为约束上限——在数据中心电力容量固定的现实下,每瓦特能服务的 Agent 数直接决定基础设施投资的产出。

二、测试指标拆解:Agents per Megawatt 是什么The Lead Metric

2.1为什么不用「每秒 token 数」

Artificial Analysis 的官方解释是:峰值吞吐容易被「堆并发」刷高——把并发数堆到每个 Agent 都爬行,系统总吞吐数字依然好看。AA-AgentPerf 的做法是固定服务水平(SLO),然后问「系统能扩展到什么程度而不跌破这个服务水平」[1]。

2.2三级 SLO:从市场真实服务水平倒推

SLO 层级P25 输出速度(token/秒/Agent)P95 TTFT(秒)对应用户体验
Tier 120≤ 10可接受的交互底线
Tier 260≤ 5流畅的编码助手体验
Tier 3180≤ 3高端实时交互

SLO 层级来源于 Artificial Analysis 对 serverless API 提供商的实际观测数据——即「今天市场上真实存在的服务质量水平」,而非理论目标[1]。

2.3三种归一化视角

归一化方式回答的问题首轮 GB300 NVL72 数字(SLO Tier 1)
Per Megawatt(每兆瓦)给定电力预算,能养活多少 Agent?61,354 agents/MW[2]
Per Accelerator(每加速器)单卡的服务容量效率57.5 agents/GPU[2]
Per System(每系统)整机/整机的绝对容量视系统规模而定
Artificial Analysis 官方说明:「per-megawatt figures are computed on measured accelerator power under load, not rated thermal design power (TDP)」——分母是实测加速器功耗(GPU die + HBM),不含 CPU、网络与冷却开销[1]。
Agents per Megawatt 的物理含义(示意) 1 MW 电力输入 GPU die + HBM(实测) CPU(不含) 网络(不含) 冷却(不含) 分母:仅加速器功耗 61,354 个并发 Agent(GB300 NVL72) Agent 1–100:编码轨迹 1(200 轮) Agent 101–200:编码轨迹 2(150 轮) …… Agent 61,254–61,354:编码轨迹 N 每个 Agent 满足 P25 ≥ 20 tok/s, P95 TTFT ≤ 10s
图 1|Agents per Megawatt 的物理含义:1 MW 实测加速器功耗输入,产出 61,354 个满足 SLO 的并发 Agent(据 Artificial Analysis 官方数据绘制[2])

三、测试方法:轨迹重放与 SLO 搜索Methodology

3.1轨迹数据集:真实编码 Agent 的「数字孪生」

属性实测数据基础设施含义
来源真实公共代码仓库 issue 解决轨迹(非合成)[1]负载形状由真实工作流决定,不可人为「优化」
轮数最多 200 轮[1]长会话对调度器与内存管理的持续压力
序列长度输入 5K–131K token,均值约 27K;轨迹总长 >100K[1]KV Cache 容量与复用策略成为一阶约束
输出长度中位约 150 token,P95 约 2K[1]大量短输出突发,考验调度器小请求处理
语言覆盖12+ 编程语言[1]负载多样性防止单一场景过拟合
数据集可见性私有;参与者仅获得代表性调优子集[1]防止「针对基准优化」的作弊

3.2容量搜索:指数爬坡 + 二分查找

对每个 SLO 层级,AA-AgentPerf 执行:指数爬坡( doubling load until target breaks)→ 二分查找(binary search)→ 在稳态窗口(所有 Agent 活跃 ≥30 秒)计算 P25 输出速度与 P95 TTFT,记录不违反 SLO 的最大并发数[1]。这一过程对每个层级重复,得到「容量-服务水平」的完整曲线。

3.3生产优化允许:与旧基准的关键区别

优化AA-AgentPerf 的态度旧基准的典型做法
KV Cache 复用允许——生产环境真实开启[1]通常关闭或忽略
推测解码(Speculative Decoding)允许[1]通常关闭
分离式 Prefill/Decode(Disaggregated)允许[1]通常不区分
推理框架与版本厂商自选,完整披露于 configurations browser[1]通常固定或忽略
准确性验证有质量控制——「optimization cannot buy capacity at the expense of output quality」[1]通常无
方法学含义:AA-AgentPerf 测量的是「部署栈的整体效能」而非「芯片的理论峰值」——同一硬件在不同推理框架、并行策略、推测解码配置下的结果可以显著不同。NVIDIA 官方博客明确将 20 倍优势归因于「extreme codesign across the full stack」[2]。

3.4工具调用的处理:CPU 模拟,GPU 隔离

AA-AgentPerf 的关键设计决策:工具调用不实际执行,而是用「代表性的 CPU 处理时间」模拟——NVIDIA 官方博客明确说明「Tool calls are not executed but simulated using representative CPU processing time, so differences in results reflect accelerated computing performance only」[2]。这意味着:

  • CPU 性能被刻意隔离:测试目标聚焦于 GPU/加速器,而非整机系统
  • 工具延迟被标准化:中位 1 秒的模拟工具延迟,确保不同系统间的公平比较[2]
  • 未来扩展方向:Artificial Analysis 在「What's next」中明确列出「Tool execution performance — testing CPU performance for executing agent tool calls as part of the benchmark」[1]

四、首轮结果与竞争力分析First Results & Competitive Landscape

4.1四组系统的完整对比(DeepSeek V4 Pro,SLO Tier 1)

系统架构Agents/MWAgents/GPU相对 H200 倍数配置提交方
NVIDIA GB300 NVL72Blackwell Ultra,72 GPU 机架级61,35457.5~23.7×NVIDIA[2]
NVIDIA B300(单节点)Blackwell,单节点21,053—~8.1×NVIDIA[2]
AMD MI355XInstinct,单卡3,551—~1.4×Artificial Analysis(非厂商)[1]
NVIDIA HGX H200Hopper,8 GPU2,5941.41.0×(基准)Artificial Analysis(非厂商)[1]

注:倍数按 61,354 / 2,594 ≈ 23.7 计算;NVIDIA 官方博客宣称「up to 20x」,可能对应特定 SLO 层级或四舍五入。AMD MI355X 与 H200 的配置由 Artificial Analysis 团队构建而非厂商提交,官方明确提示「headroom may be greater for the MI355X and H200」[1]。

图 2|AA-AgentPerf 首轮结果:每兆瓦并发 Agent 数(DeepSeek V4 Pro,SLO Tier 1,20 tok/s / TTFT ≤10s)。数据源:Artificial Analysis 官方榜单[1]。GB300 NVL72 的 61,354 为当前最高记录。

4.2三大发现:Rack-scale、代际跃迁、全栈优化

发现实测证据基础设施含义
Rack-scale 的效率优势GB300 NVL72(机架级)61,354 vs B300(单节点)21,053,同代芯片机架级仍有 ~3 倍优势[1]NVLink 域扩展、分离式推理拓扑、MoE 专家并行,使「整机架」成为新的性能单位
代际跃迁(Hopper → Blackwell)GB300 NVL72 vs H200:23.7 倍(Agents/MW)[2]不是单芯片改进,而是「72 GPU NVLink 域 + 定制 CUDA 内核 + TensorRT LLM 全栈」的系统级跃迁[2]
优化配置决定结果官方明确:「Testing with different kernel optimizations and serving configuration designs moved the results significantly」[1]「同一硬件,不同软件栈,不同结果」——推理框架、并行策略、推测解码配置成为竞争力组成部分

4.3NVIDIA 的竞争力叙事:从芯片到「每兆瓦产出」

NVIDIA 官方博客将 AA-AgentPerf 结果包装为「Blackwell 时代的基础设施叙事」[2]:

  • 技术归因:72 GPU NVLink scale-up 域、WideEP/DeepEP 的 MoE 专家并行、MXFP4/MXFP8 内核、通信与计算重叠的定制 CUDA 内核、TensorRT LLM 的 prefill/decode 分离[2]
  • 生产背书:Together AI 为 Cursor 提供实时推理、DeepInfra 为 Pam.ai 提供 AI 劳动力,均在 Blackwell 上运行 Agentic 工作负载[2]
  • 生态锁定:Baseten、DeepInfra、Together AI 已宣布在 Blackwell 上服务 DeepSeek V4 Pro Agentic 负载[2]
关键洞察:NVIDIA 的竞争力主张已从「FLOPS 更高」转向「每兆瓦能养活更多 Agent」——这是把「电力约束」转化为「采购理由」的营销重构。对于数据中心运营商,电力容量是硬约束;Agents/MW 直接回答了「同样 1 MW 电力,我的投资能多产出多少倍」。

五、CPU 厂商的角色与测试现状CPU Vendors: Role & Current Status

5.1当前测试范围:CPU 被刻意隔离

AA-AgentPerf 首轮结果的被测对象是 GPU/加速器系统(NVIDIA GB300/B300/H200、AMD MI355X),CPU 不在被测范围内。工具调用用「代表性的 CPU 处理时间」模拟,而非真实执行——这是刻意的设计选择,目的是「differences in results reflect accelerated computing performance only」[2]。

5.2CPU 厂商的潜在角色:三个维度

维度CPU 厂商的潜在竞争力AA-AgentPerf 现状
工具执行Agent 的工具调用(代码编译、测试运行、文件操作、数据库查询)本质上是 CPU 负载;Intel Xeon 与 AMD EPYC 在此有传统优势当前用模拟延迟隔离;未来计划「testing CPU performance for executing agent tool calls as part of the benchmark」[1]
内存容量与带宽长上下文(>100K token)的 KV Cache 需要大容量 CPU 内存作为溢出层;CXL 内存扩展是 Intel/AMD 的差异化方向当前未测量;分离式 prefill/decode 拓扑中 CPU 内存的角色待评估
整机系统CPU 是 GPU 系统的「指挥官」:任务调度、数据预处理、网络栈、存储 I/O 均依赖 CPU当前分母「GPU-only power」刻意排除 CPU;整机 TCO 分析在「What's next」中提及[1]

5.3为什么 CPU 厂商「也在测试」是误读

事实核查:截至 2026-07-27,AA-AgentPerf 的公开结果中没有 Intel 或 AMD CPU 作为独立被测对象。AMD MI355X 是 GPU(Instinct 系列),不是 CPU。用户提到的「CPU 厂商也在测试」可能源于以下混淆:(1) AMD 同时生产 CPU(EPYC)与 GPU(Instinct),MI355X 的测试结果被误读为「AMD CPU 表现」;(2) AA-AgentPerf 未来计划将「工具执行的 CPU 性能」纳入测试,被提前解读为「CPU 厂商已参与」;(3) NVIDIA 官方博客提到「representative CPU processing time」模拟,被误读为 CPU 实测。本报告如实标注:当前无 CPU 独立测试结果。
图 3|AA-AgentPerf 的测试范围演进(数据源:Artificial Analysis 官方「What's next」[1])。当前聚焦 GPU/加速器;CPU 工具执行性能、更长上下文(1M token)、成本/TCO 分析为已公布扩展方向。

六、暴露的基础设施瓶颈(逐项分析)Infrastructure Bottlenecks Exposed

1

电力成为硬约束:Agents/MW 取代 FLOPS 成为采购指标

官方自述
证据:Artificial Analysis 官方:「in a world where AI capacity is increasingly constrained by available power and the cost of energy, that question comes with a denominator」[1]。NVIDIA 官方:「Power, not silicon, is increasingly the binding constraint on agent deployments at scale」[2]。
Infra 含义:数据中心电力容量(MW)是固定资源,GPU 数量是弹性资源。Agents/MW 直接衡量「固定电力预算下的最大产出」,成为比「每卡性能」更真实的采购指标。
2

KV Cache 复用从「优化」变为「竞争力组成部分」

官方自述
证据:AA-AgentPerf 明确允许 KV Cache 复用、推测解码、分离式 prefill/decode——这些「生产优化」在旧基准中通常被关闭[1]。轨迹的「长共享前缀」结构使 KV 复用成为性能决定因素。
Infra 含义:推理框架的 KV Cache 管理能力(前缀缓存命中率、分层存储、驱逐策略)不再是「锦上添花」,而是 Agents/MW 的直接乘数。NVIDIA 将 WideEP/DeepEP 的 MoE 专家并行列为 20 倍优势的技术归因之一[2]。
3

调度器处理「短输出突发」的能力成为瓶颈

官方自述
证据:轨迹输出长度「中位约 150 token,P95 约 2K」——大量短输出(工具调用、代码编辑)穿插少量长推理[1]。官方明确:「bursts of short outputs stress schedulers」[1]。
Infra 含义:传统 LLM 服务优化「长输出吞吐」,而 Agent 负载是「大量小请求突发」——调度器的批处理策略、连续批处理(continuous batching)的粒度、小请求的排队延迟,成为新的性能瓶颈。
4

「闭环进度」 vs 「并发请求数」:吞吐定义的范式转移

官方自述
证据:AA-AgentPerf 测量「满足 SLO 的最大并发 Agent 数」,而非「系统总 token/秒」。高并发下系统总吞吐上升,但每 Agent 速度下降——Pareto 前沿的权衡被显式测量[1]。
Infra 含义:「并发 Agent 数」是比「并发请求数」更真实的容量指标——一个 Agent 占用系统资源数十分钟(200 轮),而非单次请求的几秒。容量规划必须从「请求/秒」转向「活跃 Agent 会话数」。
5

全栈协同设计:芯片、互连、框架、配置的「乘法效应」

官方自述
证据:NVIDIA 官方引用 Shruti Koparkar:「The complexity isn't additive; it's multiplicative」[2]。GB300 NVL72 的 20 倍优势来自 72 GPU NVLink 域 + 定制 CUDA 内核 + TensorRT LLM 的组合,而非单一组件。
Infra 含义:「买最好的芯片」不等于「得到最好的 Agents/MW」——推理框架版本、并行策略、推测解码配置、内核优化,每一层都是乘数因子。Artificial Analysis 明确:「serving configurations for DeepSeek V4 Pro improve on a near-daily basis」[1]。
6

厂商提交 vs 第三方配置:结果的可比性陷阱

推导
证据:首轮结果中,B300/GB300 配置由 NVIDIA 提交,H200/MI355X 配置由 Artificial Analysis 团队构建。官方明确提示:「headroom may be greater for the MI355X and H200, as their configurations were submitted by the Artificial Analysis team rather than a vendor team」[1]。
Infra 含义(推导):「同一硬件,厂商调优 vs 第三方调优」的结果差异可能很大——NVIDIA 的 20 倍优势部分来自「自家工程师最懂自家芯片」的配置优势。对比结果时,配置来源必须与硬件型号同时披露,否则可能高估厂商优势。
7

私有数据集与「不可复现」的张力

推导
证据:测试集私有,参与者仅获得代表性调优子集;完整数据集 held out 以防止 benchmark-targeted optimization[1]。
Infra 含义(推导):防作弊与可复现性存在结构性张力——私有数据集防止「针对基准优化」,但也使第三方无法独立验证结果。SWE-bench 的教训(500 题全污染)证明公开数据集必然被训练语料吞并;AA-AgentPerf 的私有路线是另一种选择,但其代价是「信任但无法验证」。
8

CPU 与工具执行的「测量盲区」

推导
证据:当前工具调用用模拟 CPU 延迟(中位 1 秒)隔离,未来计划才纳入真实 CPU 性能测试[1][2]。
Infra 含义(推导):Agent 的完整工作流中,工具执行(编译、测试、文件 I/O、数据库查询)可能占端到端延迟的 30–50%(本报告估算,非官方数据)。当前基准只测量「GPU 推理时间」,「CPU 工具执行时间」被标准化屏蔽——这意味着 Agents/MW 数字可能高估真实部署容量,因为真实部署中 CPU 工具执行可能成为瓶颈。
未见公开数据:真实生产环境中工具执行占 Agent 端到端延迟的比例。

七、未披露与使用边界Undisclosed & Boundaries

调查立场:AA-AgentPerf 处于开放提交期(2026-06-12 起),首轮结果仅覆盖 DeepSeek V4 Pro 的 4 组系统,gpt-oss-120b 结果「coming soon」。以下清单标注「评估其结论强度时应有的保留」。
未披露项影响
各系统在不同 SLO 层级(Tier 2/3)的完整 Agents/MW 数字仅 Tier 1 有公开数字,高端 SLO 下的竞争格局未知
NVIDIA 提交配置与 Artificial Analysis 自建配置的具体差异无法量化「厂商调优优势」对结果的贡献度
轨迹数据集的完整规模(条数、总 token 量)工作负载的统计代表性无法独立评估
「准确性验证」的具体方法与阈值质量控制的有效性无法复核
私有数据集的更新机制与防污染策略长期有效性无法评估
CPU 工具执行性能测试的具体时间表与指标设计「CPU 厂商参与」的实质内容未知
成本/TCO 分析(agent capacity per $/hr、cost per task)仅有计划,无公开数字

使用边界:本调查的结论适用于「推理服务基础设施」;AA-AgentPerf 不测量模型能力(那是 SWE-bench 等任务基准的职责),而测量「给定模型在给定轨迹下的服务容量与能效」。其 Agents/MW 指标与 MLPerf Agentic Inference 的 Pareto 前沿形成互补:前者测「固定 SLO 下的最大容量」,后者测「并发-速度权衡曲线」。当前无 CPU 独立测试结果,任何关于「CPU 厂商表现」的说法均为误读。

参考文献References

  1. [1] Artificial Analysis. First results from AA-AgentPerf: the hardware benchmark for the agent era. 2026-06-12. https://artificialanalysis.ai/articles/aa-agentperf
  2. [2] NVIDIA. NVIDIA Blackwell Leads on First Agentic AI Infrastructure Benchmark. 2026-06-12. https://blogs.nvidia.com/blog/nvidia-blackwell-agentperf-artificial-analysis/
  3. [3] Artificial Analysis. AI Hardware Benchmarking & Performance Analysis(AA-AgentPerf 榜单与配置浏览器). https://artificialanalysis.ai/benchmarks/hardware
  4. [4] NVIDIA Developer Blog. NVIDIA Achieves Leading Agentic Coding Performance on First Agentic AI Benchmark. 2026-06-12. https://developer.nvidia.com/blog/nvidia-achieves-leading-agentic-coding-performance-on-first-agentic-ai-benchmark/