一、基准概览与核心数字Overview
AA-AgentPerf 是 Artificial Analysis(独立 AI 评测机构)于 2026 年 6 月 12 日发布的硬件基准,定位为「业界首个专为 AI Agent 设计的推理基准」。其核心主张是:2026 年的主流 AI 负载与旧基准设计时瞄准的东西早已不同——编码 Agent 运行数百轮、穿插推理与工具调用、上下文常态化超过 100K token,而旧基准测量的是定长合成请求、且关闭了生产环境真实开启的优化[1]。
二、测试指标拆解:Agents per Megawatt 是什么The Lead Metric
2.1为什么不用「每秒 token 数」
Artificial Analysis 的官方解释是:峰值吞吐容易被「堆并发」刷高——把并发数堆到每个 Agent 都爬行,系统总吞吐数字依然好看。AA-AgentPerf 的做法是固定服务水平(SLO),然后问「系统能扩展到什么程度而不跌破这个服务水平」[1]。
2.2三级 SLO:从市场真实服务水平倒推
| SLO 层级 | P25 输出速度(token/秒/Agent) | P95 TTFT(秒) | 对应用户体验 |
|---|---|---|---|
| Tier 1 | 20 | ≤ 10 | 可接受的交互底线 |
| Tier 2 | 60 | ≤ 5 | 流畅的编码助手体验 |
| Tier 3 | 180 | ≤ 3 | 高端实时交互 |
SLO 层级来源于 Artificial Analysis 对 serverless API 提供商的实际观测数据——即「今天市场上真实存在的服务质量水平」,而非理论目标[1]。
2.3三种归一化视角
| 归一化方式 | 回答的问题 | 首轮 GB300 NVL72 数字(SLO Tier 1) |
|---|---|---|
| Per Megawatt(每兆瓦) | 给定电力预算,能养活多少 Agent? | 61,354 agents/MW[2] |
| Per Accelerator(每加速器) | 单卡的服务容量效率 | 57.5 agents/GPU[2] |
| Per System(每系统) | 整机/整机的绝对容量 | 视系统规模而定 |
三、测试方法:轨迹重放与 SLO 搜索Methodology
3.1轨迹数据集:真实编码 Agent 的「数字孪生」
| 属性 | 实测数据 | 基础设施含义 |
|---|---|---|
| 来源 | 真实公共代码仓库 issue 解决轨迹(非合成)[1] | 负载形状由真实工作流决定,不可人为「优化」 |
| 轮数 | 最多 200 轮[1] | 长会话对调度器与内存管理的持续压力 |
| 序列长度 | 输入 5K–131K token,均值约 27K;轨迹总长 >100K[1] | KV Cache 容量与复用策略成为一阶约束 |
| 输出长度 | 中位约 150 token,P95 约 2K[1] | 大量短输出突发,考验调度器小请求处理 |
| 语言覆盖 | 12+ 编程语言[1] | 负载多样性防止单一场景过拟合 |
| 数据集可见性 | 私有;参与者仅获得代表性调优子集[1] | 防止「针对基准优化」的作弊 |
3.2容量搜索:指数爬坡 + 二分查找
对每个 SLO 层级,AA-AgentPerf 执行:指数爬坡( doubling load until target breaks)→ 二分查找(binary search)→ 在稳态窗口(所有 Agent 活跃 ≥30 秒)计算 P25 输出速度与 P95 TTFT,记录不违反 SLO 的最大并发数[1]。这一过程对每个层级重复,得到「容量-服务水平」的完整曲线。
3.3生产优化允许:与旧基准的关键区别
| 优化 | AA-AgentPerf 的态度 | 旧基准的典型做法 |
|---|---|---|
| KV Cache 复用 | 允许——生产环境真实开启[1] | 通常关闭或忽略 |
| 推测解码(Speculative Decoding) | 允许[1] | 通常关闭 |
| 分离式 Prefill/Decode(Disaggregated) | 允许[1] | 通常不区分 |
| 推理框架与版本 | 厂商自选,完整披露于 configurations browser[1] | 通常固定或忽略 |
| 准确性验证 | 有质量控制——「optimization cannot buy capacity at the expense of output quality」[1] | 通常无 |
3.4工具调用的处理:CPU 模拟,GPU 隔离
AA-AgentPerf 的关键设计决策:工具调用不实际执行,而是用「代表性的 CPU 处理时间」模拟——NVIDIA 官方博客明确说明「Tool calls are not executed but simulated using representative CPU processing time, so differences in results reflect accelerated computing performance only」[2]。这意味着:
四、首轮结果与竞争力分析First Results & Competitive Landscape
4.1四组系统的完整对比(DeepSeek V4 Pro,SLO Tier 1)
| 系统 | 架构 | Agents/MW | Agents/GPU | 相对 H200 倍数 | 配置提交方 |
|---|---|---|---|---|---|
| NVIDIA GB300 NVL72 | Blackwell Ultra,72 GPU 机架级 | 61,354 | 57.5 | ~23.7× | NVIDIA[2] |
| NVIDIA B300(单节点) | Blackwell,单节点 | 21,053 | — | ~8.1× | NVIDIA[2] |
| AMD MI355X | Instinct,单卡 | 3,551 | — | ~1.4× | Artificial Analysis(非厂商)[1] |
| NVIDIA HGX H200 | Hopper,8 GPU | 2,594 | 1.4 | 1.0×(基准) | Artificial Analysis(非厂商)[1] |
注:倍数按 61,354 / 2,594 ≈ 23.7 计算;NVIDIA 官方博客宣称「up to 20x」,可能对应特定 SLO 层级或四舍五入。AMD MI355X 与 H200 的配置由 Artificial Analysis 团队构建而非厂商提交,官方明确提示「headroom may be greater for the MI355X and H200」[1]。
4.2三大发现:Rack-scale、代际跃迁、全栈优化
| 发现 | 实测证据 | 基础设施含义 |
|---|---|---|
| Rack-scale 的效率优势 | GB300 NVL72(机架级)61,354 vs B300(单节点)21,053,同代芯片机架级仍有 ~3 倍优势[1] | NVLink 域扩展、分离式推理拓扑、MoE 专家并行,使「整机架」成为新的性能单位 |
| 代际跃迁(Hopper → Blackwell) | GB300 NVL72 vs H200:23.7 倍(Agents/MW)[2] | 不是单芯片改进,而是「72 GPU NVLink 域 + 定制 CUDA 内核 + TensorRT LLM 全栈」的系统级跃迁[2] |
| 优化配置决定结果 | 官方明确:「Testing with different kernel optimizations and serving configuration designs moved the results significantly」[1] | 「同一硬件,不同软件栈,不同结果」——推理框架、并行策略、推测解码配置成为竞争力组成部分 |
4.3NVIDIA 的竞争力叙事:从芯片到「每兆瓦产出」
NVIDIA 官方博客将 AA-AgentPerf 结果包装为「Blackwell 时代的基础设施叙事」[2]:
- 技术归因:72 GPU NVLink scale-up 域、WideEP/DeepEP 的 MoE 专家并行、MXFP4/MXFP8 内核、通信与计算重叠的定制 CUDA 内核、TensorRT LLM 的 prefill/decode 分离[2]
- 生产背书:Together AI 为 Cursor 提供实时推理、DeepInfra 为 Pam.ai 提供 AI 劳动力,均在 Blackwell 上运行 Agentic 工作负载[2]
- 生态锁定:Baseten、DeepInfra、Together AI 已宣布在 Blackwell 上服务 DeepSeek V4 Pro Agentic 负载[2]
五、CPU 厂商的角色与测试现状CPU Vendors: Role & Current Status
5.1当前测试范围:CPU 被刻意隔离
AA-AgentPerf 首轮结果的被测对象是 GPU/加速器系统(NVIDIA GB300/B300/H200、AMD MI355X),CPU 不在被测范围内。工具调用用「代表性的 CPU 处理时间」模拟,而非真实执行——这是刻意的设计选择,目的是「differences in results reflect accelerated computing performance only」[2]。
5.2CPU 厂商的潜在角色:三个维度
| 维度 | CPU 厂商的潜在竞争力 | AA-AgentPerf 现状 |
|---|---|---|
| 工具执行 | Agent 的工具调用(代码编译、测试运行、文件操作、数据库查询)本质上是 CPU 负载;Intel Xeon 与 AMD EPYC 在此有传统优势 | 当前用模拟延迟隔离;未来计划「testing CPU performance for executing agent tool calls as part of the benchmark」[1] |
| 内存容量与带宽 | 长上下文(>100K token)的 KV Cache 需要大容量 CPU 内存作为溢出层;CXL 内存扩展是 Intel/AMD 的差异化方向 | 当前未测量;分离式 prefill/decode 拓扑中 CPU 内存的角色待评估 |
| 整机系统 | CPU 是 GPU 系统的「指挥官」:任务调度、数据预处理、网络栈、存储 I/O 均依赖 CPU | 当前分母「GPU-only power」刻意排除 CPU;整机 TCO 分析在「What's next」中提及[1] |
5.3为什么 CPU 厂商「也在测试」是误读
六、暴露的基础设施瓶颈(逐项分析)Infrastructure Bottlenecks Exposed
电力成为硬约束:Agents/MW 取代 FLOPS 成为采购指标
官方自述KV Cache 复用从「优化」变为「竞争力组成部分」
官方自述调度器处理「短输出突发」的能力成为瓶颈
官方自述「闭环进度」 vs 「并发请求数」:吞吐定义的范式转移
官方自述全栈协同设计:芯片、互连、框架、配置的「乘法效应」
官方自述厂商提交 vs 第三方配置:结果的可比性陷阱
推导私有数据集与「不可复现」的张力
推导七、未披露与使用边界Undisclosed & Boundaries
| 未披露项 | 影响 |
|---|---|
| 各系统在不同 SLO 层级(Tier 2/3)的完整 Agents/MW 数字 | 仅 Tier 1 有公开数字,高端 SLO 下的竞争格局未知 |
| NVIDIA 提交配置与 Artificial Analysis 自建配置的具体差异 | 无法量化「厂商调优优势」对结果的贡献度 |
| 轨迹数据集的完整规模(条数、总 token 量) | 工作负载的统计代表性无法独立评估 |
| 「准确性验证」的具体方法与阈值 | 质量控制的有效性无法复核 |
| 私有数据集的更新机制与防污染策略 | 长期有效性无法评估 |
| CPU 工具执行性能测试的具体时间表与指标设计 | 「CPU 厂商参与」的实质内容未知 |
| 成本/TCO 分析(agent capacity per $/hr、cost per task) | 仅有计划,无公开数字 |
使用边界:本调查的结论适用于「推理服务基础设施」;AA-AgentPerf 不测量模型能力(那是 SWE-bench 等任务基准的职责),而测量「给定模型在给定轨迹下的服务容量与能效」。其 Agents/MW 指标与 MLPerf Agentic Inference 的 Pareto 前沿形成互补:前者测「固定 SLO 下的最大容量」,后者测「并发-速度权衡曲线」。当前无 CPU 独立测试结果,任何关于「CPU 厂商表现」的说法均为误读。
参考文献References
- [1] Artificial Analysis. First results from AA-AgentPerf: the hardware benchmark for the agent era. 2026-06-12. https://artificialanalysis.ai/articles/aa-agentperf
- [2] NVIDIA. NVIDIA Blackwell Leads on First Agentic AI Infrastructure Benchmark. 2026-06-12. https://blogs.nvidia.com/blog/nvidia-blackwell-agentperf-artificial-analysis/
- [3] Artificial Analysis. AI Hardware Benchmarking & Performance Analysis(AA-AgentPerf 榜单与配置浏览器). https://artificialanalysis.ai/benchmarks/hardware
- [4] NVIDIA Developer Blog. NVIDIA Achieves Leading Agentic Coding Performance on First Agentic AI Benchmark. 2026-06-12. https://developer.nvidia.com/blog/nvidia-achieves-leading-agentic-coding-performance-on-first-agentic-ai-benchmark/