Benchmark Investigation · MLCommons · 2026-07

MLPerf Agentic Inference 深度调查
——推理基准进入「轨迹时代」暴露的基础设施瓶颈

2026 年 7 月 8 日,MLCommons 发布 Agentic Inference 基准(数据中心版),7 月 9 日发布 Edge Agentic Inference(v6.1 征集,截止 7 月 31 日)。这是 MLPerf 历史上首次把「多轮轨迹」而非「单轮请求」作为测量对象:613 条真实轨迹(113 编码+500 工作流)、三级准确性门禁、Pareto 前沿替代单一吞吐。本调查基于 MLCommons 官方两篇文章全文,分析其设计选择背后的基础设施瓶颈。

日期:2026 年 7 月 27 日 调查对象:MLCommons 官方发布(2026-07-08/09) 状态:征集期,尚无公开提交结果 ← 返回主报告 基础设施瓶颈诊断

一、基准概览与核心数字Overview

MLPerf Inference 是 MLCommons 运营的硬件中立推理性能基准(始于 2018 年训练基准,后扩展至推理)。2026 年 7 月发布的 Agentic Inference 是其首个「多轮轨迹」基准:不再测量「单请求进、单答案出」的孤立推理,而是测量「上下文持续增长、轮次严格依赖、工具调用穿插」的完整 Agent 会话。官方明确列出四个使服务问题发生本质变化的因素:上下文增长、KV Cache 复用成为关键优化、输出长度差异巨大、轮次依赖使吞吐变为「闭环进度」度量[1]。

613 条
多轮轨迹总量(113 编码+500 工作流)[1]
30,335 轮
客户端发起轮次(assistant 轮次 30,328)[1]
262,144
Kimi K2.6 / Qwen3.6-35B-A3B 的上下文窗口(token)[1]
86.23%
Edge 版 BFCL v4 单轮参考准确率(Qwen3.6-27B-Q4_K_M)[2]
~16.5 GB
27B 模型 Q4_K_M 量化后显存占用(vs BF16 约 54 GB)[2]
-8 pp
开启 reasoning 后准确率不升反降(86.23% → 78.19%)[2]
调查结论Agentic Inference 暴露的核心基础设施瓶颈不是「GPU 不够快」,而是「推理服务栈为多轮轨迹做了多少专门设计」:KV Cache 复用从「可选优化」变为「计分前提」;会话路由(X-Session-ID)成为性能变量;上下文墙(32K/262K)使长轨迹的截断管理成为一等公民;准确性门禁(OSL/Inline/Standalone 三级)证明「速度不能以质量为代价」需要被制度化。这些设计选择共同指向一个事实:Agent 时代的推理基础设施,与单轮 Chatbot 时代完全不同。

二、设计选择拆解:为什么这样测Design Rationale

2.1模型选择:两种架构、两种服务压力

Kimi K2.6Qwen3.6-35B-A3B
架构MoE + MLAMoE + Gated DeltaNet/Attention
参数1T 总参 / 32B 激活35B 总参 / 3B 激活
上下文262,144 token262,144 token
推测解码NVIDIA Eagle3 头原生 MTP(Multi-Token Prediction)
设计意图代表「大模型档案」的顶级编码 Agent代表「紧凑高效」的 GDN 新架构

两模型不合并评分,各自独立出结果——MLCommons 明确说明这是为了「覆盖不同的服务行为、架构选择与推测解码路径」[1]。Edge 版则固定为 Qwen3.6-27B(Q4_K_M GGUF,llama.cpp),理由是其「Apache 2.0 开源、工具调用能力强、原生 MTP 头、官方权重易得」[2]。

2.2数据集:两种轨迹形状,两种基础设施压力

Agentic Coding(编码)Agentic Workflow(工作流)
规模113 条轨迹 / 15,981 客户端轮次500 条轨迹 / 4,316 客户端轮次
来源DataCurve DeepSWE 数据集(真实仓库 issue)[1]Workato 企业客服/编排合成轨迹[1]
轨迹特征深:中位数十轮,历史随命令输出/文件内容/测试日志持续增长浅:轮次较少,但系统提示极大(大量工具定义与业务规则)
主要压力KV Cache 容量与长上下文调度共享前缀复用与路由局部性
组合意图防止系统只优化一种流量形状,共同压力测试「上下文感知路由」[1]

2.3客户端设计:七项机制,七项基础设施诉求

MLPerf Endpoints 客户端的七项设计,每一项都对应一个基础设施痛点[1]:

机制作用暴露的 Infra 瓶颈
闭环重放(Closed-loop replay)单会话一次一轮,等完整响应后再发下一轮轮次依赖使「并发请求数」≠「闭环进度」
目标并发控制负载生成器控制活跃会话数,不破坏轮次依赖高并发下每用户进度与系统吞吐的权衡
轮间延迟(Inter-turn delay)数据集提供的等待时间,不计入服务延迟工具执行时间需要从模型延迟中剥离
会话感知路由(X-Session-ID)稳定会话头,路由器可保持 KV Cache 局部性路由策略成为性能变量
缓存加盐(Cache salting)系统提示加确定性盐标记,允许轨迹内复用、阻止跨轨迹复用防止「作弊式」缓存复用导致结果失真
确定性提示重建未来提示从预录数据集构建,而非实时模型输出保证性能可复现,同时仍测量生成输出
生成 token 缓存清除引入空白字符清除 KV Cache 中的生成 token确保性能独立于轨迹生成所用系统

2.4性能与准确性:Pareto 前沿 + 三级门禁

性能指标不是单一吞吐,而是固定并发下的 Pareto 曲线:X 轴为「每用户输出 token/秒」(个体进度),Y 轴为「系统输出 token/秒」(聚合吞吐)[1]。准确性采用三级门禁,全部必须在同一性能配置下通过[1]:

级别作用Kimi K2.6 阈值Qwen3.6-35B-A3B 阈值
OSL 均值防止通过截断响应或偏移答案长度分布来「刷吞吐」[404, 494][355, 434]
Inline 准确性在性能运行本身上比对输出与 ground truth(编码工具调用/工作流意图码)63.08%55.86%
Standalone 准确性任务级端到端能力(200 题 SWE-bench Verified)76.5%67.0%
MLCommons 官方说明:「三级门禁确保 Pareto 曲线测量的是『可用的 Agent 进度』,而非更短、更低质量、更容易服务的响应。」[1]
Agentic Inference 的多轮轨迹结构(官方 Figure 1 重绘) Turn 1: "Fix this bug" tool call Turn 2: tool output tool call Turn 3: user input response Turn N tool call 上下文随轮次持续增长:每轮包含此前全部历史 Turn 1 历史 Turn 1+2 历史 Turn 1+2+3 历史 Turn 1+2+3+…+N 历史(可达 100K+ token)
图 1|Agentic Inference 的多轮轨迹结构:上下文随轮次单调增长,KV Cache 复用成为关键(据 MLCommons 官方 Figure 1 重绘[1])

三、暴露的基础设施瓶颈(逐项分析)Infrastructure Bottlenecks Exposed

1

KV Cache 从「优化」变为「计分前提」

官方自述
证据:官方明确将「KV-cache reuse」列为「critical serving optimization for performance and efficiency」,并设计「缓存加盐」机制防止跨轨迹复用作弊[1]。编码轨迹的上下文「runs to 100K+ tokens」[2]。
Infra 含义:单轮推理时代,KV Cache 复用是可选优化;多轮轨迹时代,它是性能的决定性变量。没有前缀缓存、会话亲和路由、KV 分层存储的推理栈,在 Agentic 工作负载下将结构性落后。
2

会话路由成为性能变量:X-Session-ID 的必要性

官方自述
证据:客户端为每条轨迹发送稳定的 X-Session-ID 头,「so routers can preserve KV-cache locality」[1]。这是 MLPerf 首次将「路由策略」纳入基准设计。
Infra 含义:负载均衡器/路由器不再是透明的网络设备,而是推理性能的组成部分。会话亲和调度、KV Cache 感知的流量分发,是 Agent 服务栈的必备能力。
3

上下文墙:32K/262K 的硬性约束与截断管理

官方自述
证据:Edge 版固定服务上下文为 32K token(「a controlled benchmark parameter, not a device ceiling」),长轨迹会耗尽它,「makes context growth and truncation first-order, measured effects」[2]。数据中心版模型上下文为 262,144 token[1]。
Infra 含义:上下文窗口不是越大越好,而是「如何在固定窗口内管理增长」——截断策略、摘要压缩、关键信息保留,是长轨迹 Agent 的基础设施能力。
4

吞吐与延迟的解耦:Pareto 前沿的必要性

官方自述
证据:官方明确:「As concurrency increases, the system may complete more total work while each individual agent progresses more slowly. The Pareto curve makes this tradeoff visible.」[1]
Infra 含义:单轮基准的「越高并发越好」在 Agent 场景失效——高并发提升系统吞吐,但降低每用户进度。推理栈需要同时优化两个维度,且需要按并发点扫描的完整 Pareto 曲线而非单点数字。
5

速度与质量的权衡需要制度化:三级准确性门禁

官方自述
证据:OSL 均值防止「截断响应刷吞吐」;Inline 准确性在性能运行本身上校验;Standalone 用 200 题 SWE-bench Verified 做任务级端到端验证[1]。Edge 版 BFCL v4 单轮参考准确率 86.23%,开启 reasoning 后降至 78.19%(-8pp)[2]。
Infra 含义:「更快但答得更差」在单轮基准中可能被容忍,在 Agent 场景中会被三级门禁拦截。推理优化(量化、推测解码、缓存策略)必须在同一配置下同时满足速度与质量门槛。
6

量化是边缘部署的「入场券」:Q4_K_M 的 3.3 倍显存压缩

官方自述
证据:27B 模型 BF16 需约 54 GB 显存,Q4_K_M 量化后约 16.5 GB(约 3.3 倍压缩),精度损失约 2–5%[2]。Edge 版固定为单加速器、单用户、32K 上下文。
Infra 含义:边缘 Agent 部署的显存墙是硬约束——全精度前沿模型无法放入单边缘加速器,量化从「优化」变为「必需」。量化校准(imatrix)、注意力块高精度保留、GGUF 生态,是边缘推理基础设施的核心组件。
7

工作负载的稀缺性:真实轨迹是「不可再生资源」

推导
证据:编码轨迹来自 DataCurve DeepSWE(真实仓库 issue),工作流轨迹来自 Workato 企业合成数据。Workato 官方文章指出:「Enterprise workflows are the scarce, valuable part, and they're exactly what generic or scraped data fails to capture」[3]。
Infra 含义(推导):与 SWE-bench 的「题可以再造」不同,Agentic 工作负载的「真实轨迹」难以批量生产——需要真实企业工作流的知识(工具、业务规则、任务结构)。这意味着:拥有真实生产轨迹的公司(Workato、DataCurve)在基准生态中拥有结构性话语权;通用爬虫数据无法替代。
未见公开数据:轨迹的采集成本、脱敏流程、是否开放下载。
8

基准的「 freshness 」困境:模型与轨迹的时效竞赛

推导
证据:数据中心版选用 Kimi K2.6 与 Qwen3.6-35B-A3B(2026 年发布);Edge 版选用 Qwen3.6-27B(2026-04-22 发布)[1][2]。MLPerf 历史上每 6 个月更新一次版本。
Infra 含义(推导):Agentic 基准的「代表性」随模型迭代快速衰减——今天的前沿模型在 6 个月后可能已非部署主流。MLPerf 的固定版本周期与 Agent 领域的月级迭代速度存在结构性张力;基准的「当前性」本身成为需要维护的基础设施资产。

四、关键数据复核Data Verification

4.1数据中心版 vs 边缘版对比

数据中心 Agentic Inference(2026-07-08)Edge Agentic Inference(2026-07-09,v6.1 征集)
模型Kimi K2.6(1T/32B)+ Qwen3.6-35B-A3B(35B/3B)Qwen3.6-27B(Q4_K_M GGUF,llama.cpp)
上下文262,144 token32,768 token(固定基准参数)
轨迹613 条(113 编码+500 工作流)20 条编码对话 / 1,007 轮(无溢出 32K)
并发模式目标并发扫描,Pareto 前沿单流(target_concurrency=1)
性能指标每用户 token/秒 × 系统 token/秒(Pareto)TTFT/TPOT/端到端轮延迟(p50/p90/p99/max)
准确性门禁OSL + Inline + Standalone(200 题 SWE-bench Verified)BFCL v4 单轮(~995 样本,86.23% 参考)
提交状态参考实现已发布(MLPerf Endpoints)征集中,截止 2026-07-31

4.2Edge 版准确性参考数据(Qwen3.6-27B-Q4_K_M)

类别准确率样本量说明
non_live (AST)82.59%~712非实时单轮函数调用
live84.12%~171实时单轮函数调用
hallucination97.16%~112拒答无关工具
Overall(门禁)86.23%~995样本加权
non_live-normalized(门禁)87.96%—三类等权平均

通过阈值:Overall ≥ 83.64%(0.97×86.23%),non_live-normalized ≥ 85.32%(0.97×87.96%)[2]。

图 2|Edge Agentic 版 BFCL v4 单轮准确性参考(数据源:MLCommons 官方[2])。Reasoning-off 为参考配置:开启 reasoning 后准确率反降 8pp 且耗时增加约 60%。

4.3推理代际演进:从 ResNet-50 到 Agentic Trajectory

图 3|MLPerf Inference 工作负载演进(数据源:MLCommons 官方发布[1][4][5])。v5.0 首次 LLM 超越图像分类;v6.0 引入 GPT-OSS 120B/DeepSeek-R1/文本生成视频;v6.1 首次引入多轮 Agentic 轨迹。

五、未披露与使用边界Undisclosed & Boundaries

调查立场:Agentic Inference 目前处于征集期(Edge 版截止 2026-07-31,数据中心版 2026 年 9 月),尚无公开提交结果。以下分析全部基于 MLCommons 官方设计文档,任何「性能数字」均为参考实现的预期值,不是实测提交结果。
未披露项影响
数据中心版的参考实现性能数字(Pareto 曲线具体坐标)无法预估当前硬件的达标难度
轨迹数据集的完整下载与使用协议社区无法独立复现与审计
「缓存加盐」的具体盐值与验证逻辑反作弊机制的细节不透明
Standalone 准确性中 200 题 SWE-bench Verified 的具体选题与 SWE-bench 家族其他成员的分数无法直接对齐
Edge 版在不同边缘加速器上的参考延迟数字「便携性验证」的具体结果未公开
轨迹采集的成本与脱敏流程工作负载的可持续生产能力无法评估

使用边界:本调查的结论适用于「推理服务基础设施」;Agentic Inference 不测量模型能力(那是 SWE-bench 等任务基准的职责),而测量「给定模型在给定轨迹下的服务效率」。其 Pareto 前沿与三级门禁的设计,与 SWE-bench 的「二值解决率」形成互补:前者测「系统能不能高效跑」,后者测「模型能不能做对」。

参考文献References

  1. [1] MLCommons. Agentic Inference for MLPerf Inference. 2026-07-08. https://mlcommons.org/2026/07/agentic-inference-for-mlperf-inference/
  2. [2] MLCommons Edge LLM Taskforce. Call for Submission: Edge Agentic Inference Benchmark for MLPerf Inference v6.1. 2026-07-09. https://mlcommons.org/2026/07/mlperf-inference-v61-edge-agentic/
  3. [3] Workato. Workato co-builds the first MLPerf Enterprise Agentic Inference Benchmark with AMD, Intel, NVIDIA, and MLCommons. 2026-07-08. https://www.workato.com/the-connector/mlperf-enterprise-agentic-inference-benchmark/
  4. [4] MLCommons. MLCommons Releases New MLPerf Inference v5.0 Benchmark Results. 2025-04-02. https://mlcommons.org/2025/04/mlperf-inference-v5-0-results/
  5. [5] MLCommons. MLCommons Releases New MLPerf Inference v6.0 Benchmark Results. 2026-04-01. https://mlcommons.org/2026/04/mlperf-inference-v6-0-results/
  6. [6] MLCommons. MLCommons Releases New MLPerf Inference v5.1 Benchmark Results. 2025-09-09. https://mlcommons.org/2025/09/mlperf-inference-v5-1-results/