一、基准概览与核心数字Overview
MLPerf Inference 是 MLCommons 运营的硬件中立推理性能基准(始于 2018 年训练基准,后扩展至推理)。2026 年 7 月发布的 Agentic Inference 是其首个「多轮轨迹」基准:不再测量「单请求进、单答案出」的孤立推理,而是测量「上下文持续增长、轮次严格依赖、工具调用穿插」的完整 Agent 会话。官方明确列出四个使服务问题发生本质变化的因素:上下文增长、KV Cache 复用成为关键优化、输出长度差异巨大、轮次依赖使吞吐变为「闭环进度」度量[1]。
二、设计选择拆解:为什么这样测Design Rationale
2.1模型选择:两种架构、两种服务压力
| Kimi K2.6 | Qwen3.6-35B-A3B | |
|---|---|---|
| 架构 | MoE + MLA | MoE + Gated DeltaNet/Attention |
| 参数 | 1T 总参 / 32B 激活 | 35B 总参 / 3B 激活 |
| 上下文 | 262,144 token | 262,144 token |
| 推测解码 | NVIDIA Eagle3 头 | 原生 MTP(Multi-Token Prediction) |
| 设计意图 | 代表「大模型档案」的顶级编码 Agent | 代表「紧凑高效」的 GDN 新架构 |
两模型不合并评分,各自独立出结果——MLCommons 明确说明这是为了「覆盖不同的服务行为、架构选择与推测解码路径」[1]。Edge 版则固定为 Qwen3.6-27B(Q4_K_M GGUF,llama.cpp),理由是其「Apache 2.0 开源、工具调用能力强、原生 MTP 头、官方权重易得」[2]。
2.2数据集:两种轨迹形状,两种基础设施压力
| Agentic Coding(编码) | Agentic Workflow(工作流) | |
|---|---|---|
| 规模 | 113 条轨迹 / 15,981 客户端轮次 | 500 条轨迹 / 4,316 客户端轮次 |
| 来源 | DataCurve DeepSWE 数据集(真实仓库 issue)[1] | Workato 企业客服/编排合成轨迹[1] |
| 轨迹特征 | 深:中位数十轮,历史随命令输出/文件内容/测试日志持续增长 | 浅:轮次较少,但系统提示极大(大量工具定义与业务规则) |
| 主要压力 | KV Cache 容量与长上下文调度 | 共享前缀复用与路由局部性 |
| 组合意图 | 防止系统只优化一种流量形状,共同压力测试「上下文感知路由」[1] | |
2.3客户端设计:七项机制,七项基础设施诉求
MLPerf Endpoints 客户端的七项设计,每一项都对应一个基础设施痛点[1]:
| 机制 | 作用 | 暴露的 Infra 瓶颈 |
|---|---|---|
| 闭环重放(Closed-loop replay) | 单会话一次一轮,等完整响应后再发下一轮 | 轮次依赖使「并发请求数」≠「闭环进度」 |
| 目标并发控制 | 负载生成器控制活跃会话数,不破坏轮次依赖 | 高并发下每用户进度与系统吞吐的权衡 |
| 轮间延迟(Inter-turn delay) | 数据集提供的等待时间,不计入服务延迟 | 工具执行时间需要从模型延迟中剥离 |
| 会话感知路由(X-Session-ID) | 稳定会话头,路由器可保持 KV Cache 局部性 | 路由策略成为性能变量 |
| 缓存加盐(Cache salting) | 系统提示加确定性盐标记,允许轨迹内复用、阻止跨轨迹复用 | 防止「作弊式」缓存复用导致结果失真 |
| 确定性提示重建 | 未来提示从预录数据集构建,而非实时模型输出 | 保证性能可复现,同时仍测量生成输出 |
| 生成 token 缓存清除 | 引入空白字符清除 KV Cache 中的生成 token | 确保性能独立于轨迹生成所用系统 |
2.4性能与准确性:Pareto 前沿 + 三级门禁
性能指标不是单一吞吐,而是固定并发下的 Pareto 曲线:X 轴为「每用户输出 token/秒」(个体进度),Y 轴为「系统输出 token/秒」(聚合吞吐)[1]。准确性采用三级门禁,全部必须在同一性能配置下通过[1]:
| 级别 | 作用 | Kimi K2.6 阈值 | Qwen3.6-35B-A3B 阈值 |
|---|---|---|---|
| OSL 均值 | 防止通过截断响应或偏移答案长度分布来「刷吞吐」 | [404, 494] | [355, 434] |
| Inline 准确性 | 在性能运行本身上比对输出与 ground truth(编码工具调用/工作流意图码) | 63.08% | 55.86% |
| Standalone 准确性 | 任务级端到端能力(200 题 SWE-bench Verified) | 76.5% | 67.0% |
三、暴露的基础设施瓶颈(逐项分析)Infrastructure Bottlenecks Exposed
KV Cache 从「优化」变为「计分前提」
官方自述会话路由成为性能变量:X-Session-ID 的必要性
官方自述上下文墙:32K/262K 的硬性约束与截断管理
官方自述吞吐与延迟的解耦:Pareto 前沿的必要性
官方自述速度与质量的权衡需要制度化:三级准确性门禁
官方自述量化是边缘部署的「入场券」:Q4_K_M 的 3.3 倍显存压缩
官方自述工作负载的稀缺性:真实轨迹是「不可再生资源」
推导四、关键数据复核Data Verification
4.1数据中心版 vs 边缘版对比
| 数据中心 Agentic Inference(2026-07-08) | Edge Agentic Inference(2026-07-09,v6.1 征集) | |
|---|---|---|
| 模型 | Kimi K2.6(1T/32B)+ Qwen3.6-35B-A3B(35B/3B) | Qwen3.6-27B(Q4_K_M GGUF,llama.cpp) |
| 上下文 | 262,144 token | 32,768 token(固定基准参数) |
| 轨迹 | 613 条(113 编码+500 工作流) | 20 条编码对话 / 1,007 轮(无溢出 32K) |
| 并发模式 | 目标并发扫描,Pareto 前沿 | 单流(target_concurrency=1) |
| 性能指标 | 每用户 token/秒 × 系统 token/秒(Pareto) | TTFT/TPOT/端到端轮延迟(p50/p90/p99/max) |
| 准确性门禁 | OSL + Inline + Standalone(200 题 SWE-bench Verified) | BFCL v4 单轮(~995 样本,86.23% 参考) |
| 提交状态 | 参考实现已发布(MLPerf Endpoints) | 征集中,截止 2026-07-31 |
4.2Edge 版准确性参考数据(Qwen3.6-27B-Q4_K_M)
| 类别 | 准确率 | 样本量 | 说明 |
|---|---|---|---|
| non_live (AST) | 82.59% | ~712 | 非实时单轮函数调用 |
| live | 84.12% | ~171 | 实时单轮函数调用 |
| hallucination | 97.16% | ~112 | 拒答无关工具 |
| Overall(门禁) | 86.23% | ~995 | 样本加权 |
| non_live-normalized(门禁) | 87.96% | — | 三类等权平均 |
通过阈值:Overall ≥ 83.64%(0.97×86.23%),non_live-normalized ≥ 85.32%(0.97×87.96%)[2]。
4.3推理代际演进:从 ResNet-50 到 Agentic Trajectory
五、未披露与使用边界Undisclosed & Boundaries
| 未披露项 | 影响 |
|---|---|
| 数据中心版的参考实现性能数字(Pareto 曲线具体坐标) | 无法预估当前硬件的达标难度 |
| 轨迹数据集的完整下载与使用协议 | 社区无法独立复现与审计 |
| 「缓存加盐」的具体盐值与验证逻辑 | 反作弊机制的细节不透明 |
| Standalone 准确性中 200 题 SWE-bench Verified 的具体选题 | 与 SWE-bench 家族其他成员的分数无法直接对齐 |
| Edge 版在不同边缘加速器上的参考延迟数字 | 「便携性验证」的具体结果未公开 |
| 轨迹采集的成本与脱敏流程 | 工作负载的可持续生产能力无法评估 |
使用边界:本调查的结论适用于「推理服务基础设施」;Agentic Inference 不测量模型能力(那是 SWE-bench 等任务基准的职责),而测量「给定模型在给定轨迹下的服务效率」。其 Pareto 前沿与三级门禁的设计,与 SWE-bench 的「二值解决率」形成互补:前者测「系统能不能高效跑」,后者测「模型能不能做对」。
参考文献References
- [1] MLCommons. Agentic Inference for MLPerf Inference. 2026-07-08. https://mlcommons.org/2026/07/agentic-inference-for-mlperf-inference/
- [2] MLCommons Edge LLM Taskforce. Call for Submission: Edge Agentic Inference Benchmark for MLPerf Inference v6.1. 2026-07-09. https://mlcommons.org/2026/07/mlperf-inference-v61-edge-agentic/
- [3] Workato. Workato co-builds the first MLPerf Enterprise Agentic Inference Benchmark with AMD, Intel, NVIDIA, and MLCommons. 2026-07-08. https://www.workato.com/the-connector/mlperf-enterprise-agentic-inference-benchmark/
- [4] MLCommons. MLCommons Releases New MLPerf Inference v5.0 Benchmark Results. 2025-04-02. https://mlcommons.org/2025/04/mlperf-inference-v5-0-results/
- [5] MLCommons. MLCommons Releases New MLPerf Inference v6.0 Benchmark Results. 2026-04-01. https://mlcommons.org/2026/04/mlperf-inference-v6-0-results/
- [6] MLCommons. MLCommons Releases New MLPerf Inference v5.1 Benchmark Results. 2025-09-09. https://mlcommons.org/2025/09/mlperf-inference-v5-1-results/