技术调研报告

Arm AGI CPU
面向AI原生数据中心的
革命性处理器架构

Arm首款直接面向数据中心销售的自研CPU,采用136核Neoverse V3架构, 专为AI代理编排优化,机架级性能宣称达x86平台2倍以上

136核心
3nm工艺
DDR5-8800
Arm AGI CPU处理器芯片

执行摘要

商业模式转型

Arm成立35年来首次从IP授权商转型为直接销售芯片制造商, 单颗芯片收入提升5-10倍,预测未来五年年收入达250亿美元 [302]

AI原生设计

专为AI代理编排优化,放弃传统SMT技术,确保确定性性能扩展, 每核心6 GB/s内存带宽,低于100纳秒内存延迟 [230]

性能表现

估算SPECint2017 Rate-1约10.8-11.0,超越所有x86服务器处理器, 机架级性能宣称达x86平台2倍以上 [358]

生态系统

首批客户包括Meta、OpenAI、Cerebras、Cloudflare等50+行业领军企业, 与Supermicro合作推出液冷200kW机架方案 [231]

1. 产品概述与定位

自研CPU战略

Arm首款直接面向数据中心销售的自研CPU,标志商业模式重大转型, 从IP授权商转变为成品芯片制造商

AI原生设计

专为AI代理编排优化,聚焦智能体系统协调处理器角色, 与GPU/ASIC形成垂直分工而非直接竞争

机架级优化

面向高密度服务器机架的大规模并行部署, 提供风冷36kW和液冷200kW两种验证方案

商业模式转型的战略意义

传统授权模式

  • 单颗芯片版税:0.05-0.30美元
  • 依赖合作伙伴实现硬件价值
  • 无法完整展示架构潜力

自研芯片模式

  • 单颗芯片收入:数百美元
  • 收入提升5-10倍
  • 完整捕获价值链利润

2. 核心架构与详细规格

处理器核心

核心架构 Arm Neoverse V3 (Armv9.2-A)
核心数量 136核心/芯片
时钟频率 3.2 GHz (最高3.7 GHz)
L2缓存 2 MB/核心
SLC缓存 128 MB共享

内存子系统

内存通道 12通道DDR5
内存速率 DDR5-8800 MT/s
理论带宽 844.8 GB/s
每核心带宽 ~6 GB/s
最大容量 6 TB/芯片
内存延迟 < 100 ns

I/O与互联

PCIe通道 96条PCIe Gen6
CXL支持 CXL 3.0
多插槽 支持2P配置
参考设计 1OU双节点刀片

物理特性

制造工艺 3nm (TSMC)
TDP范围 230W-420W可配置
典型配置 300W
核心密度 0.45核/W

架构创新亮点

AI加速特性

  • • bfloat16/INT8 AI指令支持
  • • SME2矩阵运算扩展
  • • 面向推理和训练的专用优化
  • • KleidiAI库优化集成

设计哲学

  • • 无SMT设计确保确定性性能
  • • "AI原生"功能裁剪策略
  • • 机架级部署优化
  • • 开放生态系统支持

3. 产品型号与配置选项

旗舰版

SP113012

136核心完整配置

核心数 136核
频率 3.2 GHz
TDP 300W
定位 最高密度AI基础设施

面向超大规模LLM推理服务、高密度智能体编排平台

精简版

SP113012S

128核心配置

核心数 128核
频率 3.2 GHz
TDP 300W
定位 TCO优化场景

通过屏蔽8核心实现更高良率和成本效益

低核心版

SP113012A

64核心配置

核心数 64核
频率 3.2 GHz
TDP 230W
定位 边缘/低功耗场景

面向边缘AI节点、开发测试环境

4. 官方文档与技术资料

产品手册

Arm AGI CPU Product Brief

首要技术概述文档,包含核心规格、差异化价值主张 [319]

技术参考手册 (TRM)

面向系统开发者的详细技术规格,需要NDA获取

系统开发指南

面向OEM/ODM的主板设计、固件开发指导 [320]

架构文档

Neoverse V3微架构白皮书

深入解析V3架构设计哲学和技术创新 [355]

Armv9.2-A架构参考手册

完整指令集架构定义,编译器和OS开发基础

内存一致性模型文档

多核心/多插槽配置的内存访问规则定义

参考设计

1OU双节点参考服务器

OCP DC-MHS标准兼容设计,30刀片/42U配置提供8,160核心 [259]

液冷200kW机架方案

与Supermicro合作,336颗AGI CPU提供45,000+核心 [307]

36kW标准机架配置

主流风冷部署方案,适配现有数据中心基础设施

软件生态

操作系统: Ubuntu, RHEL, SUSE Linux
容器平台: Kubernetes, Docker
AI框架: PyTorch, TensorFlow, ONNX Runtime
优化库: KleidiAI, XNNPACK

5. 使用场景与部署模式

核心应用场景

AI代理编排

智能体系统的协调处理器,负责任务调度、状态管理、工具调用

核心设计目标

LLM推理服务

预处理、GPU协调、后处理、纯CPU中小模型推理

高内存带宽优势

RAG工作负载

查询嵌入、向量搜索、文档重排序、上下文整合全流程优化

向量检索加速

向量数据库

十亿级向量索引内存驻留,亚毫秒级相似度检索

大容量内存优势

数据中心部署模式

云服务商大规模部署

超大规模云:Meta、OpenAI等吉瓦级基础设施
区域云:差异化竞争、供应链多元化
AI原生云:异构计算集群、极致性能追求

企业私有AI基础设施

数据主权:敏感数据本地处理
定制化:行业特定模型和工作流程
供应链安全:避免单一供应商锁定

软件生态支持

操作系统支持

Ubuntu
RHEL
SUSE

AI框架优化

PyTorch - XNNPACK/KleidiAI后端
TensorFlow - XLA编译器优化
ONNX Runtime - Arm NN集成

6. 性能分析与SPECINT 2017估算

性能基准参考

Neoverse V1 5.68
Neoverse V2 7.14
Google Axion N4A 7.16
Qualcomm Oryon 10.64

数据来源:[358]

估算方法

IPC提升: V3较V2提升15%
频率提升: 3.7/2.8 = 1.32×
综合系数: 1.15 × 1.32 ≈ 1.52
基准: 7.14 (Graviton 4)

估算结果

~10.85
SPECint2017 Rate-1
保守估算: ~9.4 (3.2 GHz)
典型估算: ~10.3 (3.5 GHz)
峰值估算: ~10.85 (3.7 GHz)

不确定性:±10%

性能分析洞察

超越x86服务器

估算成绩超越所有x86服务器处理器,包括AMD EPYC 9K65 (7.78) 和Intel Xeon 6982P-C (6.90)

能效与性能平衡

在300W TDP约束和136核密度下实现性能领先, 核心密度0.45核/W显著优于x86竞品

架构效率验证

相对保守频率(3.7 GHz)下实现高单线程性能, 验证Arm架构在服务器场景的效率优势

7. 业界主流处理器对比

单线程性能对比 (SPECint2017 Rate-1)

处理器 架构 频率 SPECint2017 备注
Arm AGI CPU Neoverse V3 3.7 GHz ~10.85 估算值
Qualcomm Oryon Oryon ~4.3 GHz 10.64 消费级
AMD Ryzen 9 9950X Zen 5 5.7 GHz 11.9-12.9 消费级旗舰
AMD EPYC 9R45 Zen 5 4.5 GHz 9.07 服务器
AMD EPYC 9755 Zen 5 4.1 GHz 8.97 服务器
Intel Xeon 6982P-C Redwood Cove 3.6 GHz 6.90 服务器

规格参数综合对比

特性 Arm AGI CPU AMD EPYC 9005 Intel Xeon 6
最大核心数 136 128-192 64-144
制程工艺 3nm 3nm/4nm Intel 3
典型TDP 300W 200-500W 150-500W
核心密度 0.45核/W 0.26-0.38 0.29-0.41
内存通道 12×DDR5-8800 12×DDR5-6400 8×DDR5-6400
每核带宽 ~6 GB/s ~3-4 GB/s ~2.5-3.5 GB/s
PCIe 96×Gen6 128×Gen5 80×Gen5
CXL 3.0 2.0/3.0 2.0
SMT

能效与总拥有成本

机架级性能优势

核心密度优势: 136核 vs 64-128核
内存带宽优势: 6 GB/s vs 2-3 GB/s
机架性能宣称: 2倍x86性能

TCO优势

更少服务器数量(核心密度2×+)
简化散热设计(液冷PUE<1.1)
降低电力基础设施投资
统一软件栈减少维护成本

8. 总结与评估

核心优势

极致核心密度与内存带宽

136核/12ch DDR5-8800/6GB/s每核配置业界领先, 直接针对AI工作负载内存密集型特征优化

AI代理工作负载专用架构

无SMT确定性性能、<100ns内存延迟、SME2矩阵加速, 每一项设计决策围绕AI代理编排需求展开

灵活TDP配置与扩展能力

230W-420W可配置TDP覆盖从边缘到超大规模完整部署谱系, 风冷/液冷双方案降低采用门槛

统一Arm生态软件栈

KleidiAI优化库、主流框架Arm后端、成熟Linux发行版支持, 避免专有硬件生态风险

潜在挑战

软件生态成熟度差距

特定企业软件、遗留系统、专业工具链的x86依赖性仍然存在, 需要持续投入Arm移植和优化

传统企业应用兼容性

"AI原生"设计主动放弃遗留兼容性,依赖传统x86指令集的应用 可能需要评估替代方案

市场接受度与供应链验证

作为Arm首款自研数据中心CPU,大规模部署验证、长期可靠性数据、 供应链稳定性仍需时间积累

适用性建议

优先场景

  • 大规模LLM推理服务
  • AI代理编排平台
  • RAG/向量数据库
  • GPU集群协调节点

谨慎场景

  • 依赖x86指令集应用
  • 未经Arm移植验证软件
  • 单线程绝对性能敏感场景

建议验证

  • 关键应用性能基准测试
  • 软件兼容性评估
  • TCO建模分析
  • 供应链尽职调查

报告日期:2026-04-02