Intel 以 Tick-Tock 节奏推进至强处理器,从通用 x86 走向 AI 原生矩阵计算, P 核性能与 E 核密度双线并行,内置加速器持续卸载数据中心常见任务。
每一代至强处理器针对 AI 工作负载的关键改进,从 AMX 矩阵引擎到 P/E 核混合架构。
2023 发布 · Intel 7 工艺 · x86 AI 矩阵加速元年
x86 架构首个专用矩阵乘法引擎。8 个 1KB 二维 Tile 寄存器, 每周期执行 2048 次 INT8 运算或 1024 次 BF16 运算, 相对 AVX-512 VNNI 推理吞吐提升 8 倍,原生支持 TensorFlow/PyTorch。
集成 QAT 压缩加速、DLB 动态负载均衡、DSA 数据流加速、 IAA 内存分析加速。卸载数据中心常见 IO 与压缩任务, 释放核心用于 AI 计算。
8 通道 DDR5-4800,单路最大 4TB 内存。 PCIe 5.0 提供 32GT/s 带宽,支持 CXL 1.1 协议。 最多 60 个 Golden Cove 性能核,支持 AMX + AVX-512 共存。
2024 发布 · Intel 7 工艺优化 · 缓存与频率提升
Raptor Cove 核心,同功耗频率提升,单线程性能增强。 最多 64 个 P 核,相对 SPR 同功耗性能提升约 15-20%。 AMX 执行引擎优化,矩阵乘法延迟降低。
L3 缓存容量大幅提升,片上互联带宽增加。 更大的缓存降低 AI 推理中 KV-Cache 访存延迟, 对大模型批处理推理和向量检索场景有明显收益。
Pin 兼容 Sapphire Rapids 平台,无需更换主板即可升级。 软件栈完全兼容,AMX 指令无需重新编译即可获得性能提升。 是企业 AI 部署最平滑的升级路径。
2025 发布 · Intel 3 工艺 · AI 性能大幅跃进
Redwood Cove 核心,AMX 新增 FP16 数据类型支持, 覆盖训练与推理全精度范围。AMX 吞吐量相对 SPR 再提升, 主流大模型推理吞吐相对上一代提升最高 42%。
首次突破单路 100 核大关,最多 128 个 P 核。 Intel 3 工艺带来更高频率和更低功耗, 单路 AI 推理并发能力相对 EMR 翻倍。
16 通道 DDR5/MRDIMM,支持最高 8800 MT/s, 内存带宽相对 EMR 翻倍以上。PCIe 6.0 + CXL 3.0, 支持 CXL 内存池化和高速 GPU 互联。
Granite Rapids 主打高性能 P 核,面向通用计算、AI 推理、GPU 主机节点; 同期推出的 Sierra Forest 主打高密度 E 核(144 核),面向云原生容器和微服务。 Intel 首次在服务器领域实现 P/E 核架构分离, 按负载类型提供不同优化方向的芯片。
Intel 18A 首发 · 288 E核 · 云原生与 Agent 密度之王
首款采用 Intel 18A 制程的数据中心 CPU, 环绕栅极 RibbonFET 晶体管,PowerVia 背面供电。 能效比相对前代大幅提升,IPC 提升 17%。
单芯片 288 个 E 核,576MB 共享 L3 缓存。 为云原生容器、微服务、大规模 Agent 沙箱、 多租户 AI 推理实例设计,极致核数密度。
引入 Intel AET 高级执行追踪技术, TDX 可信域扩展增强,面向多租户云环境的安全隔离。 12 通道 DDR5-8000 内存,平衡容量与功耗。
18A-P 工艺 · Panther Cove-X · 192 P 核无超线程
全新性能核微架构,IPC 大幅提升。 采用 Intel 18A-P 增强工艺,散热与功耗特性优化。 芯片设计向 AMD Chiplet 风格靠拢,多计算 Die 互联。
192 个物理核心,192 线程,不再支持同步多线程。 专注单线程性能和每核独享资源, 对 AI 推理、HPC 等重计算负载更友好。
超大共享 L3 缓存,16 通道高带宽内存, PCIe 6.0 全规格支持。定位高端企业与 AI 主机, 8 通道版本已取消,专注双路高端服务器市场。
次代制程 · 恢复 SMT · AI 原生计算
Coral Rapids 目前处于早期规划阶段,已知将恢复 SMT 超线程技术, 采用 Intel 次代制程节点,进一步增强 AMX 矩阵计算能力, 支持更先进的低精度 AI 数据类型。CXL 4.0 内存池化将成为标准配置, 与 Intel Gaudi AI 加速器深度协同,面向 Agentic AI 时代的全栈优化。
Intel 在 AI 数据中心领域的五大关键技术支柱,从矩阵引擎到 P/E 核异构。
Intel x86 架构的专用 AI 矩阵引擎,由二维 Tile 寄存器和 TMUL 乘法单元组成。 直接加速卷积、Transformer 注意力等矩阵运算,是 CPU AI 推理的核心硬件。
软件生态: oneDNN、PyTorch、TensorFlow、vLLM、llama.cpp 主流框架原生支持。 无需专用加速卡即可在 CPU 上运行大模型推理,TCO 优势显著。
Intel 首次在服务器领域采用性能核与能效核分离的产品策略, 两条独立产品线分别针对不同负载优化,而非单芯片混合。
选型关键: AI 推理优先 P 核产品线;大规模容器部署、Agent 并发执行优先 E 核产品线。 两者软件栈完全兼容,可按负载灵活选型。
除了 AMX AI 引擎,至强还集成多个专用卸载引擎, 将数据中心常见 IO、压缩、加密任务从主核心卸载。
AI 流水线价值: 数据预处理、解压、特征工程、网络包处理可由专用引擎完成, 主核心全部用于 AMX 矩阵计算,整体 AI 服务吞吐提升 20-30%。
Intel 是 CXL 标准的主要推动者,至强平台持续推进内存带宽、 容量和池化能力,解决大模型内存墙问题。
大模型价值: CXL 内存扩展支持 TB 级内存池,70B+ 参数模型可纯 CPU 部署推理。 MRDIMM 高带宽显著提升 KV-Cache 绑定的生成式推理性能。
以 Sapphire Rapids 为基准(1.0),不同 AI 工作负载在各代至强上的相对性能。 数据综合 Intel 官方发布指标与典型负载实测。
SPR → GNR,AMX 增强 + 内存带宽 + 核数
矩阵引擎 INT8/BF16 理论吞吐倍数
SPR 60核 → GNR 128核,密度翻倍
E核产品线:SPR 60核 → CWF 288核
Intel 至强路线图已明确至 2028 年,P 核与 E 核双线迭代, 制程从 Intel 7 向 18A 及更先进节点稳步推进。
| 代次 | 代号 | 时间 | 制程 | 核数/线程 | AI 关键特性 |
|---|---|---|---|---|---|
| 4代 | Sapphire Rapids | 2023 | Intel 7 | 60 / 120 | 首代 AMX (INT8/BF16), QAT/DSA/IAA, CXL 1.1 |
| 5代 | Emerald Rapids | 2024 | Intel 7 | 64 / 128 | AMX 优化, 更大 L3, 平台兼容升级 |
| 6代 E核 | Sierra Forest | 2025 | Intel 3 | 144 / 144 | 高密度 E 核,云原生/微服务优化 |
| 6代 P核 | Granite Rapids | 当前主力 | Intel 3 | 128 / 256 | AMX FP16, MRDIMM, PCIe 6.0, CXL 3.0 |
| 6+代 E核 | Clearwater Forest | 2026 已发布 | Intel 18A | 288 / 288 | 18A 首发, IPC+17%, 576MB L3, AET |
| 7代 | Diamond Rapids | 2027 中 | Intel 18A-P | 192 / 192 | Panther Cove, 无 SMT, 240MB L3, Chiplet |
| 8代 | Coral Rapids | 2028 | 次代节点 | TBD | 恢复 SMT, AMX 新一代, CXL 4.0 |