AMD 以每年一代的节奏推进 EPYC 服务器处理器,从通用计算走向 AI 原生计算。 每一代都围绕 IPC、向量吞吐、缓存层次、内存带宽、异构互联五个维度持续优化。
每一代微架构针对 AI 工作负载的关键改进,从通用向量走向 AI 原生指令集。
2022 发布 · 5nm 工艺 · 奠定 AI 基础
IPC 相对 Zen3 提升 13%,L2 缓存翻倍至 1MB/核。 引入 AVX-512 指令集,但硬件执行单元为 256 位拆分, 512 位操作会触发频率降低,适合轻量向量推理。
12 通道 DDR5-4800,单路最大 6TB 内存容量。 PCIe 5.0 提供 32GT/s 带宽,支持 CXL 1.1 内存扩展。 为大模型权重存储和 GPU 直连奠定基础。
首款服务器级 3D 堆叠缓存型号,最大 800MB L3。 使用混合键合技术,显著降低大工作集访存延迟。 对向量数据库、推荐系统等随机访存密集型负载收益明显。
2024 发布 · 4nm 工艺 · AI 异构加速元年
分派宽度从 6 宽提升至 8 宽,整数 ALU 从 4 个增至 6 个。 双取指双解码前端,每周期取指带宽翻倍。 AI/HPC 场景 IPC 相对 Zen4 提升高达 37%。
完整 512 位数据通路,不再拆分执行,不再强制降频。 BF16/FP32 向量吞吐翻倍,Embedding、注意力前处理、 特征工程等 CPU 侧 AI 算子性能显著提升。
GPU/加速器可绕过主内存,直接将数据写入 CPU L3 缓存。 解决 AI 流水线中 GPU→CPU 数据回写瓶颈, 是 GPU 主机节点端到端性能的关键硬件加速。
Zen5 标准核(8核/CCD,高频率)面向 GPU 主机和低延迟推理; Zen5c 密度核(16核/CCD,最高 192 核)面向多租户 AI 容器和 Agent 沙箱。 单颗 CPU 可混合部署两种 CCD, 硬件原生支持异构计算资源池化。
2026 发布 · 2nm GAA · Agentic AI 基础设施
首批采用台积电 2nm GAA 工艺的服务器芯片。 同性能下功耗降低 25-30%,同功耗下性能提升 10-15%。 Zen6c 版本最高 256 核 512 线程,面向大规模 Agent 执行。
16 通道 MRDIMM-12800 MT/s,内存带宽突破 1.6 TB/s。 LP 版本支持 24 通道 LPDDR5X,面向机架式 AI 节点。 CXL 3.1 支持内存池化,大模型 KV-Cache 容量近乎无限扩展。
单路最高 128 条 PCIe 6.0 通道,速率 64GT/s。 完美适配 Instinct MI500 系列 GPU,CPU-GPU 通信带宽翻倍。 Infinity Fabric 5 代,多 Chiplet 间一致性延迟进一步降低。
台积电 A14 (1.4nm) · x86 原生 AI 矩阵指令
x86 生态标准化 AI 矩阵指令,由 AMD 与 Intel 共同制定。 原生支持 FP8、FP6、FP4、BF16、INT8 数据类型, 块式寄存器组织,直接加速 Transformer 矩阵运算。 编译器支持已提前就绪,软件生态将在发布时同步成熟。
台积电 A14 1.4nm 级工艺,晶体管密度再提升。 单芯片最高 288 物理核心,线程密度相对 Zen6 再提升 12.5%。 继续保留 Zen7 / Zen7c 双架构,按 Agent 数量售卖成为可能。
原生支持 DDR6 内存标准,搭配下一代 MRDIMM 缓冲芯片。 内存带宽相对 Zen6 预计再提升 50% 以上, 配合 CXL 内存池化,支撑万亿参数模型 CPU 侧推理。
Florence:通用计算主力; Ferrara:AI GPU 主机节点专用,强化 PCIe 与缓存注入; Fidenza:高密度云原生实例,极致核数密度。 AMD 首次提出"每瓦 Agent 数"、"每美元 Agent 数"作为性能指标。
AI 原生计算架构 · 机架级深度整合
Zen8 目前处于早期规划阶段,已知方向包括:次代 GAA 工艺节点、 进一步增强的 AI 矩阵计算能力、CXL 4.0 全内存池化架构、 与 Helios 机架级系统深度融合的 CXL 交换网络。 届时数据中心计算将从"以 CPU 为中心"彻底转向"以 AI 工作负载为中心"的 异构资源池化架构,CPU 承担智能体编排、内存一致性域管理和大规模任务调度。
推动 AMD EPYC 在 AI 时代持续领先的五大关键技术支柱。
使用混合键合(Hybrid Bonding)工艺将 SRAM 晶圆直接堆叠在计算 CCD 之上, 以极低的延迟和功耗提供海量 L3 缓存。不提升主频,但大幅减少 DRAM 访问次数。
AI 负载收益: 向量数据库 > KV-Cache 推理 > 特征工程 > 小算子推理。 大工作集随机访存场景性能提升可达 50% 以上。
从受限 AVX-512 到满血 512 位通路,再到 Zen7 原生 ACE 矩阵指令, x86 向量单元正在从通用 SIMD 演化为 AI 专用矩阵加速器。
软件依赖: AOCL-DNN、AOCL-BLIS、oneDNN、编译器自动向量化。 ACE 作为 x86 标准扩展,将获得主流深度学习框架原生支持。
Smart Data Cache Injection,Zen5 引入的关键异构加速技术。 GPU、NIC、存储控制器可通过 PCIe 直接将数据注入 CPU L3 缓存, 完全绕过 DRAM 主存,消除 CPU-GPU 流水线中的内存拷贝瓶颈。
典型场景: GPU 推理结果后处理、智能体调度、分布式训练梯度同步、 高性能网络包处理(RDMA/NIC)。端到端延迟降低 20-40%。
AI 大模型的核心瓶颈是内存容量与带宽。AMD 持续推进内存通道数、 频率和 CXL 协议版本,将单路内存容量从 6TB 推向近乎无限的池化架构。
CXL 演进: CXL 1.1 (Zen4) → CXL 3.0 (Zen5) → CXL 3.1 (Zen6) → CXL 4.0 (Zen8)。 支持内存解耦、多节点共享内存池、加速器一致性内存映射。
以 Zen4 为基准(1.0),不同 AI 工作负载在各代架构上的相对性能。 数据综合 AMD 官方发布指标与典型负载实测。
Zen4 → Zen6,向量+缓存+带宽综合提升
3D V-Cache 大幅降低随机访存延迟
SDCI + PCIe 6.0 提升 GPU 有效利用率
核数密度 + 每瓦性能提升,Zen6c 优势显著
AMD 明确承诺每年一代 EPYC 节奏,AI 机架系统 Helios 同步迭代, 构建 CPU+GPU+DPU 全栈 AI 基础设施。
| 架构 | 代号 | 时间 | 工艺 | 最大核数 | AI 关键特性 |
|---|---|---|---|---|---|
| Zen 4 | Genoa / Bergamo | 2022 | TSMC 5nm | 128 (Zen4c) | AVX-512, CXL 1.1, 首代 3D Cache |
| Zen 5 | Turin | 2024 | TSMC 4nm | 192 (Zen5c) | 满血 AVX-512, SDCI, CXL 3.0, 混合 CCD |
| Zen 6 | Venice / Verano | 2026 量产 | TSMC 2nm GAA | 256 (Zen6c) | MRDIMM 1.6TB/s, PCIe 6.0, 1152MB L3 |
| Zen 7 | Florence / Ferrara / Fidenza | 2028 | TSMC A14 (1.4nm) | 288 | ACE AI 矩阵指令, DDR6 |
| Zen 8 | Ravenna | 2030 | 次代 GAA | TBD | AI 原生核心, CXL 4.0, 机架级整合 |