DDR5 SDRAM 电路设计指南
编制日期 2026-09-21 | 版本号 Rev 1.0
DDR5-3200 / 3600 / 4000 / 4400 / 4800 / 5600 / 6400 / 7200 / 8000+ MT/s · On-DIMM PMIC · RCD / DB · 双 40 bit 子通道 · DFE 与高速训练
0 · 文档说明
适用范围
本文针对 DDR5 SDRAM(JESD79-5 系列) 的硬件电路设计,覆盖颗粒(down / 板载)与模组(UDIMM、SODIMM、RDIMM、LRDIMM)两类落地形态,速率覆盖 3200 ~ 8800 MT/s 。
适用对象:服务器 / PC / 边缘计算 / 高端嵌入式主控(Intel、AMD、飞腾、海光、NXP、瑞萨、TI、SoC FPGA 等)的主存接口 原理设计、PCB Layout、电源完整性、信号完整性与量产调试。
内容包含:规格对比、封装球位、信号定义、CA 命令总线协议、电源与 On-DIMM PMIC、典型电路(内联原理图)、子通道架构与训练、Layout 规范、SI 与端接、ESD 与可靠性、焊接生产、故障排查、检查清单与 BOM。
不包含:主控侧内存控制器微架构、BIOS/UEFI MRC 源码、完整 JEDEC 寄存器位定义。
参数效力声明
全文所有电压、电流、时序、阻抗、端接值均为工程典型值或量级参考 。最终设计一律以目标型号 datasheet、目标主控 DDR 控制器设计指南(PDG / Design Guide)与 JEDEC JESD79-5 为准 ;不同厂商(Micron / Samsung / SK hynix / CXMT)、不同密度、不同速率档的数值存在明显差异。文中凡出现「典型」「约」「建议」均表示该值需按实际器件复核。
本系列其他文档
文档 器件类型 关注重点
SPI NOR 电路设计指南 串行 NOR Flash Quad/QPI 提速、dummy cycles、XIP、DPD 低功耗
SPI NAND 电路设计指南 串行 NAND Flash 页/块管理、片内 ECC、坏块表、主机 FTL
并行NAND (PPI NAND) 电路设计指南 8/16 位并行 NAND 宽总线时序、ECC 引擎、40+ 引脚 Layout
eMMC 电路设计指南 eMMC 5.0/5.1 HS200/HS400、1.8 V VCCQ、DS 选通与等长
SD NAND 电路设计指南 贴片式 SD NAND SPI/SDIO 双模式、无休眠指令、VCC 负载开关断电
NAND MCP 电路设计指南 多芯片合封存储 多 die 与多 CE、双电源轨、HDI 扇出
并行NOR (PPI NOR) 电路设计指南 并行 NOR Flash 异步读时序、XIP、等待周期、总线扩展
PSRAM 电路设计指南 伪静态 RAM OPI/HyperBus、刷新与延迟周期、XIP 与帧缓存
DDR2 电路设计指南 DDR2 SDRAM SSTL_18、T 分支拓扑、VTT 端接、ODT
DDR3 电路设计指南 DDR3 / DDR3L Fly-by 拓扑、write leveling、动态 ODT
DDR4 电路设计指南 DDR4 SDRAM POD12、bank group、DBI、2D 训练
DDR5 电路设计指南 本文 DDR5 SDRAM 双子通道、On-DIMM PMIC、DFE、同帧 ECC
EEPROM 电路设计指南 EEPROM I²C/SPI 接口、上拉电阻与总线电容、页写与写保护
快速决策:DDR4 / DDR5 / LPDDR5 / GDDR 怎么选
四类易失性存储器的定位差异
维度 DDR4 DDR5(本文) LPDDR5 / LPDDR5X GDDR6 / GDDR6X
定位 上一代通用主存 通用主存 / 服务器主存 移动与低功耗 SoC 主存 显卡 / AI 加速高带宽显存 供电 VDD/VDDQ 1.2 V,VPP 2.5 V VDD/VDDQ 1.1 V,VPP 1.8 V VDD1 1.05 V / VDD2 0.9 V / VDDQ 0.5 V VDD 1.35 V,VDDQ 1.35 V(随厂商) 通道形态 单 64 bit(+8 ECC = 72) 双 32 bit 子通道(各 +8 ECC = 40×2) 每 die 16 bit,多 die 组通道 每颗粒 32 bit,多颗粒并行
速率 1600~3200 MT/s 3200~8800+ MT/s 5500~10700 MT/s(X 档) 14~24 Gbps/pin 电源架构 主板 VRM On-DIMM PMIC(模组) PMIC + 主控内 DVFS 多相 VRM + 显存电源层 成本 / 功耗敏感 成本最低、生态成熟 带宽与容量密度最高 每 bit 功耗最低 带宽优先、功耗与成本最高
决策一句话: 需要大容量 + 高带宽 + 服务器 RAS 特性 → DDR5;需要电池续航 + 小体积 → LPDDR5/LPDDR5X(含 LPCAMM2);需要极致带宽 → GDDR6/GDDR7;成本优先且速率 ≤3200 → DDR4。DDR5 的代价是电源架构变更(PMIC)、训练复杂度上升、Layout 与 SI 门槛显著提高 ,若主控不支持 DDR5 PHY,任何优化都无法弥补。
本文速览:DDR5 相对 DDR4 的九处本质变化
电压下探: VDD/VDDQ 由 1.2 V 降为 1.1 V,VPP 由 2.5 V 降为 1.8 V,AC 噪声容限更紧(±3% 量级)。
电源调节下沉到内存条: 模组上集成 PMIC(输入 5 V 或 12 V),主板不再直接供给 1.1 V。
通道拆分: 单个 DIMM 拆成两个独立的 32 bit 子通道(各含 8 bit 校验),并行度翻倍。
命令地址串行化: RAS#/CAS#/WE#/ACT# 取消,全部命令由 CA 总线在 1~2 个时钟内串行传输。
突发长度翻倍: BL16(burst chop 为 BC8),预取由 8n 变 16n。
Bank 数翻倍: 8 bank group × 4 bank = 32 bank,配合 Same-Bank Refresh 降低刷新开销。
均衡与训练复杂化: 引入 DFE、内部 VREF 训练、DCA(占空比调整)、CA 训练、Loopback 反馈训练。
刷新粒度细化: All-Bank Refresh / Same-Bank Refresh(REFsb)+ RFM/ARFM 行锤抑制。
管理总线升级: SPD Hub + PMIC + TS 通过 I2C/I3C(HSCL/HSDA)统一管理,支持遥测。
1 · 器件基础
本节给出 DDR5 与 DDR4 的规格对照、封装与球位分区、以及设计必须遵守的关键电气参数。任何一条不满足,后续 Layout 与训练都无法救回。
1.1 规格对比:DDR4 vs DDR5
项目 DDR4 DDR5 设计影响
VDD / VDDQ 1.2 V(±3% / ±5% 依档位) 1.1 V(AC 噪声典型 ±3%) 噪声预算从 36 mV 压到 33 mV,PDN 设计难度上升 VPP(字线升压) 2.5 V 1.8 V 可直接由 PMIC 一路输出供给,无需独立升压 VDD 电源来源 主板 VRM / DC-DC 模组上 PMIC(板载方案需自建) 主板只送 5 V 或 12 V,需重新规划电源层
数据速率 1600~3200 MT/s 3200~8800+ MT/s Nyquist 从 1.6 GHz 升到 4.4 GHz,板材与残桩必须升级 时钟频率 速率 / 2(最高 1.6 GHz) 速率 / 2(最高 4.4 GHz) CK 抖动要求更严,差分 80 Ω 与对称布线是硬指标 通道结构 1 × 64 bit(ECC 时 72 bit) 2 × 32 bit 子通道(各带 8 bit 校验) 两个子通道可独立并发,布线需两两对称
突发长度 BL8 / BC4 BL16 / BC8 一次访问 64 B(单子通道 32 B),缓存行利用率提高 预取 8n 16n 控制器调度粒度变化,tCCD 等参数随之改变 Bank 结构 4 BG × 4 = 16 bank 8 BG × 4 = 32 bank 并发度翻倍,tFAW / tRRD 约束需重新核算
命令地址 ADDR + RAS#/CAS#/WE#/ACT# CA[13:0] 14 bit 串行总线 命令引脚减少约 20 个,但 CA 需 1T/2T 训练 片内 ECC 无(部分厂商私有) 有(on-die ECC,透明,不占引脚) 阵列可靠性提升,但不等于系统级 SECDED 系统级 ECC x72 模组(64+8) 每子通道 32+8,双通道共 80 bit 链路 「同帧 ECC」:校验与数据同帧传输,不扩展外部数据宽度
均衡 CTLE(控制器侧)、无 DFE 控制器 CTLE/DFE + DRAM 侧 DFE 训练项增加,上电训练时间显著变长 ODT RTT_NOM / RTT_WR / RTT_PARK RTT_NOM_RD / RTT_NOM_WR / RTT_WR / RTT_PARK 读写端接可分别设置,写眼图调试空间更大 ZQ 校准电阻 240 Ω ±1% 240 Ω ±1%(低寄生布局) 必须靠近 ZQ 引脚,走线 ≤ 5 mm,禁止过孔
刷新 All-Bank Refresh All-Bank + Same-Bank(REFsb) 刷新可只针对部分 bank,降低性能抖动 告警 / 训练引脚 ALERT_n(部分)、PARITY ALERT_n、TEN、Loopback 反馈 管理侧需增加上拉与测试点 模组管理 SPD EEPROM(I2C) SPD Hub + PMIC + TS(I2C/I3C) 需 3.3 V 管理电源与上拉,支持遥测与热节流
最容易踩的坑:把 DDR5 当「更快的 DDR4」来画
DDR5 不是 DDR4 的提速版。若沿用 DDR4 的电源树(主板直供 1.1 V 给插槽)、沿用 DDR4 的 1.6 GHz 走线规则、或用 DDR4 的等长公差(±25 mil 组间),在 6400 MT/s 上大概率表现为训练失败、只能降速到 3600/4000、或高温环境随机 ECC 报错 。电源架构、叠层板材、等长公差、训练项四类必须同步升级。
1.2 封装与球位定义
形态 封装 典型尺寸 球距 / 球数 说明
DDR5 颗粒 x8 FBGA-82 9.0 × 11.0 mm(典型) 0.8 mm / 82 ball 板载(down)方案主流;单颗 x8,需 4 颗组 32 bit 子通道 DDR5 颗粒 x16 FBGA-102 9.0 × 14.0 mm(典型) 0.8 mm / 102 ball 2 颗组 32 bit;球数少、布局友好,但可选型号少 DDR5 颗粒 x4 FBGA-82 / 96 9.0 × 11.0 mm(典型) 0.8 mm 多见于服务器高密度 RDIMM(8 颗组 32 bit)
UDIMM / RDIMM 288 pin 金手指 133.35 × 31.25 mm 0.85 mm pin pitch 双面子通道分区,中部卡口防呆 SODIMM 262 pin 金手指 69.6 × 30.0 mm 0.5 mm pin pitch 笔记本 / 边缘设备,同样双 40 bit 子通道 CAMM2 / LPCAMM2 压缩连接器(LGA 式) 约 78 × 30 mm 0.85 mm 网格 更低高度、更短走线,可跑更高速率;需专用连接器
DDR5 封装与 288 pin 模组信号分区(示意)
① DDR5 颗粒 FBGA-82(x8,0.8 mm 球距)
A1
9.0 mm(列方向) 球位分区图例 DQ[7:0] / DQS_t·DQS_c / DM_n(数据组,8 位 + 1 对选通 + 1 掩码) CA[13:0] / CS_n / CK_t·CK_c(命令地址与时钟,串行化命令) VDD / VDDQ 1.1 V(主电源与 I/O 电源,数量最多)
VSS / VSSQ(地,与电源球 1:1 交错布置降低回路电感) VPP 1.8 V / ZQ / ALERT_n / RESET_n / TEN / Loopback / NC ② 288 pin UDIMM / RDIMM 金手指分区(正反面合计)
卡口 Notch(防呆) VDD / VDDQ / VSS(1.1 V 主电源与地)
≈ 120 pin VPP 1.8 V(由 On-DIMM PMIC 产生,板上不再直供) ≈ 12 pin
CK_A_t / CK_A_c(子通道 A 差分时钟) 2 pin CA_A[13:0] + CS_A_n(子通道 A 命令地址总线)
15 pin DQ_A[31:0] + DQS_A_t/c ×4 + DM_A_n ×4(数据组) 52 pin
CB_A[7:0](子通道 A 校验位,与 32 bit 数据同帧) 8 pin CK_B / CA_B[13:0] / CS_B_n(子通道 B 命令时钟,完全独立)
17 pin DQ_B[31:0] + DQS_B_t/c ×4 + DM_B_n ×4(数据组) 52 pin
CB_B[7:0](子通道 B 校验位) 8 pin ALERT_n / RESET_n / TEN / Loopback(开漏需上拉)
≈ 6 pin HSCL / HSDA(I2C/I3C 管理总线 → SPD Hub + PMIC + TS) 2 pin
SA0~SA2 / 保留 / 机械检测(地址选择与在位检测) ≈ 6 pin ▶ UDIMM / SODIMM:主控直连颗粒(仅地址时钟走 Fly-by); ▶ RDIMM:CK / CA / CS 经 RCD 寄存再驱动;LRDIMM 另加 DB 缓冲 DQ。
▶ 两个子通道各自独立训练,主控必须分别完成 write/read leveling 与 VREF。 注:pin 数与分组为示意,确切分布以 JEDEC 模组规范与目标型号 datasheet 为准。
图 1-1 DDR5 颗粒 FBGA-82 球位分区(含 A1 标记)与 288 pin 模组信号分区:两个子通道各 40 bit(32 DQ + 8 CB),命令与时钟完全独立
1.3 关键电气参数
参数 符号 典型值 / 范围 说明与设计约束
核心 / I/O 电压 VDD / VDDQ 1.1 V(AC 噪声 ±3% 量级) 含 DC 误差 + 纹波 + 噪声的总容差按目标型号;1.1 V 下 33 mV 是全部预算 字线升压 VPP 1.8 V(±5% 量级) 电流很小(mA 级),但对噪声敏感,需独立去耦与短走线 I/O 电平标准 — PODL(端接到 VDDQ) 与 DDR4 的 POD12 同为伪开漏,高电平由端接上拉建立
输入参考电压 VREF 内部生成,多档 MR 可调 DDR5 内部 VREF 训练范围更宽,需按训练结果锁定 差分时钟频率 fCK 1.6 ~ 4.4 GHz 等于数据速率的一半;抖动(RMS)要求随速率收紧 CA 总线速率 — SDR @ fCK(1T / 2T 命令) 命令在 1 或 2 个 CK 周期内串行发完
单端阻抗(DQ / CA / DM) Z0 40 Ω ±10% 部分平台为 40 Ω;以主控 PDG 为准,不可沿用 DDR3 的 50 Ω 差分阻抗(CK / DQS) Zdiff 80 Ω ±10% 差分对内等长 ±1~2 mil,禁止跨分割 ZQ 校准电阻 RZQ 240 Ω ±1%(低寄生) 贴装距 ZQ 引脚 ≤ 5 mm,走线不加过孔,包地处理
片内端接 RTT 240 / 120 / 80 / 60 / 48 / 40 / 34 Ω 等 DDR5 将 Nominal 拆为 RD / WR 两类,见第 7 章 刷新间隔 tREFI 3.9 µs(≤85 °C) DDR4 为 7.8 µs;>85 °C 时典型折半为 1.95 µs 刷新命令周期 tRFC1 / tRFC2 / tRFCsb 约 295 / 160 / 130 ns(16 Gb 量级) 随密度显著变化;REFsb 只刷新单 bank,延迟最短
工作温度(颗粒) Tcase 0 ~ 85 °C(商业);-40 ~ 95 °C(工温/车规) >85 °C 触发 2× 刷新率与热节流,带宽下降 存储温度 Tstg -55 ~ 100 °C 运输与仓储需控制湿度(MSL 管控) ALERT_n 上拉 — 典型 4.7 ~ 10 kΩ 到 1.1 V 或管理电源 开漏输出,多器件线与;上拉电源域以 datasheet 为准
RESET_n — 低有效,上电期间需保持低 ≥ 规定时间 板载方案建议 1~10 kΩ 下拉 + 主控 GPIO 可控上拉 ESD 等级 HBM / CDM HBM ≥ 1000 V;CDM ≥ 250 V(典型) 高速引脚 ESD 器件结电容需 ≤ 0.3 pF 级或干脆不加
上表中的阻抗、端接与时序值会随代际与厂商修订而变;主控提供的 PDG(Processor Design Guide / DDR Design Guide)优先级高于本文 ,冲突时以 PDG 为准。
2 · 接口与协议
DDR5 最大的协议变化是「命令地址串行化」:传统 RAS#/CAS#/WE#/ACT# 引脚被取消,所有命令由 14 bit CA 总线在 1~2 个 CK 周期内串行发送。这一改动把引脚数降下来的同时,把时序约束与训练责任转移到了控制器与 Layout。
2.1 完整信号定义
信号 方向 类型 / 电平 数量(x8 单颗粒) 功能与设计要点
CK_t / CK_c主控→DRAM 差分,80 Ω 1 对 命令与地址的时序基准;频率 = 速率/2。差分对内等长 ±1~2 mil,禁止在途中分叉 CA[13:0]主控→DRAM 单端 40 Ω,SDR 14 命令 + 地址 + Bank/BG 复用总线;部分命令需 2 个 CK(2T)。组内等长,Fly-by 末端端接 CS_n主控→DRAM 单端 40 Ω 1(3DS 为 CS_n_A / CS_n_B) 片选兼命令有效性指示;多 rank 时每个 rank 一根,随 Fly-by 顺序排列
DQ[7:0](x8)双向 PODL 单端 40 Ω 8 数据位;4 颗 x8 组 32 bit 子通道。组内与 DQS 等长 ±3~5 mil DQS_t / DQS_c双向 差分 80 Ω 1 对 / 字节组 数据选通;读写双向,读时由 DRAM 发出(与 DQ 边沿对齐→主控做 read leveling) DM_n(x8/x16)主控→DRAM 单端 40 Ω 1 / 字节组 写数据掩码;x16 可能为 DM_n/DBI_n 复用。与同组 DQ 等长
CB[7:0](模组)双向 PODL 单端 40 Ω 8 / 子通道 校验位(check bits),与 32 bit 数据同帧传输,供主控做 SECDED。板载方案若主控不用则按 NC/接地处理(依 datasheet) ALERT_nDRAM→主控 开漏输出,需上拉 1 CRC 错误、命令/地址奇偶错误、温度事件共用的告警线。低有效,多器件线与 RESET_n主控→DRAM 单端,低有效 1 上电与异常恢复复位;需在 VDD 稳定后保持低电平足够时间再释放
TEN主控→DRAM 单端,高有效 1 测试 / 连通性测试模式使能(Test Enable)。正常运行时保持无效电平,建议预留下拉 Loopback(反馈输出)DRAM→主控 单端 / 专用反馈 1~2(依型号) 训练反馈通道,把 DRAM 内部采样到的时钟/数据相位回传主控,用于 Loopback 训练与 DFE 收敛 ZQ外接电阻 模拟 1 外接 240 Ω ±1% 精密电阻,作为 ODT 与驱动强度校准基准
VDD / VDDQ电源 1.1 V 多球 核心与 I/O 电源,通常同电位、同层铜皮,分别去耦 VPP电源 1.8 V 1~2 球 字线升压;电流小但对噪声敏感,靠近颗粒放置 0.1 µF VSS / VSSQ地 0 V 多球 与电源球交错,保证每个数据球旁有回流地孔
HSCL / HSDA(模组)双向 开漏,I2C / I3C 2 管理总线,挂 SPD Hub、PMIC(及温度传感器)。需外部上拉,速率 100 kHz ~ 12.5 Mbps(I3C SDR/HDR)
信号层面的两个易错点
① ALERT_n 是开漏 ,板上必须有上拉;若多 rank 共用一根 ALERT_n,需确认主控能区分是哪一个 rank 触发(通常靠逐个 rank 查询 MR 状态位)。② TEN 与 Loopback 引脚名在不同厂商间命名不完全一致 (部分厂商写作 TEN / LBDQ / LB_DQS 等),原理设计时务必按目标 datasheet 校对,不要照抄参考设计的网络名。
2.2 CA 总线:命令如何被「串行化」
DDR5 的命令由 CA 总线在 1 个(1T)或 2 个(2T)CK 周期 内传输。第一个周期传输命令码与部分地址,第二个周期(若需要)传输剩余地址与 Bank/Bank Group 位。主控侧通过 CA 训练(CA Training)确定采样点,DRAM 侧通过内部 VREF 与(部分器件的)CA 端接保证信号质量。
命令 CA 周期数 承载内容 说明
ACTIVATE(ACT) 2T 命令码 + Row 地址 + BG/Bank 打开一行;DDR5 32 bank 需要更多 Bank 位 READ / WRITE 1T 或 2T 命令码 + Column 地址 + BG/Bank + AP(自动预充电) BL16 时列地址按 16 突发对齐 PRECHARGE(PRE) 1T / 2T 命令码 + Bank 或 All-Bank 标志 关闭行,为下次 ACT 做准备
REFRESH(REFab) 1T 命令码 All-Bank Refresh,需满足 tRFC1 REFRESH(REFsb) 1T 命令码 + Bank 地址 Same-Bank Refresh,仅刷新指定 bank,其余 bank 可继续工作 MODE REGISTER WRITE/READ(MRW/MRR) 2T 命令码 + MR 地址 + 数据 训练期间高频使用;写 MR 后需等待 tMRD / tMOD
ZQ CALIBRATION 1T 命令码 + Long/Short 标志 上电需 ZQCL(长校准),退出自刷新后常用 ZQCS MPC(Multi-Purpose Command) 2T 命令码 + 操作码 承载训练模式进入/退出、DFE 使能、VREF 设置、Loopback 使能等 RFM(Refresh Management) 1T 命令码 + Bank 行锤缓解:对高频激活区域发起额外刷新
NOP / DESELECT 1T — CK 边沿采样到 CS_n 无效或空操作码
CA 总线的硬件含义
引脚数下降: 取消 RAS#/CAS#/WE#/ACT#/BA/ADDR 分立引脚后,x8 颗粒的地址命令类引脚从 DDR4 的约 25 根降到 15 根,为电源与地腾出球位(这也是 DDR5 能在 1.1 V 下保持电源完整性的前提之一)。
时序余量下降: CA 是 SDR 但速率等于 fCK(最高 4.4 GHz 命令率),建立保持窗口极小,必须做 CA 训练(VREF + 延迟),且 CA 走线必须 Fly-by 等长、末端端接。
2T 命令降低效率: 高频下主控常自动切到 2T 命令时序(类似 DDR 的 2T 模式),会损失少量带宽,属正常现象,不要误判为故障。
调试难度上升: 逻辑分析仪无法像 DDR3 那样「看引脚知命令」,必须使用支持 DDR5 CA 解码的协议分析仪或依赖主控训练日志。
2.3 BL16 / BC8、子通道与同帧 ECC
突发长度 BL16 与 Burst Chop BC8
项目 数值 / 规则 说明
标准突发长度 BL16 单次读/写传输 16 个数据节拍,在 DQ 上占用 8 个 CK 周期(DDR 双沿) Burst Chop BC8 半突发,传输 8 个节拍,用于不满 32 B 的访问,减少无用数据搬移 子通道单次传输量 32 bit × 16 = 64 B BL16 下单个子通道一次突发 = 64 B;两个子通道并发 = 128 B
与缓存行的对齐 64 B 缓存行 = 单子通道 1 次 BL16 这是 DDR5 选择 BL16 的核心原因:与主流 CPU 64 B 缓存行天然对齐 预取 16n 阵列一次读出 16n,对外以 BL16 吐出
同帧 ECC(Same-Frame ECC)与片上 ECC 的区别
类型 位置 位宽 对系统的可见性 设计注意
On-die ECC(片上 ECC) DRAM 颗粒内部 内部校验,不占用任何外部引脚 完全透明,主控无感知 提升阵列良率与保持特性,但不能替代系统级 ECC :无法检测 DQ 链路上的传输错误 同帧 ECC(Link / Same-Frame ECC) 主控 ↔ DRAM 链路 每 32 bit 数据配 8 bit 校验(CB[7:0]) 主控可见,需 SECDED 引擎 校验位与数据在同一帧内传输 ,不额外增加传输周期;代价是每子通道多 8 根线 传统 ECC(DDR4 x72) 模组级 64 bit 数据 + 8 bit ECC 主控可见 需要把总线扩展到 72 bit,所有 DQ 走线与颗粒数量增加 1/8
为什么 DDR5 说「不扩展数据宽度」
DDR5 的 40 bit 子通道中,32 bit 是数据、8 bit 是校验。相比 DDR4 的 72 bit(64 数据 + 8 校验)方案,DDR5 的校验位比例是 DDR4 的两倍 (32:8 而非 64:8),因此可以实现更强的纠错(部分主控可做到 SECDED 之外再检测部分多比特错误)。所谓「不扩展数据宽度」指的是:校验位不作为独立的一颗 x8 颗粒挂在总线上扩展总线位宽,而是与数据同帧、同子通道、同突发传输 ,颗粒位宽仍是 x8/x16,总线调度不因 ECC 而变复杂。若主控不使用 ECC,CB 位并非简单悬空 ——需按主控与器件 datasheet 处理(常见做法为接地或保持端接),切勿凭经验悬空。
2.4 刷新机制与 Same-Bank Refresh
刷新类型 粒度 典型周期 性能影响 使用建议
All-Bank Refresh(REFab) 整个器件全部 bank tRFC1(≈295 ns @16 Gb) 期间所有 bank 不可访问,延迟尖峰明显 上电初始化、空闲窗口、或无法做细粒度调度时使用 Same-Bank Refresh(REFsb) 单个 bank tRFCsb(≈130 ns @16 Gb) 仅目标 bank 阻塞,其余 31 个 bank 可继续服务 业务态首选;主控需支持 REFsb 调度才能受益 Fine Granularity Refresh 可配置比例 按 MR 设置 把刷新开销摊薄 高温场景优先启用
RFM / ARFM(行锤缓解刷新) Bank 或 Bank Group 按激活计数触发 少量额外刷新开销 必须启用;由主控或 DRAM 内部计数触发
刷新开销估算(单 rank,2 个 16 Gb x8 颗粒组 32 bit 子通道):
标准刷新:tREFI = 3.9 us -> 1 s 内 256,000 次 REFab
每次 tRFC1 ≈ 295 ns -> 占用率 = 256000 x 295ns / 1s ≈ 7.5%
同帧拆分为 REFsb(假设把 32 bank 分为 32 次,每次 tRFCsb ≈ 130 ns):
总刷新次数不变,但单次阻塞从 295 ns 降到 130 ns
最坏情况单次阻塞降低约 56%,延迟尖峰明显改善
高温(> 85 C):tREFI 折半为 1.95 us -> 占用率约 15%,带宽可观测下降
=> 热设计目标:Tcase 控制在 85 C 以下,避免进入 2x 刷新区
2.5 模式寄存器与训练相关 MR
DDR5 的模式寄存器数量显著多于 DDR4,训练相关的设置项分散在多个 MR 中。下表列出与硬件设计/调试最相关的项(地址与位定义以 JESD79-5 与目标 datasheet 为准 ):
MR 类别 可配置内容 硬件/调试关联
MR0~MR5(基础) BL、CL、WR/RTP、驱动强度、ODT 相关基础项 初始化第一批发写;写错会直接导致训练失败 MR(写均衡) Write Leveling 使能 / 输出使能 需要 DQS 与 CK 走线可测;训练失败时优先排查 DQS/CK 拓扑 MR(Read Leveling) Read Leveling / DQS 延迟链设置 与 DQ-DQS 组内等长强相关
MR(VREF) 内部 VREF 档位、VREF 训练范围与步进 VREF 不合理会表现为高温/低压下随机错 MR(DFE) DFE 使能、抽头数量、系数加载 DFE 不收敛时优先查通道插损与残桩 MR(DCA) Duty Cycle Adjuster 占空比调整 CK 占空比失真 > 2% 时补偿
MR(CA 训练) CA 训练模式进入/退出、CA VREF、CA ODT CA 走线 Fly-by 末端端接不良时训练不通过 MR(CS 训练) CS_n 训练模式 多 rank 时逐 rank 单独训练 MR(Loopback) Loopback 反馈输出使能与选择 需要 PCB 上 Loopback 网络连通且不被误接上拉/下拉
MR(RTT) RTT_NOM_RD / RTT_NOM_WR / RTT_WR / RTT_PARK 端接值选择见第 7 章 MR(刷新) REFsb 使能、FGR 比例、RFM/ARFM 配置 行锤与高温可靠性相关 MR(温度) 温度读出、热节流阈值、ALERT_n 温度事件使能 与 SPD Hub 内 TS 读数交叉核对
MR(ECC / CRC) ECC 使能、写 CRC、错误状态与计数读出 ECC 报错排查的核心入口
典型初始化写 MR 序列(示意,顺序与延时以主控 MRC 与 datasheet 为准)
1. 供电稳定(VDD/VDDQ 1.1 V、VPP 1.8 V),拉低 RESET_n
2. RESET_n 保持低 >= tPW_RESET(典型 1 us 量级,以 datasheet 为准)
3. 释放 RESET_n,等待 tXPR(典型几百 ns ~ us)
4. 拉高 CKE 类使能(DDR5 由命令/CS 管理,按主控要求执行)
5. ZQCL(长校准),等待 tZQINIT(典型 1 us 量级)
6. MRW:设置 BL=16、CL、tWR、驱动强度、RTT_PARK
7. MRW:进入 Write Leveling 模式 -> 训练 -> 退出
8. MRW:CA 训练模式 -> CA VREF / CA 延迟训练 -> 退出
9. MRW:Read Leveling / DQS 延迟训练
10. MRW:内部 VREF 训练(逐字节、逐子通道)
11. MRW:DFE 使能 + 系数训练
12. MRW:DCA(占空比)训练
13. MRW:Loopback 训练(若主控与颗粒支持)
14. MRW:正常模式,进入 IDLE,开始正常读写
15. 周期性:ZQCS(短校准)、VREF 重训练、温度触发重训练
2.6 带宽与容量计算
速率等级 tCK (ns) 单子通道带宽 (GB/s) DIMM(双通道,64 bit)带宽 (GB/s) 典型 CL-tRCD-tRP(JEDEC 常见值) tAA (ns)
DDR5-3200 0.625 12.8 25.6 22-22-22 13.75 DDR5-3600 0.556 14.4 28.8 26-26-26 14.44 DDR5-4000 0.500 16.0 32.0 30-30-30 15.00
DDR5-4400 0.455 17.6 35.2 34-34-34 15.45 DDR5-4800 0.417 19.2 38.4 40-40-40 16.67 DDR5-5200 0.385 20.8 41.6 42-42-42 16.15
DDR5-5600 0.357 22.4 44.8 46-45-45 16.43 DDR5-6000 0.333 24.0 48.0 48-48-48 16.00 DDR5-6400 0.313 25.6 51.2 52-52-52 16.25
DDR5-7200 0.278 28.8 57.6 58-58-58 16.11 DDR5-8000 0.250 32.0 64.0 64-64-64 16.00 DDR5-8800 0.227 35.2 70.4 70-70-70 15.91
带宽计算公式(理论峰值)
单子通道峰值 (B/s) = 速率(MT/s) x 子通道位宽(bit) / 8
例:DDR5-6400 单子通道 = 6400 x 32 / 8 = 25,600 MB/s = 25.6 GB/s
单个 DIMM 峰值 = 速率 x 64 / 8 (双 32 bit 子通道合计)
例:DDR5-6400 DIMM = 6400 x 64 / 8 = 51.2 GB/s
注意:若启用 ECC(CB[7:0]),链路总位宽为 (32+8) x 2 = 80 bit,
但「数据带宽」仍按 64 bit 计算,校验位不承载用户数据。
有效带宽 = 峰值 x 效率系数
效率系数典型:Stream 类连续流 0.85~0.92
随机小粒度访问 0.25~0.45
受 tRC / tREFI / 刷新占用率 / 读写翻转惩罚影响
板载(down)方案容量计算:
单子通道容量 = 颗粒容量(bit) x 颗粒数 / 8
例:4 颗 x8 16 Gb -> 16 Gb x 4 / 8 = 8 GB(单子通道)
两子通道共 8 颗 -> 16 GB
2.7 多 Rank、3DS 与容量组织
概念 定义 电气影响 设计注意
Rank 共享同一组 CA/CS 的一组颗粒,一次访问只选通一个 rank DQ 总线负载增加(多 rank 时 DQ 为多点分支) 每 rank 需独立 CS_n;Fly-by 顺序必须与主控期望一致 3DS(3D Stacked) 单封装内堆叠 2~8 个 die,通过 CS_n_A / CS_n_B 与内部 CID 选择 负载与单点分支类似多 rank,但走线更短 需确认主控支持 3DS;上电训练项增加 颗粒位宽组合 x4 / x8 / x16 x4 需要 8 颗组 32 bit,负载最重但密度最高 板载方案优先 x16(2 颗/子通道,走线最短)
最大容量 单 DIMM 可达 128 GB+(RDIMM / 3DS / TSV 组合) 容量越大,刷新与地址位越多 地址位增加会提高 CA 2T 命令占比
2.8 模组上的关键器件:RCD / DB / PMIC / SPD Hub
器件 全称 应用形态 作用 设计要点
RCD Registering Clock Driver RDIMM(必选) 对 CK、CA、CS 进行寄存与再驱动,隔离颗粒负载;支持 CA 端接与内部均衡 由 PMIC 供电;主控侧必须按 RCD 的寄存器做训练(RCD 引入固定延迟,需补偿) DB Data Buffer LRDIMM(必选) 对 DQ / DQS / DM 缓冲,把颗粒侧数据负载隔离 DDR5 LRDIMM 常用 MRCD/MDB(多路复用型);会增加约数 ns 往返延迟 PMIC Power Management IC 所有 DDR5 模组 输入 5 V 或 12 V,输出 VDD / VDDQ / VPP 三路;SMBus/I3C 可配置与遥测(电压、电流、温度、故障) UDIMM/SODIMM 通常 1 颗;RDIMM 常见 2 颗(分别供两个子通道区域)。输出电压与时序由模组厂商预设,也可由主控改写
SPD Hub Serial Presence Detect Hub 所有 DDR5 模组 存储 SPD 数据,并作为 I3C/I2C hub 管理 TS(温度传感器)与其他从设备 内含 TS(典型 1~2 个温度传感点);主控通过它读取温度并触发热节流 TS Temperature Sensor 集成于 SPD Hub 或分立 提供 DIMM 温度,用于刷新率切换与节流 读数与 DRAM 内部 MR 温度寄存器应交叉核对
管理总线(HSCL / HSDA)的硬件要求
项目 要求 说明
协议 I2C 兼容 + I3C(MIPI I3C Basic) 上电阶段以 I2C 模式通信,主控可切换到 I3C 提升遥测速率 速率 100 kHz / 400 kHz / 1 MHz(I2C);最高 12.5 Mbps(I3C SDR) 高速模式需重新核算上拉与总线电容 上拉电阻 典型 1.5 ~ 4.7 kΩ(依电压与总线电容) 上拉到管理电源(模组侧常为 3.3 V 或 1.8 V,以规范为准);主控侧需匹配电平
总线电容 ≤ 100 pF(I2C 400 kHz 常规上限) 多插槽并联会累加,需核算或加总线缓冲 地址 SPD Hub 与 PMIC 各有独立地址,由 SA0~SA2 类引脚设定 多插槽时必须保证地址不冲突;原理设计预留地址配置电阻 PCB 走成对、远离高速信号、包地 虽是低速总线,但被干扰会导致 SPD 读取失败、整机点不亮
管理总线是最容易被忽略的「点不亮」根因
若 HSCL/HSDA 上拉缺失、上拉电源域错误、或多插槽地址冲突,表现为主控读不到 SPD → 无法确定内存参数 → 直接拒绝初始化 ,且不会给出有意义的高速报错。原理设计阶段必须:① 确认上拉电源域;② 为 SA0~SA2 留 0 Ω 可选配置;③ 在管理总线上预留测试点(但不要加拉低总线电容的测试焊盘)。
3 · 电源设计
DDR5 电源设计的第一原则是:电压调节从主板下沉到内存条 。模组方案主板只负责送 5 V 或 12 V;板载(down)方案则必须由设计者自己完成整条 PMIC / DC-DC 链路。1.1 V 下 ±3% 的 AC 噪声预算(约 33 mV)决定了这一章的每一项都不能打折。
3.1 电源域与容差
电源域 标称值 来源(模组方案) 来源(板载方案) 容差要点
VDD(核心) 1.1 V On-DIMM PMIC 自建 PMIC / 单相或多相 buck DC 精度 + 纹波 + 瞬态总和需满足 datasheet(典型 ±3% AC) VDDQ(I/O) 1.1 V On-DIMM PMIC(常与 VDD 同路或独立路) 可与 VDD 共用,也可通过磁珠/电感隔离 高频噪声直接叠加在 DQ 上,去耦必须到颗粒 VPP(字线升压) 1.8 V On-DIMM PMIC 第三路 小电流 LDO 或 buck(几十 mA 量级) 电流小但需独立去耦,避免与 VDD 共用同一滤波节点
管理电源(模组侧) 1.8 V / 3.3 V(依规范) 主板常供 VIN_SPD 类电源 按颗器件确定 给 SPD Hub / PMIC 控制逻辑供电,掉电时通常需保持或受控 ZQ / VREF — 内部生成 内部生成 ZQ 外接 240 Ω ±1%,温度系数 ≤ 100 ppm/°C 更好
噪声预算拆解(以 VDD = 1.1 V 为例,数值按目标 datasheet 复核)
总容差(典型) : ±3% -> ±33 mV
其中建议分配:
DC 设定误差 : ≤ 8 mV (PMIC 反馈电阻 0.5% + 基准源误差)
低频纹波 (<1MHz): ≤ 10 mV (由 buck 输出电感/输出电容决定)
高频噪声 (>1MHz): ≤ 8 mV (由陶瓷去耦阵列与平面电容决定)
瞬态跌落 : ≤ 7 mV (由负载阶跃响应与 bulk 电容决定)
=> 只要有一项超预算,就会在眼图上直接表现为:写眼收窄、VREF 训练窗口变窄、
高温下随机错。不要指望「靠训练救回来」——训练能补偿时序,补偿不了电源噪声。
3.2 On-DIMM PMIC
项目 典型规格 设计说明
输入电压 5 V(SODIMM / 多数 UDIMM)或 12 V(服务器 RDIMM) 由模组形态决定;主板只送一种,原理设计前先确认插槽定义 输出通道 3 路:VDD / VDDQ / VPP 部分 PMIC 集成第四路(管理电源)或 LDO 输出电流能力 VDD+VDDQ 合计可达数十 A 量级(依 PMIC 与模组) 主板 5 V/12 V 电源必须按满配模组数量留余量(见 3.3)
控制接口 I2C / I3C(SMBus 兼容) 与 SPD Hub 挂在同一条 HSCL/HSDA 上,地址不同 遥测 输出电压、电流、温度、故障状态 BMC / BIOS 读取用于热节流与故障上报 可配置性 输出电压、软启动、保护阈值、开关频率 默认值由模组厂商写入;主控可改写(部分平台锁定)
故障行为 OVP / UVP / OCP / OTP → 关断或告警 ALERT_n 与 PMIC 状态寄存器是排查电源问题的第一入口 数量 UDIMM / SODIMM 通常 1 颗;RDIMM / LRDIMM 常见 2 颗 两颗时地址需区分,遥测要分别读取
3.3 板载(down)方案与主板供电规划
板载 vs 插槽的取舍
维度 板载颗粒(down) 插槽模组(UDIMM/RDIMM)
信号质量 走线最短(可 ≤ 3 inch),无连接器损耗,最容易跑到 6400+ 优 插槽引入 1~2 dB 插损与阻抗不连续,速率上限受限 容量灵活性 出厂即固定 劣 现场可更换、可扩容 优 电源责任 设计者全责:PMIC 选型、时序、去耦、PDN 由模组 PMIC 承担,主板只需送 5 V/12 V
成本与库存 BOM 低,但颗粒需按项目备货 BOM 高(含 PMIC/SPD/RCD),但模组通用 维修性 BGA 返修困难 换条即可 适用场景 嵌入式、边缘计算、空间受限、固定配置 服务器、PC、工控、需现场扩容的场景
板载方案电源预算估算(示例,数值需按实际器件复核)
单颗 DDR5 x8 颗粒工作电流(估算量级):
IDD0(激活待机) ~ 40~70 mA
IDD4R(读,6400 MT/s) ~ 150~250 mA
IDD4W(写,6400 MT/s) ~ 180~300 mA
IDD5B(刷新) ~ 200~350 mA
IDD2P(低功耗) ~ 15~40 mA
8 颗粒(16 GB,双 32 bit 子通道)满负荷估算:
I_VDD ≈ 8 x 0.25 A = 2.0 A(读写峰值可到 3 A)
I_VDDQ ≈ 0.5~1.5 A(与 DQ 翻转率和端接电流相关,端接电流不可忽略)
I_VPP ≈ 10~30 mA(很小,但需独立路)
输入侧(12 V)电流:
总功率 ≈ 1.1 V x 3.5 A + 1.1 V x 1.5 A + 1.8 V x 0.03 A ≈ 5.6 W
I(12V) ≈ 5.6 W / 12 V / 0.9(效率) ≈ 0.52 A
多插槽场景(服务器,8 条 RDIMM @ 12 V):
单条峰值按 25~40 W 计 -> 8 条 ≈ 200~320 W
=> 12 V 输入需 ≥ 30 A,必须独立电源层 + 多盎司铜厚
多插槽主板的 5 V / 12 V 分配
模组方案下,主板的 5 V/12 V 是唯一 的供电通道,其纹波会被 PMIC 的 PSRR 部分抑制,但低频跌落无法抑制。设计时必须:① 按满配最高速率模组 计算输入电流并留 ≥ 20% 余量;② 电源层铜厚 ≥ 2 oz(服务器建议内层电源用 2 oz 或加铺);③ 每条插槽附近布置 bulk 电容(见 3.4);④ 避免与 GPU / 电机 / 大电流 DC-DC 共用同一路。
3.4 去耦电容配置
位置 容值与数量(每颗粒 / 每条 / 每路) 封装 作用频段 备注
颗粒 VDD 球附近(背面) 0.1 µF × 1~2 + 0.01 µF × 1(每颗) 0201 / 0402 10~100 MHz 必须背面贴装、过孔最短;0.01 µF 优先选低 ESL 型 颗粒 VDDQ 球附近 0.1 µF × 1 + 0.047 µF × 1(每颗) 0201 / 0402 10~150 MHz I/O 电源噪声直接进 DQ 眼图,优先级最高 颗粒 VPP 0.1 µF × 1(每颗) 0402 — 靠近 VPP 球,回流路径短
子通道区域中频 1 µF / 2.2 µF × 每 2 颗 1 只 0603 / 0805 1~10 MHz 均匀铺开,不要集中在一处 Bulk(每个子通道区) 10 µF / 22 µF × 2~4 0805 / 1206 100 kHz~1 MHz 陶瓷优先;低 ESL 阵列电容更佳 VRM 输出(板载方案) 100~330 µF(陶瓷 + 聚合物并联) 1210 / 钽 / 聚合物 < 100 kHz 聚合物电容提供 ESR 阻尼,抑制反谐振峰
插槽附近(每条 DIMM) 10 µF × 2~4 + 1 µF × 4~6(输入 5 V/12 V) 0805 / 1206 输入侧保持 输入电容不足会在负载跳变时拉垮输入轨
去耦布局硬规则
1. 高频电容(0.1 / 0.01 uF)必须贴在颗粒背面、正对电源球,
过孔到焊盘距离 <= 1.0 mm,过孔到平面 <= 0.5 mm。
2. 每个电容至少 2 个过孔到电源平面、2 个过孔到地平面,禁止共用过孔。
3. 电容本体到 BGA 的距离优先于「布线美观」:宁可绕线,不要挪走电容。
4. 不同容值电容不要排成一条直线(会造成同一方向的反谐振),
采用交错 / 棋盘式布置。
5. 0201 与 0402 混用时注意回流焊的立碑风险,0402 更稳妥。
6. 板载方案在 VRM 输出侧预留 1~2 个 bulk 焊位,便于调试时调整 ESR/容值。
3.5 上电 / 掉电时序
DDR5 上电 / 复位 / 初始化时序(示意,时间轴非等比)
t0 使能 t1 管理电源 OK t2 VDD 达 90%
t3 RESET_n 释放 t4 ZQCL 完成 t5 训练阶段 t6 正常读写
管理/备用 电源 1.8 V / 3.3 V(管理域,先行建立)
VDD / VDDQ 1.1 V 单调上升,禁止回勾
≥ 200 us 稳定期(典型,以 datasheet 为准) VPP 1.8 V
VPP 与 VDD 同时或先于 VDD 建立,任意时刻 VPP ≥ VDD RESET_n (低有效)
整段供电爬升期间保持低电平 释放后需等待 ≥ 规定时间(tXPR 量级)才允许发第一条命令 (见下)
ZQCL CA / WL / RL 训练
VREF / DFE / DCA 此区间:控制器、PLL、PHY 上电,命令总线保持无效态
图 3-1 DDR5 上电与复位时序:管理电源先行、VDD/VDDQ 单调上升、VPP 同步或提前、RESET_n 全程拉低并在电源稳定后释放
上电时序规则(整理版,所有延时以目标 datasheet 为准)
seq:
1) 管理/备用电源建立(1.8 V 或 3.3 V,按模组规范)
2) 模组输入电源 5 V / 12 V 建立并稳定
3) On-DIMM PMIC 完成软启动,输出 VPP(1.8 V) 与 VDD/VDDQ(1.1 V)
- VPP 与 VDD 的先后关系:VPP 同时或先于 VDD 建立
- 任意时刻满足 VPP >= VDD
- VDD 与 VDDQ 之间通常要求同时或 VDDQ 不晚于 VDD
4) 电源稳定并维持足够时间(典型 >= 200 us 量级)后释放 RESET_n
5) RESET_n 释放后等待 tXPR(量级数百 ns ~ us)才允许发第一条命令
6) ZQCL(长校准)-> tZQINIT 等待
7) 训练序列(详见第 5 章)
8) 正常读写
掉电时序:
a) 停止所有访问,发出 PRECHARGE ALL 关闭所有行
b) 进入自刷新(若需保持数据)或直接下电
c) 拉低 RESET_n(推荐),确保 DRAM 处于确定态
d) 撤除 VDD / VDDQ / VPP:VPP 同时或晚于 VDD 撤除
e) 严禁在 VDD 未撤除时单独撤除 VPP(字线偏置异常风险)
违反后果:
- VDD 上升非单调 / 回勾 -> 内部状态机卡死,表现为上电后不响应
- VPP 晚于 VDD -> 字线驱动不足,读写失败或单元损伤
- RESET_n 释放过早 -> 初始化不完整,训练阶段随机失败
自刷新与掉电保持
模式 进入方式 电流量级 保持要求 说明
自刷新(Self-Refresh) SRE 命令 数 mA ~ 数十 mA(随温度上升) VDD/VDDQ/VPP 均需保持 数据保持靠内部刷新;温度越高刷新越频繁、电流越大 自刷新掉电(SRPD) 自刷新 + 关时钟 更低 同上 CK 可停,进一步省电 最大省电 / 深度掉电 依器件支持情况 最低 部分器件可断 VDDQ 需确认退出流程与时间,切勿凭经验操作
完全掉电 直接断电 0 — 数据丢失;必须按掉电时序执行
3.6 功耗与热管理
项目 典型值 / 规则 说明
温度传感(TS) SPD Hub 内置(典型 1~2 点)+ 颗粒内部 MR 温度 两路读数应定期交叉核对,偏差过大说明散热或传感器异常 刷新率切换点 Tcase ≈ 85 °C 超过后 tREFI 由 3.9 µs 折半到 1.95 µs,带宽可观测下降 5%~15% 热节流触发 由主控按 TS 读数决定,阈值依平台 典型行为:降速率 / 降并发 / 限带宽,严重时报错
模功耗(DDR5 DIMM) 空闲 2~5 W;满载 10~30 W(依容量与速率) 服务器满配机箱内是主要热源之一 散热措施 散热片、导热带、强制风道(≥ 1.5 m/s 通过模组表面) 散热片需与颗粒顶面贴合,导热垫厚度 0.5~1.5 mm 布局避让 模组与 CPU / GPU 热源间距 ≥ 20 mm 或加导流 避免下游模组处于上游热风出口
热节流不是「保护功能」,是性能事故
DDR5 速率越高、功耗越大,且 tREFI 本身只有 DDR4 的一半,高温时进一步折半。工程上应把Tcase ≤ 85 °C 作为硬性设计目标 (工温场景按器件规格)。若在整机测试中发现内存带宽随运行时间下降,第一步应读取 SPD Hub 的 TS 与 PMIC 遥测温度,确认是否进入 2× 刷新或节流区,而不是先怀疑信号完整性。
3.7 PDN 目标阻抗与电源完整性
目标阻抗法(板载方案必做,模组方案做输入侧)
Z_target = 允许纹波电压 / 最大瞬态电流
例:VDD = 1.1 V,允许高频纹波 15 mV,最坏阶跃电流 6 A
Z_target = 15 mV / 6 A = 2.5 mΩ
控制频段:
F_max = 1 / (2 x pi x t_r) 或经验取 0.35 / t_r
若电流阶跃上升时间 t_r = 50 ns -> F_max ≈ 7 MHz(由 bulk 与中频电容覆盖)
若 t_r = 5 ns -> F_max ≈ 70 MHz(必须由陶瓷阵列 + 平面电容覆盖)
分层控制建议:
< 100 kHz : VRM 环路 + bulk(聚合物 / 电解)
100 kHz~2 MHz : 中频陶瓷(10 / 22 uF)
2 MHz~80 MHz : 高频陶瓷(0.1 / 0.047 / 0.01 uF)+ 电源/地平面对电容
> 80 MHz : 封装内电容 + 芯片内电容(设计者只能通过平面与过孔优化)
平面电容(薄介质电源地平面对)是最便宜的 >100 MHz 去耦:
采用 2~4 mil 介质(PP 106 / 1080)紧耦合电源地平面,
单位面积电容约 100~250 pF/cm^2,ESL 极低。
检查项 目标 仿真 / 测量手段
DC 压降(IR Drop) VRM 到最远端颗粒 ≤ 允许 DC 误差的一半 电源完整性 DC 仿真(如 Cadence Sigrity / Ansys SIwave) AC 阻抗曲线 目标频段内 Z ≤ Z_target,且无明显反谐振峰 PDN AC 仿真 + 去耦方案优化 反谐振峰 峰值阻抗 ≤ 1.5 × Z_target 调整电容容值梯度或增加 ESR(聚合物电容)
瞬态响应 峰峰值 ≤ 噪声预算 时域仿真 + 实测(示波器 + 电源纹波探头) 实测纹波 20 MHz 带宽限制,使用同轴/点测探头 禁止使用长接地线(会引入数十 mV 假噪声)
4 · 典型应用电路
本节给出三种落地形态的原理图(内联绘制):板载颗粒点对点、UDIMM/SODIMM 插槽、RDIMM(含 RCD)。所有网络均按第 6 章的阻抗与等长规则布线。
4.1 板载(down)颗粒点对点方案
DDR5 板载(down)点对点方案 —— 单子通道 32 bit(4 × x8 颗粒)
CPU / SoC 集成 DDR5 控制器 + PHY CK_A_t / CK_A_c CA_A[13:0] CS_A_n
DQ_A[31:0] DQS_A_t/c ×4 DM_A_n ×4 CB_A[7:0] ALERT_n RESET_n
TEN Loopback_A / _B HSCL / HSDA (子通道 B 引脚对称存在, 本图省略绘制)
U1 DDR5 x8 16 Gb DQ[7:0] / DQS / DM_n / FBGA-82
U2 DDR5 x8 16 Gb DQ[15:8] / DQS / DM_n U3 DDR5 x8 16 Gb DQ[23:16] / DQS / DM_n
U4 DDR5 x8 16 Gb UECC DDR5 x8(CB[7:0]) 校验位颗粒(若主控启用同帧 ECC)
CK_A_t/c 差分 80 Ω,Fly-by,等长 ±10 mil
CA_A[13:0] + CS_A_n:Fly-by 依次串联 4 颗,末端端接 Rtt CA 端接
DQ_A[31:0] + DQS_A ×4 + DM_A_n ×4(点对点,每字节组独立等长) DQ 不经 CA 的 Fly-by,直接点对点到对应颗粒
CB_A[7:0] 校验位,与 DQ 同帧、同子通道等长
10k ALERT_n 开漏,需上拉;多 rank 线与
10k RESET_n:下拉保证上电为低;建议主控 GPIO 可拉高
TEN:正常工作保持无效,预留下拉(电平依 datasheet) Loopback:训练反馈回主控,禁止误接上拉/下拉
PMIC / 多路 DC-DC(板载方案自建) 5 V 或 12 V 输入 → VDD 1.1 V / VDDQ 1.1 V / VPP 1.8 V 需软启动、Power Good、使能时序控制与遥测
VIN 5 V / 12 V VDD / VDDQ
VPP 1.8 V
去耦阵列 0.1 µF / 0.01 µF(颗粒背面)
240 Ω ZQ ±1%
每颗 DRAM 各配 1 只 240 Ω,距 ZQ 球 ≤ 5 mm,禁止过孔
图 4-1 板载点对点方案:CK/CA/CS 走 Fly-by 并末端端接,DQ/DQS/DM/CB 点对点,PMIC 自建三路电源,ZQ 与去耦贴近颗粒
板载方案逐网络说明
网络 连接 拓扑 端接 / 上拉 关键点
CK_A_t / CK_A_c SoC → 4 颗粒 Fly-by(串接,末端端接) 末端差分端接(典型 80 Ω 差分,或依 PDG) 差分对内 ±1~2 mil;全程同层;禁止分支 CA_A[13:0] SoC → 4 颗粒 Fly-by 末端单端端接(典型 40~60 Ω,端接电源依 PDG) 组内等长 ±10 mil;与 CK 长度差按 PDG(典型 ±20~50 mil) CS_A_n SoC → 每 rank 一根 Fly-by(与 CA 同序) 与 CA 同端接策略 单 rank 时可视为 CA 组成员一起等长
DQ_A[31:0] SoC ↔ 颗粒(每颗 8 bit) 点对点 片内 ODT(DRAM 侧 + 主控侧) 每字节组与对应 DQS 等长 ±3~5 mil DQS_A_t/c ×4 SoC ↔ 颗粒 点对点差分 差分 ODT 差分对内 ±1~2 mil;与 CK 的长度关系由 write leveling 补偿 DM_A_n ×4 SoC → 颗粒 点对点 同 DQ 与同字节组 DQ 等长
CB_A[7:0] SoC ↔ 校验颗粒 点对点 同 DQ 与 DQ 组等长,长度差纳入同组匹配 ALERT_n SoC ← 所有颗粒(线与) 多点 上拉 4.7~10 kΩ(电源域依 datasheet) 走线短、远离高速;预留测试点 RESET_n SoC → 所有颗粒 多点 下拉 1~10 kΩ + 可拉高 上电期间必须为低;注意复位期间不得浮空
TEN SoC → 所有颗粒 多点 下拉(依 datasheet) 仅测试/训练使用,正常保持无效 Loopback SoC ← 颗粒 点对点 不加上下拉 反馈训练用,走线等长到主控,禁止并联 ZQ 颗粒 → 240 Ω → 地(或指定电位) — — 每颗 1 只;≤ 5 mm;1% 精度
VDD / VDDQ / VPP PMIC → 颗粒 平面 / 铜皮 去耦阵列见 3.4 VPP 独立走线与去耦
4.2 UDIMM / SODIMM 插槽方案
DDR5 模组方案:主控 ↔ 288 pin 插槽 ↔ UDIMM / RDIMM(含 On-DIMM PMIC 与 SPD Hub)
CPU / SoC / BMC CK_A/B、CA_A/B、CS_A/B DQ_A/B[31:0]、DQS_A/B DM_A/B、CB_A/B[7:0] ALERT_n / RESET_n / TEN
Loopback_A / Loopback_B HSCL / HSDA(管理) GPIO / 在位检测 主控侧完成全部训练: CA / WL / RL / VREF / DFE / DCA / Loopback
主板电源 5 V(UDIMM/SODIMM)
或 12 V(RDIMM)
288 pin DDR5 插槽(UDIMM / RDIMM) 金手指 30 µ" Au,卡口防呆 DDR5 DIMM(模组侧)
DDR5 颗粒阵列 子通道 A:4~8 颗(32 bit + 8 CB) 子通道 B:4~8 颗(32 bit + 8 CB)
RCD 寄存时钟驱动器 (RDIMM 必选)
DB / MDB (LRDIMM 才有,缓冲 DQ)
On-DIMM PMIC 5 V / 12 V → VDD 1.1 V / VDDQ 1.1 V / VPP 1.8 V(SMBus/I3C 可配)
SPD Hub + TS 温度传感 SPD 数据 + I3C Hub 地址由 SA0~SA2 设定 热节流温度上报
VDD/VDDQ/VPP
HSCL/HSDA 模组内部管理总线
高速总线:CK / CA / CS / DQ / DQS / DM / CB / Loopback(差分 80 Ω、单端 40 Ω) 5 V / 12 V → 模组 PMIC
上拉
管理侧:ALERT_n 上拉、RESET_n 可控、TEN 下拉 输入侧去耦:每条插槽 10 µF ×2~4 + 1 µF ×4~6(见 3.4) 主控到插槽走线:6400 MT/s 时建议 ≤ 4~6 inch,含连接器损耗按第 6 章核算
图 4-2 模组方案:主板只送 5 V/12 V 与管理总线,电压调节由 On-DIMM PMIC 完成;RDIMM 的 CK/CA/CS 经 RCD 寄存,LRDIMM 的 DQ 再经 DB 缓冲
插槽方案设计要点
项目 要求 说明
插槽选型 必须使用 DDR5 专用 288 pin 插槽(与 DDR4 物理不兼容) 卡口位置与 DDR4 不同;不可混插,也不可用 DDR4 插槽替代 金手指镀层 推荐 30 µ"(0.76 µm)硬金,插拔寿命 ≥ 25 次 15 µ" 在多次插拔后接触电阻上升,会影响高速信号 插槽固定 两侧卡扣 + 定位柱;振动场景加锁固件 接触不良会表现为训练失败或间歇性报错
插槽下方布线 禁止在插槽正下方走高速线或放置过孔阵列 会造成参考平面不连续与插损恶化 输入电源 5 V 或 12 V(按插槽定义),每条独立限流/保护 热插拔(若支持)需缓启动与浪涌抑制 在位检测 预留机械/电气检测,避免空载插槽误报 多插槽系统按需关闭空槽的时钟与电源
SODIMM 262 pin,0.5 mm pitch,同样双 40 bit 子通道 空间受限,需注意插槽下方禁布区与模组高度 CAMM2 / LPCAMM2 压缩连接器,压接方式,走线更短 可支持更高速率(8000+);需专用连接器与压接工艺
4.3 RDIMM(含 RCD)方案的额外注意
项目 说明 设计动作
RCD 引入的固定延迟 CK/CA 经 RCD 再驱动,主控训练结果需包含 RCD 延迟 训练算法由主控 MRC 处理,硬件上只需保证 RCD 供电与旁路电容符合要求 RCD 电源 由 On-DIMM PMIC 供电(常见 1.1 V 域) 模组侧已处理;主板无需额外供 RCD 电源 CA 拓扑改变 主控 → RCD → 颗粒(两段) 主板只负责主控到插槽这一段;段内 Fly-by 由模组完成
DB(LRDIMM) DQ 也缓冲,往返延迟增加 延迟敏感场景慎用 LRDIMM;容量优先时选用 RCD 配置 部分平台在训练前需通过管理总线配置 RCD 寄存器 确认主控 MRC 支持该 RCD 型号(兼容性清单)
形态选择小结
速率优先 + 固定配置 → 板载 x16 颗粒 (走线最短、无连接器)。容量与可维护优先 → UDIMM/RDIMM 插槽 (≤6400 MT/s 稳妥,更高需严格评估通道余量)。空间受限 + 高速 → CAMM2/LPCAMM2 。电池供电 → LPDDR5(X) ,不要用 DDR5。
中文硬件技术文档系列 · DDR5 SDRAM 电路设计指南 · 以目标型号 datasheet 与主控 DDR 控制器设计指南为准
后续章节请下载「芯参谋」查看 ……(篇幅原因, 还有10章· 详见芯参谋→方案设计)
当前分享仅开放前 5 章正文。详细资料请在芯参谋客户端中打开完整文档。
打开路径:🔧解决方案&应用市场分析 -> 原理方案设计 -> DDR5_电路设计指南
📥 下载芯参谋客户端