只读分享解决方案文档原理方案设计📅 2026-09-21🔖 Rev 1.0✅ 长期有效
🔧解决方案&应用市场分析 -> 原理方案设计 -> uMCP_电路设计指南

uMCP_电路设计指南

生成时间 2026-09-21 23:25:54 长期有效

uMCP 电路设计指南

UFS + LPDDR 合封 · M-PHY 差分串行链路 · 六路电源域 · REF_CLK 参考时钟 · 297-ball HDI 扇出 · 链路训练与 DRAM 训练 | 编制日期 2026-09-21 | 版本号 Rev 1.0

本指南面向嵌入式与移动终端硬件工程师、Layout 工程师与底层软件工程师,覆盖 uMCP(UFS-based Multi-Chip Package,UFS + LPDDR 合封) 从器件选型、原理图与电源设计、启动时序、PCB Layout、热与可靠性、焊接生产到故障排查的完整链路,并给出可直接落地的参数、规则与检查清单。

2 套
完全独立的总线(UFS + LPDDR)
封装内部无任何信号互连,仅 VSS 共地
6 路
需独立设计的电源轨
VCC / VCCQ / VCCQ2 / VDD1 / VDD2 / VDDQ
297
焊球数(UFS 3.1 + LPDDR4X)
0.4 / 0.5 mm pitch,约 12 × 12 mm
11.6
Gbps/lane(M-PHY HS-G4)
2 lane 全双工,聚合 23.3 Gbps
一句话结论

uMCP 的电路设计难点不在 UFS 侧,而在 DRAM 侧。UFS 只需要 2 ~ 3 对差分,走线压力远小于 eMMC 的 11 根并行线;真正决定叠层、HDI 阶数与板成本的是 LPDDR4X 那约 60 根单端信号怎么从 0.4 / 0.5 mm pitch 的球阵列里扇出来。

uMCP 相对 eMCP 新增的风险点是:多了一路电源(VCCQ2)、多了一对 REF_CLK 差分时钟、UFS 侧从「上拉 + 并行等长」变成了「差分阻抗 + 链路训练」。这三处是 eMCP 工程师转做 uMCP 时最容易出错的地方。

适用范围

主控同时带 UFS Host 控制器(M-PHY + UniPro)LPDDR4/4X/5 内存控制器的 SoC / AP / 车规座舱与旗舰移动平台;器件侧为 JEDEC 标准 uMCP(UFS 2.1 / 2.2 / 3.0 / 3.1 + LPDDR4 / LPDDR4X / LPDDR5),封装 254-ball / 297-ball / 315-ball FBGA,UFS 容量 32 GB ~ 1 TB,DRAM 4 Gb ~ 64 Gb。

不适用的场景

若主控缺少 UFS 控制器或 LPDDR 控制器、PCB 预算低于 8 层、板厂不具备激光盲孔与 via-in-pad 能力、或对存储带宽需求低于 300 MB/s,请选择eMCP(eMMC + LPDDR)或分立式方案,见本系列同族文档。UFS 的带宽优势只有在配合 UFS 控制器与合理的文件系统时才体现得出来。

同系列文档

文档器件类型关注重点
uMCP 电路设计指南 本文UFS + LPDDR 合封M-PHY 差分、REF_CLK、VCCQ/VCCQ2、297-ball
eMCP 电路设计指南eMMC + LPDDR 合封双总线、五路电源、启动先后、0.5 mm HDI 扇出
NAND MCP 电路设计指南裸 NAND + DRAM 合封多 die 多 CE、主机侧 FTL、双电源轨
eMMC 电路设计指南eMMC 5.0/5.1HS200/HS400、1.8 V VCCQ、DS 选通与等长
SD NAND 电路设计指南贴片式 SD NANDSPI/SDIO 双模式、VCC 负载开关断电
SPI NOR 电路设计指南串行 NOR FlashQuad/QPI、XIP、DPD 低功耗
SPI NAND 电路设计指南串行 NAND Flash片内 ECC、坏块表、主机 FTL
PSRAM 电路设计指南伪静态 RAMOPI/HyperBus、刷新与延迟周期

阅读建议

  • 硬件工程师:重点看第 3 章(六路电源)、第 4 章(典型电路)、第 11 章(检查清单)。
  • Layout 工程师:重点看第 6 章(差分 100 Ω、REF_CLK、HDI 扇出、DRAM 等长)。
  • 软件工程师:重点看第 5 章(启动链路、UFS 初始化、链路训练、DRAM 训练)。
  • 从 eMCP 转过来的工程师:请先看第 2 章的「UFS 与 eMMC 的六处关键差异」,避免把 eMMC 的经验直接套用。

1 · uMCP 器件基础

uMCP 把 UFS 存储与 LPDDR 内存装进同一个封装,对外呈现两组电气上完全独立的接口。理解「哪些是共用的、哪些是分开的」,是画好原理图的前提。

uMCP 合封方案 vs 分立(UFS + LPDDR4X)方案050100150200250300占板面积(mm²,含周边禁布)190260需独立设计的电源轨数66高速差分对数量(对)44BGA 器件贴装次数12X-Ray / AOI 检测点位12链路训练复杂度(相对值)9090uMCP 合封分立两颗 BGA注:面积为量级示意(合封 11.5×13 mm 单封装 vs 分立 UFS BGA-153 + LPDDR4X BGA-200 加两者间距);合封在面积、贴装次数上优势明显,代价是替换困难、返修成本高,且一旦停产必须整体重新认证。
图 1 · uMCP 与分立方案对比
uMCP 内部结构:两颗 die 分装在同一基板上,对外是两组完全独立的总线uMCP 单封装(FBGA,0.4 / 0.5 mm pitch)UFS dieNAND 阵列 + UFS 控制器M-PHY / UniPro 物理层对外:TX / RX 差分对LPDDR4X die2 channel × 16 bit约 60 根单端 + 差分 DQS对外:DQ / DQS / CA / 控制两者在封装内部「无任何信号互连」封装基板(Substrate):布线 + 焊球阵列● 蓝:UFS 信号球(少量) ● 橙:DRAM 信号球(大量) ● 灰:电源 / 地 / NCUFS 侧:串行差分• 2 对差分(TX / RX)或 4 对(2 lane)• 加 1 对 REF_CLK 差分时钟• 信号数量极少,走线轻松• 但对阻抗、等长、抖动极敏感• 无需上拉电阻(与 eMMC 不同)• 需链路训练(Link Startup)LPDDR4X 侧:并行单端• 约 60 根单端 + 差分 DQS• 信号数量多,扇出压力大• 字节通道内严格等长• ZQ 校准 + ODT + Vref 训练• 对电源噪声极敏感• 决定 HDI 阶数与板层数为什么说 uMCP 的难点在 DRAM 侧UFS 只需 4 ~ 6 对差分,走线压力很小;而 LPDDR4X 的约 60 根单端要从 0.4 / 0.5 mm pitch 的球阵列扇出来,才是决定叠层、HDI 阶数与板成本的关键。
图 2 · uMCP 内部结构

1.1 什么是 uMCP

uMCP(UFS-based Multi-Chip Package)是把一颗 UFS 存储芯片(NAND 阵列 + UFS 控制器)与一颗或多颗低功耗 DRAM die(LPDDR4 / LPDDR4X / LPDDR5)封装在同一个 FBGA 基板内的多芯片封装器件。对外它是一颗 BGA,内部是两颗各自独立的芯片。

它解决的核心问题是在最小的占板面积内提供「存储 + 内存」的完整组合。相比分立式方案,uMCP 节省约 25 % ~ 35 % 的占板面积,减少一次 BGA 贴装与一次 X-Ray 检测,同时缩短 UFS 与主控之间的走线长度。

1.2 与 eMCP 的关系:换了存储接口,DRAM 侧几乎不变

对比项eMCPuMCP对电路设计的影响
存储接口eMMC:并行单端 11 根UFS:串行差分 2 ~ 3 对差异最大:阻抗、等长、上拉规则全部改变
存储侧电源VCC + VCCQ(2 路)VCC + VCCQ + VCCQ2(3 路)uMCP 多一路电源与相应的上电时序约束
参考时钟由主控提供 CLK(单端)REF_CLK 差分输入uMCP 需额外走一对差分时钟
上拉电阻CMD / DAT 必须上拉无需上拉UFS 侧省掉大量电阻
最高带宽HS400:400 MB/sHS-G4 2 lane:约 2 ~ 4 GB/suMCP 带宽高一个数量级
DRAM 侧LPDDR3 / 4 / 4XLPDDR4 / 4X / 5基本相同的规则,等长与阻抗略收紧
启动链路BootROM → eMMC → SPLBootROM → UFS → SPL流程相似,UFS 侧多了链路训练
封装球数221 / 254 / 297254 / 297 / 315uMCP 球更多,扇出难度略高
一句话区分

eMCP 与 uMCP 的区别只在存储那一半:eMMC 是并行单端,UFS 是串行差分。DRAM 那一半(LPDDR)的设计规则基本一致。所以如果你做过 eMCP,转到 uMCP 要重学的是 UFS 侧,DRAM 侧的经验可以平移。

1.3 封装与球位

封装类型球数Pitch典型尺寸典型配置工艺难度
FBGA254 ball0.5 mm约 11.5 × 13 mmUFS 2.1 + LPDDR4XHDI,需 via-in-pad
FBGA297 ball0.4 / 0.5 mm约 12 × 12 mmUFS 3.1 + LPDDR4XHDI 1~2 阶,主流配置
FBGA315 ball0.4 mm约 12.5 × 13 mmUFS 3.1 + LPDDR5 大容量HDI 2 阶,难度高

uMCP 的球位大致可以分成四个区域,理解分区对扇出规划很有帮助:

  • UFS 信号区:TX / RX 差分对 + REF_CLK,通常集中在封装的某一个角落,球数很少(6 ~ 10 个球)。
  • DRAM 信号区:DQ / DQS / DM / CA / 控制信号,球数最多(约 60 ~ 70 个球),通常占据封装的一侧或两排外圈。
  • 电源区:VCC / VCCQ / VCCQ2 / VDD1 / VDD2 / VDDQ,通常集中在封装中部或某一区域,便于去耦电容就近放置。
  • 地与 NC:地球数量很多(散热与回流),NC 球按手册处理(悬空或接地)。
球位定义没有「通用表」

不同厂商、不同料号的 uMCP,球位定义完全不同。同一个 297-ball 封装,A 厂的 VCCQ2 在 M12,B 厂可能在 T8。原理图符号与封装的球位映射必须逐球对照数据手册核对,并安排第二人交叉复核。这是 uMCP 项目里最高风险的单一环节——映射错了,板子回来就是砖。

1.4 选型要点

  • UFS 版本与主控匹配。主控的 UFS Host 支持的 Gear(HS-G1/2/3/4)与 lane 数,决定了能跑多快。UFS 3.1 器件接在只支持 UFS 2.1 的主控上,只能降速工作。
  • DRAM 类型与主控匹配。主控内存控制器支持 LPDDR4 还是 LPDDR4X / LPDDR5,决定了器件选型。LPDDR4 与 LPDDR4X 的 VDDQ 不同(1.1 V vs 0.6 V),选错会直接烧器件。
  • 容量组合的供货周期。uMCP 是高度定制化的组合,某个「8 GB + 256 GB」的组合可能只有一家供应商有,且生命周期与主控平台绑定。选型时要确认至少两家的可替代料号
  • 温度等级。消费级(0 ~ 70 ℃)、工业级(-40 ~ 85 ℃)、车规(-40 ~ 105 ℃)的价格与供货差异很大,按产品定位选。
  • 封装与板厂能力对齐。0.4 mm pitch 需要 HDI 2 阶 + via-in-pad + 树脂塞孔电镀填平,投板前必须书面确认板厂能做。
UFS 与 eMMC 接口形态对比:为什么 uMCP 的 UFS 侧反而是「简单」的那一半eMMC:并行单端,11 根信号CLKCMDDAT0DAT1DAT2DAT3DAT4DAT5DAT6DAT7DS单端 50 Ω,组内等长,需上拉电阻,需 DS 选通(HS400)速率上限:HS400 = 400 MB/s(200 MHz DDR × 8 bit)信号多、速率低、对阻抗相对宽容UFS:串行差分,2 ~ 3 对TX0DP / DNRX0DP / DNREF_CLK差分时钟差分 100 Ω,对内等长,无需上拉,需链路训练后才能切到 HS速率:HS-G4 = 11.6 Gbps/lane,2 lane 全双工,聚合 23.3 GbpsUFS 用「更少的线、更高的速率」换来了带宽:信号数量从 11 根降到 2 ~ 3 对,但对阻抗连续性、等长、抖动的容差收得极紧。
图 3 · UFS 与 eMMC 接口形态对比

2 · 接口与工作模式

uMCP 的 UFS 侧与 DRAM 侧在协议层毫无关系,但在物理层共用一块基板、共用一组地、共用同一个散热路径。这一章先讲 UFS 那套从 eMMC 完全不同的接口逻辑,再讲 DRAM 侧相对 eMCP 基本不变的部分。

UFS 协议栈:四层结构,硬件工程师只需关心最底两层应用层UFS Command SetSCSI 精简指令集:读 / 写 / 查询描述符 / 标志位软件栈,与硬件无关传输层UTP(UFS Transport Protocol)把 SCSI 命令打包成 UPIU,管理任务队列与 LU软件栈,与硬件无关链路层UniPro(Unified Protocol)数据链路、流控、错误恢复、电源模式管理(Hibern8)影响低功耗行为与唤醒时序物理层M-PHY(MIPI)差分串行收发、速率档位协商、链路训练(Link Startup)硬件直接相关:阻抗、等长、抖动、REF_CLK硬件设计只需要管好 M-PHY 这一层:把差分走线做对、把 REF_CLK 供对、把电源供干净,上面三层的协议由主控与器件自动完成。
图 4 · UFS 协议栈分层

2.1 UFS 协议栈:硬件只需关心 M-PHY

UFS 的协议栈分四层,硬件工程师只需要把最底层的 M-PHY 物理层做对,上面三层由主控与器件自动完成。这个分工很重要——遇到存储问题时,先判断是硬件层(M-PHY)还是协议层,避免用软件的思路去查硬件问题。

  • 物理层 M-PHY:差分串行收发、速率档位协商、链路训练。硬件直接相关——阻抗、等长、抖动、REF_CLK 都在这里。
  • 链路层 UniPro:数据链路、流控、错误恢复、电源模式管理(Hibern8 低功耗态)。影响休眠唤醒时序。
  • 传输层 UTP:把 SCSI 命令打包成 UPIU,管理任务队列与逻辑单元(LU)。
  • 应用层 UFS Command Set:精简的 SCSI 指令集,读 / 写 / 查询描述符 / 标志位。

2.2 M-PHY 速率档位

M-PHY 有两套模式:PWM(Pulse Width Modulation)用于上电初始化与省电,HS(High Speed)用于正常工作。速率是协商出来的,不是固定的——上电后先跑最低速的 PWM-G1,再由双方按能力协商切到最高可用档。

M-PHY 速率档位:PWM 用于初始化与省电,HS 用于正常工作024681012Gbps/lanePWM-G10.2HS-G11.5HS-G22.9HS-G35.8HS-G411.6速率是「协商」出来的,不是固定的上电后先跑 PWM-G1,再由双方按能力协商切到最高可用档。跑不到最高档,几乎都是硬件问题协商结果低于预期时,先查差分阻抗、REF_CLK 与电源噪声。
图 5 · M-PHY 速率档位
档位速率(Gbps/lane)编码有效带宽(MB/s/lane)说明
PWM-G10.2 ~ 0.4初始化模式,也用于极低功耗
HS-G11.25 ~ 1.468b10b约 145UFS 2.0 最低档,兼容性兜底
HS-G22.50 ~ 2.928b10b约 290UFS 2.0 / 2.1 常用档
HS-G35.00 ~ 5.838b10b约 580UFS 2.1 最高档
HS-G410.0 ~ 11.678b10b约 1160UFS 3.0 / 3.1 档位,需 SI 达标
关于带宽的几个常见误解
  • 「UFS 3.1 = 23.3 Gbps」这个数字是 2 lane 的聚合值,不是单 lane。单 lane 是 11.67 Gbps,2 lane 聚合 23.3 Gbps。
  • 8b10b 编码有 20 % 开销,11.67 Gbps 的有效数据率约为 9.33 Gbps ≈ 1160 MB/s per lane。
  • 顺序读写的实测值远低于理论值:UFS 3.1 的 2 lane 理论约 2330 MB/s,旗舰手机实测约 1800 ~ 2100 MB/s,这是正常的。
  • 速率是协商结果,不是器件保证值。如果硬件没做好(阻抗差、REF_CLK 抖动大),器件会自动降到低速档,表现为「UFS 3.1 跑出了 UFS 2.0 的速度」。

2.3 差分对与 lane 配置

信号方向数量说明
TX_DP / TX_DN主控 → 器件1 ~ 2 对下行发送差分对,lane 数由版本决定
RX_DP / RX_DN器件 → 主控1 ~ 2 对上行接收差分对,与 TX 独立,构成全双工
REF_CLK(可选差分)主控 → 器件1 对或单端参考时钟,频率固定(19.2 / 26 / 38.4 MHz)
RST_n主控 → 器件1 根低有效硬件复位
全双工带来的布线优势

UFS 的 TX 与 RX 是两组独立的差分对,收发可以同时进行,互不干扰。这意味着:

  • TX 与 RX 之间不需要严格等长(它们是不同方向的独立链路),只需要各自对内等长。
  • 这与 eMMC 的半双工完全不同——eMMC 的 CLK/CMD/DAT 是共享总线,必须组内等长。
  • 但 TX 与 RX 的长度差也不宜过大,建议控制在数英寸以内,避免时序偏差累积。

2.4 REF_CLK 参考时钟

这是 eMCP 工程师最容易踩的坑:eMMC 的 CLK 是「传输时钟」,主控可以随时降频、暂停甚至关掉;而 UFS 的 REF_CLK 是「参考时钟」,频率固定、必须持续供给,器件用它来锁相生成内部的高速时钟。

项目要求说明
频率19.2 MHz(最常见)、26 MHz、38.4 MHz由器件型号决定,务必查手册,不可想当然
供给方式主控输出,或独立的时钟发生器需确认主控是否能在休眠状态下保持输出
是否可门控不可(链路活动期间)关掉 REF_CLK 会导致链路中断,需要重新训练
信号形态差分或单端,按手册差分抗干扰更好,优先选差分
幅度按主控 / 器件手册通常为几百 mV 到 1.8 V 量级
抖动要求按手册,通常要求较低抖动超标会直接导致 HS 模式训练失败
走线按差分处理,全程有完整参考地远离开关电源、射频与高速数据线
REF_CLK 的三个致命错误
  1. 频率选错。19.2 MHz 与 26 MHz 的器件不能互换,接错了链路根本建不起来。
  2. 当成可以门控的时钟。为了省电把 REF_CLK 关掉,唤醒后链路需要重新训练,表现为「休眠唤醒后存储卡死」。
  3. 走线不当。把 REF_CLK 当成普通低速信号随便走,紧挨开关电源或射频线,抖动超标后只能降到低速档运行。

2.5 Link Startup:链路训练流程

UFS 上电后必须先完成链路训练,在此之前存储完全不可访问。这一点与 eMMC 完全不同——eMMC 上电后主控直接给时钟、发命令就能通信。

M-PHY Link Startup:UFS 上电后必经的握手流程① 电源与复位VCC/VCCQ/VCCQ2 就绪释放 RST_n步骤 1② REF_CLK 稳定19.2 / 26 / 38.4 MHz必须持续供给步骤 2③ PWM 模式建立DME_RESET 后进入PWM-G1 最低速步骤 3④ 属性协商读 Device 描述符确认 Gear / lane 能力步骤 4⑤ 切到 HS 模式速率跃迁到HS-G3 / HS-G4步骤 5⑥ 链路可用UTP 层开始收发 UPIU步骤 6Link Startup 失败的典型表现• 停在 PWM 模式不切 HS → 速率只有几十 MB/s• 反复 DME_RESET → REF_CLK 不稳或电源噪声• 完全无响应 → RST_n 未释放或电源缺失• 协商档位低于预期 → 差分阻抗 / 等长不达标REF_CLK 是这一流程的前提• 频率由硬件决定,必须按器件手册选取• 必须持续供给,不能像 eMMC 的 CLK 那样门控• 幅度与抖动超标会直接导致训练失败• 走线按差分处理,远离干扰源与 eMMC 的差别:eMMC 上电后由主控直接给时钟、发命令即可;UFS 必须先完成这套链路训练,在此之前存储完全不可访问。
图 6 · Link Startup 链路训练流程
Link Startup 失败时的排查方向

链路训练失败的表现是「存储完全不存在」,而不是「速率慢」。遇到这种情况按以下顺序查:

  1. 六路电源是否全部到位、顺序是否正确(用示波器多通道抓)。
  2. REF_CLK 是否有输出、频率是否正确、是否持续供给。
  3. RST_n 是否正确释放(低有效,未释放时器件一直处于复位)。
  4. 差分走线的阻抗与对内等长是否达标。

前三项占了实际故障的绝大多数,第 4 项只在设计本身有缺陷时才是主因。

2.6 低功耗模式

UFS 相比 eMMC 有更丰富的电源状态管理,主要通过 Hibern8(深度休眠)实现。硬件设计上需要关注:

  • Hibern8 进入 / 退出由链路层协议控制,硬件无需干预,但要保证退出时电源已恢复稳定
  • 休眠期间 VCCQ / VCCQ2 可以掉电(部分器件支持),但掉电后唤醒需要重新做链路训练,唤醒时间会变长。
  • REF_CLK 在 Hibern8 期间的处理按器件手册,有些器件允许关闭,有些要求保持——这直接决定休眠功耗。
  • DRAM 侧的自刷新与 UFS 侧的低功耗态是两套独立机制,休眠流程要分别处理。

2.7 UFS 与 eMMC 的六处关键差异

如果你做过 eMCP,转到 uMCP 时请把下面这张图记牢。这六处差异是eMMC 经验不能直接套用的地方。

从 eMCP 转到 uMCP 必须重学的六处差异差异 1 · 信号形态eMMC:11 根并行单端UFS:2 ~ 3 对串行差分阻抗从单端 50 Ω 变成差分 100 Ω;等长从「组内等长」变成「对内等长」差异 2 · 上拉电阻eMMC:CMD / DAT 必须上拉UFS:完全不需要上拉UFS 侧省掉 8 ~ 9 颗电阻,但也意味着不能再靠上拉救信号差异 3 · 时钟eMMC:主控给 CLK,可随时降频UFS:REF_CLK 固定频率,必须常供REF_CLK 是参考时钟不是传输时钟;关掉它链路就断差异 4 · 电源路数eMMC:VCC + VCCQ 两路UFS:VCC + VCCQ + VCCQ2 三路多出的 VCCQ2 通常由内部 LDO 从 VCCQ 产生,外部接旁路电容差异 5 · 握手流程eMMC:发命令即可通信UFS:必须先做 Link Startup链路训练失败时,表现是「存储完全不存在」,而不是「速率慢」差异 6 · 双工方式eMMC:半双工,读写不能同时UFS:全双工,读写可并行这是 UFS 带宽优势的核心来源,也是功耗估算要考虑的点注:以上为 UFS 与 eMMC 在硬件设计层面的主要差异;协议与命令集的差异由软件栈处理,不影响原理图与 Layout。
图 7 · UFS 与 eMMC 的六处关键差异

3 · 电源系统设计

uMCP 需要 六路独立电源:三路给 UFS(VCC / VCCQ / VCCQ2),三路给 LPDDR(VDD1 / VDD2 / VDDQ)。这是它比 eMCP 复杂的地方——多一路电源,就多一份上电时序约束、多一组去耦电容、多一处出错的可能。

uMCP 六路电源域:三路给 UFS,三路给 DRAM,「互不合并」PMIC六路输出 + 时序控制VCCVCCQVCCQ2VDD1VDD2VDDQuMCP 器件UFS 侧(3 路)VCC · VCCQ · VCCQ2差分对 + REF_CLK信号少,但速率高LPDDR4X 侧(3 路)VDD1 · VDD2 · VDDQ约 60 根单端 + DQS信号多,电流大绝对不能做的事• 把 VCCQ 与 VDDQ 并为一路• 把 VCCQ2 与外部 1.8 V 直连(若内部 LDO)• 忽略 VCCQ2 的上电顺序要求• 用 5 % 精度的电阻做 ZQ 校准去耦电容布置原则• 每个电源球一组,优先放器件背面• VDDQ(0.6 V)裕量最小,优先级最高• VCCQ2 旁路电容容值严格按手册• 每颗电容至少一个独立地过孔• 大容值储能电容每路 1 ~ 2 颗六路电源看似复杂,但有个记忆方法:三路管存储(VCC/VCCQ/VCCQ2)、三路管内存(VDD1/VDD2/VDDQ),各自独立,各自的去耦与时序都要单独设计。
图 8 · uMCP 六路电源域架构

3.1 六路电源域详解

电源轨归属典型电压容差作用设计要点
VCCUFS2.4 ~ 3.6 V(2.5 / 3.3 V)±10 %UFS NAND 核心与内部电路电流相对小,注意上电顺序
VCCQUFS1.14 ~ 1.26 V 或 1.7 ~ 1.95 V±5 %UFS 控制器 / IO 电平UFS 3.x 多为 1.2 V
VCCQ2UFS1.7 ~ 1.95 V(1.8 V)±5 %M-PHY 模拟部分uMCP 独有;常由内部 LDO 从 VCCQ 产生
VDD1LPDDR1.70 ~ 1.95 V(1.8 V)±5 %DRAM 核心 / 阵列大电流,注意路径压降
VDD2LPDDR1.06 ~ 1.17 V(1.1 V)±3 % 级DRAM 核心 / 外围大电流,突发特性明显
VDDQLPDDRLPDDR4: 1.1 V / 4X: 0.6 V±3 % 级DRAM IO 电平裕量最小,去耦要求最严
VCCQ2 是 uMCP 相对 eMCP 最容易漏掉的一路

很多从 eMCP 转过来的工程师会下意识地按「两路存储电源」设计,结果漏掉 VCCQ2。这一路给 M-PHY 的模拟部分供电,漏了它 UFS 侧直接不工作。

关键问题在于:VCCQ2 经常是由器件内部的 LDO 从 VCCQ 升压产生的。这种情况下:

  • 外部不需要提供 1.8 V 给 VCCQ2 引脚;
  • 但器件会引出一个 VDDiQ2(或类似命名)的引脚,要求外部接一颗旁路电容(典型 1 µF,容值严格按手册);
  • 如果误把这个引脚接到外部 1.8 V,会与内部 LDO 冲突,可能损坏器件。

做法:逐球核对数据手册,确认该料号的 VCCQ2 是「外部供电」还是「内部 LDO + 外部旁路电容」。

3.2 上电时序

uMCP 的上电时序可以概括为三段式:电源按顺序斜升 → REF_CLK 建立并稳定 → 释放 RST_n。每一段都有明确的前置条件。

uMCP 上电时序:三段式——电源斜升 → REF_CLK 稳定 → 释放复位VCCVCCQVCCQ2VDD1VDD2VDDQREF_CLK持续供给RST_n释放说明① 六路电源按 VCC → VCCQ → VCCQ2 → VDD1 / VDD2 / VDDQ 的顺序依次斜升,每路都应单调上升。② REF_CLK 必须在复位释放前就稳定输出,并且之后持续供给,不能门控。③ RST_n 在所有电源稳定之后再释放,释放后器件才开始 Link Startup。
图 9 · uMCP 上电时序
阶段动作关键约束违反后果
① 电源斜升六路电源按 VCC → VCCQ → VCCQ2 → VDD1/VDD2/VDDQ 依次上升每路单调上升,斜升时间在手册范围内内部复位电路误动作,器件状态不确定
② 时钟建立REF_CLK 起振并稳定必须在 RST_n 释放前稳定链路训练失败或只能跑低速档
③ 释放复位RST_n 由低变高所有电源稳定后再释放,留足余量初始化失败,存储完全不可见
④ 链路训练器件自动完成 Link Startup硬件无需干预,但需电源与时钟达标协商降档或链路建立失败
⑤ DRAM 训练由 SPL 软件完成UFS 必须先可用(SPL 存在 UFS 里)系统卡在 SPL 阶段
下电时序同样重要

下电顺序通常与下电相反,且要避免反向电流:当某一路电源已经掉电而另一路仍然带电时,电流可能通过器件内部的 ESD 保护二极管倒灌,造成闩锁(Latch-up)甚至永久损坏。

设计时要确认 PMIC 是否支持受控的下电顺序;若不关闭某路电源(比如常开的 1.8 V),要核算倒灌电流是否在器件允许范围内。

3.3 去耦设计

电源轨高频去耦储能电容数量布局要求
VCC100 nF(0402 / 0201)4.7 ~ 10 µF2 ~ 4 + 1紧靠 VCC 球,背面优先
VCCQ100 nF1 ~ 4.7 µF2 ~ 4 + 1紧靠 VCCQ 球
VCCQ2 / VDDiQ2按手册(常为 100 nF)按手册(常为 1 µF)按手册容值不可随意更改,紧靠引脚
VDD1100 nF4.7 ~ 10 µF4 ~ 6 + 1~2紧靠 VDD1 球
VDD2100 nF4.7 ~ 10 µF4 ~ 6 + 1~2紧靠 VDD2 球
VDDQ100 nF1 ~ 4.7 µF4 ~ 8 + 1~2优先级最高,0.6 V 裕量最小
去耦设计的三个要点
  • 安装电感比容值更重要。0201 / 0402 小封装 + 紧靠球 + 独立地过孔,比用大容值但远离器件有效得多。
  • 注意直流偏压衰减。X5R 介质在额定工作电压下实际容值会大幅下降,选型时按工作电压下的有效容值核算,留 2 倍余量。
  • 优先放背面。0.4 / 0.5 mm pitch 的 BGA 正面扇出空间极紧,去耦电容放器件正下方背面,回路最短。

3.4 功耗估算

uMCP 的功耗由四部分组成,做电源选型与热设计时需要分别估算:

功耗来源典型量级特性对设计的影响
UFS NAND 读写数百 mW(瞬态)突发性,读写时集中影响 VCC 的瞬态响应要求
UFS M-PHY 链路数十 ~ 上百 mW与速率档位强相关高速档位下功耗明显上升
DRAM 读写数百 mW ~ 1 W 级突发性,与带宽相关决定 VDD1 / VDD2 的电流能力
DRAM 自刷新数 mW ~ 数十 mW持续,休眠时的主要功耗决定待机功耗
功耗估算的实用建议

不要试图从数据手册的「典型值」推算整机功耗——UFS 与 DRAM 的功耗都是强负载相关的。正确做法是:

  1. 先按数据手册的最大值做电源选型与热设计,保证最坏情况不超标;
  2. 样机出来后用实际业务场景(连续读写、视频录制、游戏加载)测整机功耗,反推各部分占比;
  3. 把实测数据作为下一版设计的依据,形成自己项目的功耗基线表。

4 · 典型应用电路

uMCP 的原理图本身并不复杂——总共就是「2 ~ 3 对差分 + 1 对 REF_CLK + 约 60 根 DRAM 信号 + 六路电源」。难点在于每个细节都不能想当然:UFS 侧不用上拉,DRAM 侧 ZQ 必须 1 %,VCCQ2 的处理要逐球核对。

4.1 UFS 侧电路

UFS 侧参考电路:差分对、REF_CLK、RST_n、VCCQ2 旁路SoC / APUFS Host + LPDDR 控制器uMCP · UFS 侧M-PHY + UFS 控制器100 Ω 差分TX0_DP / DN主控发送,器件接收100 Ω 差分RX0_DP / DN器件发送,主控接收REF_CLK参考时钟,持续供给RST_n低有效复位VCCQ2 处理(关键)若器件内部集成 LDO:外部不供 1.8 V,只在 VDDiQ2 引脚接 1 µF 旁路电容(容值按手册)。误接外部电源会与内部 LDO 冲突。注:UFS 侧无需任何上拉电阻;是否需要外部 AC 耦合电容取决于器件与主控,M-PHY HS 模式通常已集成在片内。
图 10 · UFS 侧参考电路
信号 / 网络处理方式常见错误
TX_DP / TX_DN差分对直连,100 Ω 差分阻抗,对内等长 ≤ 5 mil按单端走线;对内不等长
RX_DP / RX_DN同上,与 TX 独立,不需要与 TX 等长把 TX 与 RX 做等长(没必要)
REF_CLK按手册频率(19.2 / 26 / 38.4 MHz),持续供给,按差分处理频率选错;当成可门控时钟关掉
RST_n低有效,由 GPIO 或 PMIC 控制,按手册加上拉或下拉悬空;极性搞反
VCC按手册电压(2.5 / 3.3 V),加去耦电压档位选错
VCCQ按手册电压(1.2 / 1.8 V),加去耦与 VDDQ 共用一路电源
VCCQ2 / VDDiQ2逐球核对手册:内部 LDO 型只接旁路电容,外部供电型才接 1.8 V误接外部电源到内部 LDO 引脚
上拉电阻不需要沿用 eMMC 习惯加上拉
UFS 侧最致命的两个错误
  1. 给 VDDiQ2 接了外部 1.8 V。当器件内部集成了 VCCQ2 的 LDO 时,VDDiQ2 只是 LDO 的输出引脚,外部只需要接旁路电容。如果误接到外部 1.8 V 电源,会与内部 LDO 打架,轻则工作异常,重则损坏器件。
  2. 沿用 eMMC 习惯加了上拉电阻。UFS 的差分信号完全不需要上拉。加上拉不仅没用,还会破坏差分阻抗,导致信号质量下降。这个错误在从 eMCP 转过来的项目里非常常见。

4.2 LPDDR4X 侧电路

LPDDR4X 侧的规则与 eMCP 中的 DRAM 侧基本一致,这里只强调几处容易出错的地方。

LPDDR4X 侧参考电路:ZQ 校准、控制信号默认电平、去耦ZQ 校准电阻ZQ ── 240 Ω ±1 % ──→ VDDQ精度必须 1 %,不可用 5 % 替代紧靠器件放置,走线尽可能短它是驱动强度与 ODT 的校准基准控制信号默认电平• RESET_n:外部下拉,确保上电期间为低• CKE:外部下拉,上电期间保持低• ODT_CA:固定接 VDD2 或 VSS,不悬空• CS / CLK:按主控要求处理三路 DRAM 电源去耦• VDDQ(0.6 V):优先级最高,4 ~ 8 颗• VDD2(1.1 V):4 ~ 6 颗 + 储能• VDD1(1.8 V):4 ~ 6 颗 + 储能• 全部放背面,每颗独立地过孔信号分组与等长单位DQ / DM / DQS每字节通道内等长≤ 20 ~ 25 milCA(命令地址)与 CLK 等长按主控手册CLK 差分对对内等长≤ 5 mil字节通道之间相对宽松≤ 100 ~ 200 milLPDDR4 与 LPDDR4X 不能混用两者 VDDQ 不同(1.1 V vs 0.6 V),按 LPDDR4 设计去供 LPDDR4X 的料,会直接过压损坏。选型、原理图标注、BOM、贴片生产四处都要核对。LPDDR5 的额外注意点LPDDR5 引入 WCK 差分时钟、DVFS 电源管理及更严格的 Vref 训练要求,电源与 Layout 规则都需重新核对。若项目用 LPDDR5,本图仅作为概念参考。
图 11 · LPDDR4X 侧参考电路
项目要求说明
ZQ 电阻240 Ω ±1 %,紧靠器件驱动强度与 ODT 的校准基准,精度不足会表现为「训练勉强通过但读写不稳定」
ODT_CA固定接 VDD2 或 VSS,不可悬空LPDDR4X 中该引脚被忽略,但必须固定电平
RESET_n外部下拉,确保上电期间为低避免上电期间 DRAM 进入不确定状态
CKE外部下拉,上电期间保持低同上
VDDQ 电压LPDDR4:1.1 V / LPDDR4X:0.6 V选错会直接烧器件
去耦每路电源球一组,VDDQ 优先级最高0.6 V 的噪声裕量极小

4.3 完整系统连接

uMCP 完整系统连接图:两条总线 + 六路电源 + 一路参考时钟PMIC(六路 + 时序)VCC VCCQ VCCQ2 VDD1 VDD2 VDDQ六路电源SoC / AP• UFS Host(M-PHY + UniPro)• LPDDR4X 控制器• REF_CLK 输出• GPIO(RST_n 等)内部 SRAMBootROM 在此执行装不下完整 DRAM初始化代码uMCPUFS(存储)TX / RX 差分 · REF_CLKVCC · VCCQ · VCCQ2需 Link StartupLPDDR4X(内存)约 60 根单端 + DQSVDD1 · VDD2 · VDDQ需 PHY 训练 + ZQ 校准UFS:2 ~ 3 对差分100 Ω · 无需上拉LPDDR4X:约 60 根单端40 Ω · 字节通道等长REF_CLK(19.2 / 26 / 38.4 MHz)必须持续供给这张图的三个要点1. 两条总线「完全独立」 地址、数据、控制、 电源都不共享, 只有 VSS 是共用的2. UFS 侧信号少, DRAM 侧信号多, 扇出压力在后者3. 先让 UFS 可用, 才能加载 SPL, 才有 DRAM 训练六路电源 + 2 ~ 3 对差分 + 1 对 REF_CLK + 约 60 æ ¹ DRAM 信号 —— 这就是 uMCP 原理图的全部。
图 12 · uMCP 完整系统连接

4.4 原理图自检要点

  • 六路电源全部有来源,无遗漏、无错接
  • VCCQ2 的处理方式已按数据手册逐球确认(内部 LDO 还是外部供电)
  • REF_CLK 的频率、来源、是否可门控已确认
  • RST_n 的极性与上下拉已确认
  • UFS 侧没有加上拉电阻
  • ZQ 电阻是 240 Ω ±1 %
  • LPDDR4X 的 VDDQ 按 0.6 V 设计(不是 1.1 V)
  • 每条电源轨都预留了可测量的测试点
  • 去耦电容按「每个电源球一组」放足
  • 封装球位与原理图符号的映射已由第二人交叉核对
📥 芯参谋客户端下载