HBF 高带宽闪存市场调研报告
2026 年版 · 数据窗口 2025 全年—2026 H1 · 以 HBF 为驱动变量的 AI 推理服务器板上存储机会分析(含三档时间表敏感性) | 编制日期 2026-09-21 | 版本号 Rev 1.0
先说清楚分母和时点,否则后面所有数字都会被误读。
分母不是 HBF 的颗数或位元数,而是HBF 折算的 AI 推理服务器当量(2030E 中性档约 84 万台测算)。原因与 HBM 报告同源:HBF 以裸堆栈形式与 xPU 一同封装在中介层或 RDL 上,通过 UCIe 内存总线直连加速器,它不是 PCIe 设备,不挂 Option ROM,也不外挂固件存储。用 HBF 颗数当分母,板上存储 TAM 会算出零。
时点必须写明:HBF 在 2026 年一颗都没有出货。首个标准规范(v0.7)2026-08-04 才通过 OCP 发布,工程样品要到 2026 年下半年,首批搭载 HBF 的推理设备样品在 2027 年初,全面量产时点在厂商路线图上仍标注为 TBD。因此本报告不做「过去三年市场规模」,而是给乐观/中性/悲观三档出货时间的敏感性分析,并把中性档作为工作值。
与 HBM 报告的边界:两者分母不可相加。HBM 报告的 380 万台是 2026E 的分母,本报告的 84 万台是 2030E 的分母,时点相差四年,且 HBF 服务器在架构上是 HBM 服务器的子集或延伸——同一台机器会同时挂 HBM 与 HBF。两份报告测的是同一块板上非易失存储在不同时点的形态,不是两块可以相加的市场。
容量单位一律用 bit(Mb / Gb),只有 eMMC 按 byte(GB)标注。
① HBF 是一堵更高的墙,不是一个更近的机会。HBF 需要 3D NAND 晶圆 + CBA 铜铜混合键合 + TSV 超低翘曲堆叠 + UCIe 芯粒互连 + 先进封装产能,XTX 一条都不具备——连 NAND 晶圆这一层都没有,这不是投入能解决的问题,比 HBM 的距离更远。② HBF 不新增 NOR 槽位,它只推高容量档位。HBM 报告里「谁有固件谁就要有 Flash」的逻辑,在 HBF 这里不成立:HBF 挂在 UCIe 内存总线上,主机侧不把它当作可独立升级固件的 PCIe 设备,因此不会新增一颗 Option ROM NOR。HBF 对 XTX 的传导路径只有一条——把时间推到 2028—2030,届时板上 NOR 的容量档位从 256 Mb 上移到 512 Mb / 1 Gb / 2 Gb。③ 它甚至可能是负面的。OXMIQ 在 Hot Chips 2026 的建模显示,HBF 让单颗 GPU 就能装下原本要 8 颗 GPU 才装得下的万亿参数模型,即同样的推理任务需要的服务器数量下降。北大与复旦团队的《HBF Sucks?》论文更指出,若直接把 HBF 当作 SSD 的替代品去做 KV 卸载,平均端到端时延会上升 2—5.5 倍。这两条都必须写进风险,不能只讲利好。
0 · 什么是 高带宽闪存 HBF
HBF 是把 3D NAND 用硅通孔堆成类 HBM 形态、经 UCIe 内存总线直连加速器的近端大容量层,用 HBM 级别的封装换 SSD 级别的容量。它的定义特征是堆叠 NAND + 内存总线接口 + 只读为主。本节还要先说清一件事:HBF 在 2026 年一颗都没有出货,所以本报告的分母是 2030 年的推理服务器当量,而不是今天的 HBF 出货量。
0.1 一句话定义
HBF = TSV 堆叠 3D NAND + CBA 铜铜混合键合 + UCIe 芯粒互连直连 xPU,是 OCP 在 2026 年 8 月刚发布的新规范(v0.7,开放免授权费)。它的内核是用封装换容量:把成百上千个 3D NAND 子阵列当作独立通道并发调度,即使单次读取延迟为几十微秒,聚合带宽仍能达到 TB/s 级——带宽只到 HBM3E 水平,容量却是 HBM 的十几倍。技术
规范把 HBF 分成三个带宽等级,这也是第 3 章分档的依据:① Grade 1——8-Hi / 256 GB、UCIe 8 GT/s、约 0.4 TB/s,面向轻量化推理与边缘 AI;② Grade 2——16-Hi / 512 GB、UCIe 16 GT/s、约 1.6 TB/s,是闪迪第一代的目标档,也是主流 AI 推理的主力;③ Grade 3——16-Hi / 512 GB、UCIe 32 GT/s(UCIe 2.0)、约 3.0 TB/s,接近 HBM3E 水平,面向大规模算力集群。单堆栈容量上限 512 GB,为 HBM4 的 8—16 倍。
① HBM:同为 TSV 堆叠与中介层共封装,但介质是 DRAM、面向读写混合的工作集,本报告单列一份;HBF 与 HBM 会挂在同一个加速器上,两份报告的分母时点不同、互相重叠,不可相加;② NVMe eSSD:以 PCIe / NVMe 协议挂载的上一代容量层,本报告作为「上一代」对照项——HBF 替代它的前提是读密集且可预取,直接拿来做 KV 卸载反而会变慢;③ 三星 zHBM / zNAND-O:未加入 OCP 联盟的自有路线,zNAND-O 面向边缘 AI,本报告按并行路线并列呈现,不并入 OCP HBF 口径。
0.2 与「上一代 NVMe eSSD」的三点不同
| 对比维度 | 上一代 NVMe eSSD | 高带宽闪存 HBF |
|---|---|---|
| 互联方式 | PCIe / NVMe 协议,作为标准 PCIe 设备挂载 | UCIe 内存总线直连 xPU,不是 PCIe / NVMe 设备 |
| 读取带宽 | 受 PCIe 通道数与协议栈开销限制 | Grade 1 约 0.4 TB/s、Grade 2 约 1.6 TB/s、Grade 3 约 3.0 TB/s |
| 容量层级 | 单盘 TB 级,靠多盘组池扩容量 | 单堆栈最高 512 GB,8 堆栈 4 TB,为 HBM4 的 8—16 倍 |
| 读写粒度与适用负载 | 块设备语义,随机读写与写入密集都能扛 | 读块 64 B—4 KB、4 KB 页写;适合规则可预测的顺序读(模型权重加载),不适合随机小写 |
| 访问延迟 | 协议栈与驱动带来较高访问开销 | 单次读取延迟仍为几十微秒,靠上千个子阵列并发换取聚合带宽 |
| 固件与固件存储 | 每块盘是独立可维护单元,自带固件 Flash 并占用一个 Option ROM 槽位 | 挂在内存总线上,主机不为其分配 Option ROM,不新增一颗 NOR |
| 用户结果 | 模型权重要从 SSD 池跨过 PCIe 加载进显存 | 权重常驻加速器近端,单颗 GPU 能装下更大的模型 |
这张表里决定 XTX 命运的是固件与固件存储这一行。HBM 报告里「谁有固件谁就要有 Flash」的逻辑,在 HBF 这里不成立:HBF 挂在 UCIe 内存总线上,主机不把它当作可独立升级固件的 PCIe 设备,不产生 NOR 槽位,XTX 从这一层拿到的是 0 元。HBF 对 XTX 的全部传导只有一条——把时间轴推到 2028—2030,届时板上 NOR 的主力容量档从 256 Mb 上移到 512 Mb / 1 Gb,天花板档到 2 Gb。结论因此带着两面性:可覆盖比例从 HBM 报告的 82% 降到 74.5%,不是市场变小了,而是需求跑到了供给前面(1 Gb 仅 2 款 MP、2 Gb 的 MP 量产为 0);同时 HBF 还可能做减法,它让单颗 GPU 就能装下原本要 8 颗才装得下的模型,同样的推理任务需要的服务器数量会下降。事实
0.3 典型形态与代表产品
| 档位/形态 | 代表方案或产品 | 关键事实或数据 |
|---|---|---|
| OCP HBF(开放规范) | SK 海力士 + 闪迪主导,联盟成员含 Google、Tenstorrent | v0.7 于 2026-08-04 发布、免授权费;样品 2026 H2、设备样品 2027 初、Cube 可用 2028 Q1、量产时点仍标 TBD |
| 三星 zHBM / zNAND-O | 三星(未加入联盟) | zHBM 把 HBM 垂直堆叠在加速器正上方,量产目标 2028—2029;zNAND-O 面向边缘 AI,目标 2028 |
| 铠侠 GP 系列(XL-FLASH) | 铠侠与 NVIDIA 合作 | 仍是 PCIe 附加的 SSD,第二代 XL-FLASH + PCIe 6.0 单盘 1,000 万 IOPS;替代的是现有 eSSD 而非新增槽位 |
| 代际路线(报告外推) | HBF Gen1 / Gen2 / Gen3 | Gen1 16-Hi / 512 GB;Gen2 24-Hi / 1 TB;Gen3 32-Hi / 2 TB,均为报告测算;超低翘曲堆叠良率、约 9 个月生产周期与热管理是三条硬约束 |
| 时点敏感性 | 乐观 2028 规模出货 / 中性 2029 / 悲观 2031 或更晚 | 三档对应的 2030E 板上存储 TAM 分别为 3.85 / 1.41 / 0.57 亿元,相差 6.8 倍;中性档单机非易失存储价值 168.4 元 |
0.4 拆开看:2030 年一台推理服务器的硬件构成
| 子系统 | 主芯片 | 存储 | 电源与驱动 | XTX 能否覆盖 |
|---|---|---|---|---|
| HBF 近端容量层 | xPU 经 UCIe 内存总线直连 | HBF 模组:8 / 16-Hi 3D NAND 堆叠 + CBA 铜铜混合键合,逻辑基片集成 ECC、坏块管理与地址映射;模组上大概率无独立 Flash | 与加速器共用核供电与散热路径 | 不可覆盖(需 3D NAND 晶圆与混合键合,XTX 连晶圆这一层都没有) |
| HBM 与 DDR5 主存 | 加速器与 CPU 的主存子系统 | HBM3E / HBM4 堆栈与 DDR5 主存,XTX 一颗都没有 | 核供电 VRM 与内存供电 | 不可覆盖(XTX 不做 DRAM、HBM 与 DDR) |
| 加速器 VBIOS 与 BMC / CPU BIOS | GPU / xPU、BMC 管理控制器、CPU | SPI NOR:GPU VBIOS 上探至 512 Mb—1 Gb,BMC / CPU BIOS 到 1 Gb,天花板档 2 Gb | 板上多路 VRM 与上电时序控制 | 可覆盖(主力档;但 1 Gb 仅 2 款 MP、2 Gb MP 量产为 0) |
| 互联 / 网卡与遥测日志 | DPU / 智能网卡、PCIe Switch、Retimer | SPI NOR 256 Mb—1 Gb 存固件;遥测与日志分区用 SPI NAND | SerDes 供电、低纹波 LDO | 可覆盖(SPI NOR 与 SPI NAND 均在射程内) |
| BMC 系统盘与板卡标识 | BMC、FRU 与内存 SPD | BMC 用 eMMC 32—64 GB(OpenBMC 镜像 + 日志 + 配置);FRU 与内存 SPD 用 I²C EEPROM | 由 BMC 电源域供给 | 部分可覆盖(eMMC 32 GB 全部处于 CS 或 LTB、需过 OpenBMC 验证;EEPROM 无产品线) |
把这张表加总,HBF 时代 XTX 的抓手只有一类——容量档被推高的板上 SPI NOR:GPU VBIOS 到 512 Mb—1 Gb、BMC 与 CPU BIOS 到 1 Gb、天花板档 2 Gb,2030 年加权单机非易失存储价值 168.4 元、TAM 1.41 亿元、可覆盖 74.5%。缺口要按性质分开看:EEPROM 是结构性死缺口(字节级改写 + I²C,NOR 扇区擦除在寿命与软件栈上都不成立);2 Gb NOR 与 BMC 高容量 eMMC 是「需求已经到了、供给还没到」的可争取项——前者是产品规划问题、优先级最高,后者是 OpenBMC 兼容验证与长期供货承诺问题。温度这一项只会更严:HBF 把更多容量塞进加速器封装旁边,液冷渗透率 2027 年逼近 60% 之后风冷区的局部温度反而更高,-40~+105 °C 不是差异化卖点,而是能不能进 BOM 的准入条件。测算
HBF 是比 HBM 更远的一堵墙——需要 3D NAND 晶圆、CBA 混合键合与 UCIe,XTX 一条都不具备,而且它不新增 NOR 槽位;唯一的抓手是它把时间推到 2028—2030 年之后、把板上 NOR 容量档从 256 Mb 推到 512 Mb / 1 Gb,所以现在该做的是补 2 Gb 量产节点与 256 Mb / 512 Mb 的 -40~+105 °C 温度档,而不是为 HBF 备货。
1 · 摘要与核心结论
这一章把全文的结论压缩成八条。如果只看一页,看这一页。
1.1 核心结论
| # | 结论 | 关键依据 |
|---|---|---|
| 1 | HBF 目前一颗都没有量产,本报告全部数字都是三档敏感性下的预测值,中性档 TAM 1.41 亿元、SAM 1.05 亿元。首个标准规范 v0.7 于 2026-08-04 通过 OCP 发布,工程样品 2026 下半年、推理设备样品 2027 年初、全面量产时点仍标 TBD。乐观(2028 规模出货)/ 中性(2029)/ 悲观(2031 或更晚)三档对应的 2030E 板上存储 TAM 分别是 3.85 / 1.41 / 0.57 亿元测算,相差 6.8 倍。 | 第 2.2 节三档预测;第 2.4 节分母推导;第 3.3 节 TAM |
| 2 | 分母必须是「HBF 折算的 AI 推理服务器当量」而不是 HBF 颗数。HBF 与 HBM 同构:裸堆栈与 xPU 一同封装在中介层或 RDL 上,通过 UCIe 内存总线直连,不是 PCIe 设备,不挂 Option ROM。按 HBF 颗数当分母会把板上存储 TAM 算成零。2030E 中性档 84 万台测算,且与 HBM 报告的 380 万台时点不同、互相重叠,不可相加。 | 第 2.4 节;UCIe 规范与 OCP HBF v0.7 |
| 3 | HBF 不新增 NOR 槽位——这是本报告与 HBM 报告最关键的差异,也是最容易被误判的一点。HBM 时代 NOR 颗数从 3 颗涨到 21 颗,驱动力是「GPU、Switch、Retimer、DPU、光模块各自都要一块可独立升级的固件存储」;而 HBF 挂在内存总线上,主机不为它分配 Option ROM 空间。它的全部价值传导只有一条:把时间轴推到 2028—2030,届时板上 NOR 主力容量档从 256 Mb 上移到 512 Mb / 1 Gb,天花板档到 2 Gb。 | 第 3.2 节器件拆解;第 4.5 节容量路线 |
| 4 | 可覆盖比例从 HBM 报告的 82% 降到 74.5%,原因是容量档位上移撞上了 XTX 的供给短板。2030 年主力档是 512 Mb—1 Gb、天花板档 2 Gb,而 XTX 的 1 Gb 仅 2 款 MP、2 Gb 的 MP 量产型号为 0(库内 7 款:2 款小批、4 款认证中、1 款在研)。不可覆盖部分还包括 EEPROM(FRU / SPD)。这不是市场变小了,是需求跑到了供给前面。 | 第 5.2 节容量档位表;第 10.2 节槽位对照 |
| 5 | 存在真实的负面效应:HBF 会减少所需服务器数量,这是本报告必须写出的减法。OXMIQ 在 Hot Chips 2026 建模 72-GPU 机架跑万亿参数 Kimi-K2(FP4):HBM-only 需 8 颗 GPU 承载一个模型实例(整机架 9 个实例),HBF-only 可做到 1 GPU 一个实例(整机架 72 个)。当部署受容量约束时,HBF 直接把服务器需求压缩——对以「台」为分母的 NOR 生意是负的。 | 第 2.2 节 OXMIQ 模型;第 8.1 节负面效应 |
| 6 | 《HBF Sucks?》是这份报告里最该读的一篇反面材料。北大与复旦团队(arXiv 2608.11668,2026-08)用扩展 TokenSim 重放四段两小时通义千问-百炼生产 trace,在 H100 / B200 上把 Mooncake 风格 KV 卸载栈的 SSD 换成 HBF,结果平均端到端时延上升 2—5.5 倍、最大 SLO goodput 下降 1.1—2.7 倍。根因是「通过封装买闪存」会挤占 GPU 近端层的容量与带宽,且每次 trace 的写入量都超过读取量,TLC 层比被替换的 SSD 池磨损更快。结论:HBF 作为瞬态 KV 的 SSD 替代品不成立,只在「重用感知放置 + 写入预算 + 热协调」下才有价值。 | arXiv 2608.11668;第 8.1 节 |
| 7 | 不可覆盖部分要拆开:EEPROM 是死缺口,2 Gb NOR 与 BMC 高容量 eMMC 是「需求已经到了、供给还没到」的可争取项。EEPROM 需要字节级改写 + I²C 接口,NOR 扇区擦除在寿命与软件栈上都不成立,XTX 无此产品线,如实计入不可覆盖;2 Gb NOR 是产品规划问题(优先级最高),BMC eMMC 32—64 GB 是 OpenBMC 验证与长期供货承诺问题。三者性质完全不同,不能混为一谈。 | 第 8.4 节;第 10.5 节缺口表 |
| 8 | 这是一个「一亿元量级」且时点在 2028 年之后的机会,把它当成 2026 年的增长点会误导资源分配。中性档 SAM 1.05 亿元,乐观档 2.87 亿元、悲观档 0.43 亿元。XTX 现在该做的不是为 HBF 备货,而是把 2 Gb NOR 的量产节点与 256 Mb / 512 Mb 的 -40~+105 °C 温度档补上——这两件事对 HBM、HBF、AI 算力模块三个品类同时有效,是与时点无关的正确投入。 | 第 11 章结论与建议;第 12.2 节计算链 |
1.3 图表索引
| 图 1 | HBF 从概念到标准的关键里程碑 | 2.1 | 图 2 | 单位容量成本对比:HBF / HBM / eSSD | 2.1 |
| 图 3 | HBF 市场规模三档预测(2028E—2030E) | 2.2 | 图 4 | HBF 三档规格与 HBM 的单堆栈容量对比 | 2.3 |
| 图 5 | HBF 折算 AI 推理服务器当量(三档) | 2.4 | 图 6 | HBF 生态阵营与终端采购方影响力 | 2.5 |
| 图 7 | HBF 推理服务器分档出货量(2030E) | 3.1 | 图 8 | 单机 SPI NOR 用量:三代服务器对比 | 3.2 |
| 图 9 | 单机非易失存储价值分档 | 3.3 | 图 10 | 单机电源与驱动器件用量 | 3.4 |
| 图 11 | HBF 三档读取带宽与 HBM 对照 | 4.1 | 图 12 | HBF 代际路线:层数与容量 | 4.2 |
| 图 13 | 三层存储分层的容量—带宽—成本 | 4.4 | 图 14 | 板上 NOR 容量升级路线 2026→2030 | 4.5 |
| 图 15 | 存储方案对比:价值与可覆盖性 | 5.1 | 图 16 | HBF 推理服务器 NOR 槽位矩阵 | 6.1 |
| 图 17 | 高带宽闪存(HBF)系统硬件框图 | 7.1 | 图 18 | H³ 混合架构下的启动时序 | 7.2 |
| 图 19 | XTX 可覆盖存储价值量(分档,2026 年行情中值) | 10.4 |
2 · 市场规模
HBF 的市场规模是所有 AI 硬件里数据最软的一个——没有一家原厂披露过出货量、ASP 或份额,唯一有机构署名的数字是韩国新荣证券的「2030 年 120 亿美元」。这一章先把「规范已发布、产品未量产」这个事实摆清楚,再用三档敏感性落到本报告能用的分母上。
2.1 出货量与规模
HBF 没有「过去三年市场规模」可言——2023 年它还不存在,2025 年 2 月才被提出。但它在 18 个月里走完了别的存储品类五年的路,这个过程本身值得写清楚,因为它决定了本报告的时点判断。
| 时点 | 事件 | 性质 | 对 XTX 的意义 |
|---|---|---|---|
| 2023—2024 | HBM 容量墙成为行业共识:单堆栈 24—48 GB、单位容量成本 >1,000 美元/GB | 产业背景 | 与 XTX 无关,但构成了 HBF 的需求起点 |
| 2025-02 | 闪迪在投资者日首次提出 HBF 概念并展示原型,同时成立技术顾问委员会 | 概念提出 | XTX 无参与可能 |
| 2025-08 | 闪迪与 SK 海力士签署 MOU,共同制定 HBF 技术规范 | 标准化启动 | 无 |
| 2025-10 | 2025 OCP 全球峰会:SK 海力士推出含 HBF 的 「AIN 系列」产品线;三星启动自有 HBF 早期概念设计 | 阵营分化 | 无 |
| 2026-02-26 | HBF 规格标准化联盟启动会(加州米尔皮塔斯闪迪总部),在 OCP 框架下设专项工作组 | 联盟成立 | 无 |
| 2026-08-04 | FMS 2026:SK 海力士与闪迪联合发布首个 HBF 标准规范(v0.7),开放、免授权费 | 标准发布 | 规范本身不含 XTX 可及器件;但面板级供应链开始可跟踪 |
| 2026-08 | 闪迪投资者日:首款 HBF 产品完成流片(tape-out),预计 2027 年推出首批样品;高盛评价为「早期期权,未计入估值」 | 产品化进展 | 无 |
这张表最重要的信息在最后两行之间:规范已经发布,产品还没量产。v0.7 是「0.7 版」,完整规范 1.0 预计 2027 年 1 月才发布,HBF Cube 可用时点指向 2028 年第一季度,而全面量产在 SK 海力士自己的路线图上仍标注为 TBD。从规范发布到量产硅片通常要三到四年——UCIe 3.0 规范发布于 2025 年 8 月,业界普遍预期原生 UCIe 3.0 芯粒硅片要到 2028—2029 年窗口。HBF 想在本十年末之前实现广泛部署,节拍上是紧的,但不是不可能。
经济性上,HBF 的全部说服力集中在一条:单位容量成本约为 HBM 的 1/3 至 1/10,而单堆栈容量是 HBM 的 8—16 倍。本报告按 HBM3E 约 12.5 美元/GB 的保守上沿(1/3)推算,HBF 约 3.5 美元/GB测算。但这个数字必须连带一个提醒:HBF 没有任何实际成交价,它是推算值,不能用于报价,而且它换来的是容量而非带宽——同样的钱买到的带宽只有 HBM 的三分之一左右。
2.2 出货趋势
对 HBF 的市场规模,公开可查的机构预测只有一个:韩国新荣证券给出的 2030 年 120 亿美元,约为同期 HBM 市场(约 1,170 亿美元)的 10%。另有两条更长期的口径:KAIST 金正浩教授预测 2038 年前后 HBF 需求可能超过 HBM;高盛 2026 年 8 月研报称 HBF 是闪迪的「额外上行期权」,但仍处于早期,未完全反映在公司估值中。
| 档位 | 规模出货起点 | 2030E 市场规模 | 对板上存储 TAM 的影响 |
|---|---|---|---|
| 乐观 | 2028 年 | 180 亿美元测算 | 服务器当量 214 万台,TAM 3.85 亿元测算 |
| 中性(工作值) | 2029 年 | 120 亿美元(新荣证券) | 服务器当量 84 万台,TAM 1.41 亿元测算 |
| 悲观 | 2031 年或更晚 | 60 亿美元测算 | 服务器当量 38 万台,TAM 0.57 亿元测算 |
三档之间相差 6.8 倍,这个离散度本身就是结论:HBF 现在是期权,不是订单。触发乐观档的条件是 UCIe 芯粒生态按计划成熟、闪迪 16-Hi 堆叠良率顺利爬坡;触发悲观档的条件有三个,任何一个发生都会把时点往后推:① 3D NAND 多层堆叠良率不达预期(生产周期约 9 个月,返工代价极高);② 三星 zHBM / zNAND-O 抢先成为事实标准;③ 《HBF Sucks?》揭示的系统性问题被产业界广泛接受,导致部署策略从「直接替换」退回「选择性使用」。
① OXMIQ(Hot Chips 2026)的建模给出了一条反直觉但极重要的结论:"HBM for the rack, HBF for the box."在 72-GPU 机架跑万亿参数 Kimi-K2(FP4)的场景下,HBM-only 配置提供 20.7 TB 容量与 1,584 TB/s 聚合带宽、整机架只能跑 9 个模型实例;HBF-only 配置把容量拉到 294.9 TB(14 倍)但带宽降到 922 TB/s,整机架能跑 72 个实例。容量受限时 HBF 完胜;带宽受限时 HBM 完胜。而「每 GPU 一个实例」意味着同样的推理任务需要的服务器数量下降——对以「台」为分母的 NOR 生意,这是减法。
② arXiv 2608.11668《HBF Sucks?》(北大 + 复旦,2026-08)保留 Mooncake 风格 KV 卸载栈、把底层 SSD 换成 HBF,在 H100 / B200 上测得平均端到端时延上升 2—5.5 倍、最大 SLO goodput 下降 1.1—2.7 倍。根因是:通过封装购买闪存会挤占 GPU 近端层的容量与带宽,而 HBF 自身的读写延迟几乎无关紧要(放大 3.75 倍,延迟变动不到 1%);且四条生产 trace 里写入量都超过读取量,3D-ICE 模型显示该栈在远低于峰值带宽处就撞上热限制,TLC 层比它替换掉的 SSD 池磨损更快。
③ 标准归属未定。三星未加入 SK 海力士 / 闪迪的联盟,在 FMS 2026 上主推 zHBM(把 HBM 垂直堆叠在加速器正上方,官方宣称 8 倍性能、3 倍能效、热阻减半、每 GPU 省约 100 W,量产目标 2028—2029)与 zNAND-O(面向边缘 AI 的 4 层 / 8 层 TSV V-NAND,目标 2028)。铠侠则走完全不同的第三条路——GP1 系列基于第二代 XL-FLASH 与 PCIe 6.0,单盘 1,000 万次随机读 IOPS、目标 1 亿 IOPS,但它仍是 PCIe 附加的 SSD,不是内存总线设备。三条路线谁先成为事实标准,直接决定 HBF 的时点。
2.3 关键指标
HBF 这个位置上同时有三条技术路线在跑,它们解决的是同一个问题(AI 推理的容量墙),但架构完全不同,对 XTX 的意义也完全不同——三条路线上都没有 XTX 的位置,但其中两条会推高板上 NOR 的容量档位,一条不会。
| 路线 | 主导方 | 架构 | 时点 | 是否推高板上 NOR 容量 |
|---|---|---|---|---|
| HBF(OCP 开放规范) | SK 海力士 + 闪迪,联盟成员含 Google、Tenstorrent | TSV 堆叠 3D NAND + CBA 铜铜混合键合,UCIe 芯粒接口直连 xPU,逻辑基片集成 ECC / 坏块管理 / 地址映射 | 样品 2026 H2、设备样品 2027 初、Cube 可用 2028 Q1、量产 TBD | 是——把时点推到 2028—2030,容量档上移到 512 Mb—2 Gb |
| 三星 zHBM / zNAND-O | 三星(未加入联盟) | zHBM 把 HBM 垂直堆叠在加速器正上方;zNAND-O 为带 TSV 的 V-NAND,面向边缘 AI 的 4 层 / 8 层版本 | zHBM 量产目标 2028—2029;zNAND-O 目标 2028 | 是——同样把容量档往上推,且 zNAND-O 面向边缘,与边缘算力模块品类重叠 |
| 铠侠 GP 系列(XL-FLASH) | 铠侠,与 NVIDIA 合作 | 仍是 PCIe 附加的 SSD,第二代 XL-FLASH + PCIe 6.0,单盘 1,000 万 IOPS,目标 1 亿 | GP 系列 2026 Q3 起;1 亿 IOPS 目标 2027 | 不确定——PCIe 设备会占一个 Option ROM 槽位,但它替代的是现有 eSSD 而非新增槽位 |
| NVIDIA 的角色 | NVIDIA | 不直接开发 HBF,但是事实上的认证闸门与关键客户 | — | 决定哪条路线能上量 |
这张表最重要的信息在最后一列。三条路线对 XTX 的意义差别不在「能不能进去」——都不能——而在「会不会把板上 NOR 的容量档位推上去」。HBF 与 zHBM 都会把时间推到 2028 年之后,届时 AI 服务器的整机柜统一固件镜像会把主力容量档从 256 Mb 推到 512 Mb / 1 Gb,天花板档到 2 Gb;这两条路线上 XTX 的供给短板(1 Gb 仅 2 款 MP、2 Gb MP 为 0)会被放大。铠侠路线不改变这个判断,因为它替换的是现有 eSSD 槽位。
HBF 规范的技术要点
| 维度 | 规范内容 | 对 XTX 的意义 |
|---|---|---|
| 堆叠配置 | 8-Hi 与 16-Hi 两种 NAND 堆叠,单堆栈最高 512 GB;闪迪第一代用 16-Hi | 无——不做 NAND 晶圆与堆叠 |
| 带宽分级 | Grade 1 约 0.4 TB/s(8-Hi 256 GB,8 GT/s UCIe);Grade 2 约 1.6 TB/s(512 GB,16 GT/s UCIe);Grade 3 约 3.0 TB/s(512 GB,32 GT/s UCIe 2.0) | 无,但决定了分档口径(第 3.1 节) |
| 互联接口 | UCIe 标准芯粒互连,并行高速内存总线,直连 GPU / CPU / 加速器,不是 PCIe / NVMe 协议 | 关键:内存总线设备不产生 Option ROM 槽位,这是「HBF 不新增 NOR 颗数」的技术依据 |
| 读写粒度 | 读块 64 B—4 KB,4 KB 写,4 KB 页;依赖上千个子阵列并发读取换取带宽 | 无 |
| 逻辑基片 | 集成 ECC 引擎、坏块管理、地址映射表、并行调度算法与多级读缓冲 | 固件由主机侧下发,模组上大概率无独立 Flash 尚无原厂公开披露,本报告按内存总线设备通行做法推断 |
| 规范体系 | 覆盖 xPU-HBF 主机接口、电气与信号完整性、堆叠工艺可靠性与封装指南(TSV / 微凸点 / 混合键合)、软件 I/O 指南四个维度 | 无 |
OCP HBF 规范 v0.7(2026-08-04 发布,开放免授权费);闪迪与 SK 海力士 FMS 2026 公开材料;Tom's Hardware 对 Hot Chips 2026 OXMIQ 演讲的报道。
2.4 分母口径
现在把 HBF 的量,换算成本报告能用的分母。方法与 HBM 报告同源但参数不同:用 2030E HBF 市场规模除以 HBF 模组 ASP,再除以单服务器搭载颗数。之所以不用「HBF 位元出货」,是因为没有任何机构发布过这个数字。
| 档位 | 规模出货起点 | 2030E 市场 | 模组 ASP | 单服务器搭载 | 服务器当量 |
|---|---|---|---|---|---|
| 乐观 | 2028 年 | 180 亿美元测算 | 1,400 美元测算 | 6 颗/台 | 214 万台测算 |
| 中性(工作值) | 2029 年 | 120 亿美元 | 1,780 美元测算 | 8 颗/台 | 84 万台测算 |
| 悲观 | 2031 或更晚 | 60 亿美元测算 | 2,000 美元测算 | 8 颗/台 | 38 万台测算 |
中性档的完整推导链
- 2030E 市场规模取 120 亿美元(韩国新荣证券,唯一有机构署名的公开预测)。
- HBF 模组 ASP 取 1,780 美元测算——按 HBM3E 24 GB 单堆栈约 300 美元(12.5 美元/GB)为基准,取公开口径「HBF 单位容量成本约为 HBM 的 1/3—1/10」的保守上沿 1/3,得约 3.5 美元/GB,乘以单堆栈 512 GB 得约 1,780 美元。
- 模组出货量 = 120 亿美元 ÷ 1,780 美元 ≈ 674 万颗测算。
- 单服务器搭载取 8 颗——主流 8 加速器推理服务器,按每个加速器配 1 颗 HBF 折算。
- 服务器当量 = 674 万 ÷ 8 ≈ 84 万台测算。
HBM 报告的 380 万台是 2026E 搭载 HBM 的 AI 服务器当量;本报告的 84 万台是 2030E 搭载 HBF 的推理服务器当量。两者时点相差四年,而且在架构上 HBF 服务器是 HBM 服务器的子集或延伸——同一台 2028 年的推理服务器会同时挂 HBM 与 HBF,在两份报告的分母里各被计一次。换句话说,HBM 报告与本报告测的是同一块板上非易失存储在不同时点的形态,不是两块可以相加的市场。若只取「4.21 亿元 + 1.41 亿元 = 5.62 亿元」,会犯一次四年跨度加总的口径错误。
横向校验一下这个量级:IIM 信息预测 AI 服务器出货量从 2025 年的 420 万台升至 2030 年的 1,150 万台,其中推理服务器 2026 年需求约 272.8 万台(按物理机)。中性档 84 万台相当于 2030 年 AI 服务器的 约 7%测算,对一项 2029 年才规模出货的新技术而言,这个渗透率是合理偏保守的。⚠ 各机构对「推理服务器」的定义分歧极大——另一份 IIM 报告给出 2026 年出货「超过 95 万台」,与 272.8 万台相差近 3 倍,本报告只把 AI 服务器总量当作量级校验,不做精确占比引用。
2.5 下游终端厂商格局
HBF 的直接采购方是闪迪与 SK 海力士,但决定板上 NOR 型号的永远不是存储原厂,而是 ODM 与服务器品牌厂的主板设计环节。这一节的目的是找出真正的 NOR 决策链,以及 HBF 这个新变量会怎样改变这条链。
| 厂商 | 在 HBF 生态中的角色 | 对 NOR 选型的影响力 | 说明 |
|---|---|---|---|
| SK 海力士 | 标准共同主导方,贡献 HBM 封装工艺与 3D 堆叠积累,提出 H³(Hybrid HBM+HBF)混合架构 | 间接高 | 定义参考设计与中介层布局,间接决定板上 Flash 的位置与容量 |
| 闪迪 SanDisk | 标准共同主导方,掌握 CBA 键合与 BiCS 3D NAND,第一代产品 16-Hi / 512 GB / 1.6 TB/s | 间接高 | 首款产品已完成流片,2027 年出样品 |
| 联盟成员,全程参与技术验证与标准制定 | 间接最高 | 自研 TPU + 自采服务器 + OCP 规范推动者,三重身份使其成为唯一能同时影响标准与 BOM 的终端方 | |
| NVIDIA | 未加入联盟,但是事实上的认证闸门与关键客户 | 高(否决权) | 其 AVL 与参考设计决定能否上量;已定点的 NOR 供应商很难被替换 |
| Tenstorrent | 联盟成员,AI 芯片新创 | 中 | 量级小,但技术路线激进,可作为早期验证的切入口 |
| 三星 | 自有路线(zHBM / zNAND-O),未加入联盟 | 中 | 若其路线成为事实标准,会重新洗牌 HBF 的时点与生态 |
| AMD / Intel | 未公开表态 | 低—中 | 取决于 HBF 是否被纳入其加速器参考设计 |
采购决策链:HBF 时代的 NOR 是怎么被选进去的
| 环节 | 决策内容 | 关注点 | HBF 带来的变化 |
|---|---|---|---|
| ① 加速器 / xPU 原厂 | 定义 VBIOS 分区大小、安全启动要求、是否为近端存储预留 Option ROM | 固件完整性、防回滚、容量够放 A/B 备份 | 无变化——HBF 不占 Option ROM 空间 |
| ② BMC 厂商(ASPEED / Nuvoton) | BMC 固件 Flash 容量与分区布局 | OpenBMC 兼容、4-byte addressing、双镜像 | 容量上移——整机柜统一镜像推动 512 Mb → 1 Gb → 2 Gb |
| ③ ODM / 主板设计 | 具体料号选型、第二供应商策略 | 价格、交期、AVL 状态、Pin-to-Pin 兼容 | 无新增槽位,但要应对容量档位迁移带来的重新选型 |
| ④ 云厂商 / 终端客户 | 通过 OCP 规范与 AVL 间接约束 | 长期供货(LTS)、PCN 管理、多源供应 | Google 等联盟成员的规范话语权上升,OCP 规范对 BOM 的约束变强 |
| ⑤ 存储原厂(闪迪 / SK 海力士) | 只决定 HBF 模组本身的规格 | 良率、堆叠层数、UCIe 速率 | 不决定板上 NOR 型号 这是最容易误判的一环 |
HBF 的采购被闪迪与 SK 海力士垄断,但板上 NOR 的选型权分散在 ODM 与 BMC 生态里——这跟 HBM 时代完全一样,HBF 这个新变量没有改变决策链的位置,只改变了容量档位这一个参数。可执行的动作有三个,按确定性排序:① 进入 ASPEED / Nuvoton 的 OpenBMC 兼容清单——参考设计公开、分区布局可验证,这是唯一能靠技术能力而非商务关系打通的入口,且它直接对应 BMC 主 Flash 这个单机价值最高的槽位;② 把 2 Gb NOR 的量产节点定在 2028 年之前——HBF 与 zHBM 都把容量档位推向 2 Gb,按当前供给(库内 7 款、MP 量产 0 款)这是一个必须先解决的硬伤;③ 跟随国产 AI 平台(昇腾等)一起走——国产化是硬要求,且不受 NVIDIA 生态绑定,是本报告推荐的第一落点。
3 · 用量分析
这一章回答:一台被 HBF 重新定义过的推理服务器,板上到底需要多少非易失存储,值多少钱。所有分档占比与单价均为 2030 年口径的报告测算,不是机构实测值,也不来自任何原厂披露。
3.1 分档出货量
OCP 规范的三个带宽等级(Grade 1—3)天然构成了分档依据:Grade 1 面向轻量化推理与边缘,Grade 2 匹配主流推理,Grade 3 服务大规模算力集群。再加上 SK 海力士的 H³ 混合架构(HBM 与 HBF 并列部署在同一中介层、统一地址空间对上层软件透明),一共四档。
| 档位 | 占比 | 2030E 出货 | HBF 配置 | 单机非易失存储价值 |
|---|---|---|---|---|
| 主流推理 | 40% | 34 万台测算 | 8×HBF Grade 2(1.6 TB/s,4 TB/台) | 170 元测算 |
| 入门推理 | 32% | 27 万台测算 | 4×HBF Grade 1(0.4 TB/s,1 TB/台) | 100 元测算 |
| 高配推理 | 16% | 13 万台测算 | 8×HBF Grade 3(3.0 TB/s,4 TB/台) | 240 元测算 |
| H³ 混合 | 12% | 10 万台测算 | HBM + HBF 同中介层,统一地址空间 | 250 元测算 |
| 合计 / 加权 | 100% | 84 万台 | — | 168.4 元测算 |
分档占比为报告测算测算,依据是 OCP HBF 规范的三档带宽定位与 SK 海力士 H³ 架构的公开描述。⚠ 没有任何机构发布过 HBF 服务器的分档实测占比,本表是本报告最脆弱的一处假设,若读者有更好的口径,可按第 12.2 节的计算链自行重算。
3.2 单台 NOR/NAND 用量
先给结论:HBF 推理服务器的单机 NOR 颗数是 20—24 颗,与 2026 年的 HBM AI 服务器(18—24 颗)基本持平,没有增长。这一条值得单独讲,因为它推翻了一个很自然的直觉——「多了一层存储,就该多几颗 Flash」。
| 系统形态 | SPI NOR 颗数 | 来源 | HBF 是否新增槽位 |
|---|---|---|---|
| 传统通用服务器 | 2—4 颗 | 芯天下 EETalk 2025 | — |
| HBM AI 服务器(2026E) | 18—24 颗 | 芯天下 EETalk 2025;兆易创新给 NVL72 架构 300—400 颗 | — |
| HBF 推理服务器(2030E) | 20—24 颗测算 | 报告测算 | 否 |
为什么 HBF 不新增 NOR 槽位
HBM 时代 NOR 颗数从 3 颗涨到 21 颗,驱动力是「谁有固件,谁就要有 Flash」:GPU、PCIe Switch、Retimer、DPU、网卡、光模块、CPLD、电源时序控制器,每一个可独立升级固件的单元都要配一颗非易失存储。这套逻辑对 HBF 不成立,原因在接口。
- HBF 挂在 UCIe 内存总线上,不是 PCIe 设备。PCIe 设备会在枚举时申明自己的 Option ROM 空间,主机 BIOS 从这个空间读取固件并加载——这就是每加一张卡就多一颗 Flash 的机制。而 HBF 通过并行高速内存总线直连 xPU,主机不把它当作可独立升级固件的 PCIe 功能设备,也不为其分配 Option ROM 空间。
- HBF 的逻辑基片固件由主机侧下发。逻辑基片集成了 ECC 引擎、坏块管理、地址映射表与并行调度算法,这套固件在初始化阶段经 UCIe 链路下发,而不是从模组上一颗自己的 Flash 里 XIP 就地执行。这与 HBM 的情况同构——HBM 的初始化、训练、测试全部通过 JEDEC 定义的寄存器接口完成,堆栈上没有任何外挂固件存储的位置。
- 同样的判断适用于三星 zHBM。它把 HBM 垂直堆叠在加速器正上方,走的同样是内存语义通道,不产生 Option ROM 槽位。唯一可能不同的是铠侠的 GP1 系列——它是 PCIe 6.0 附加设备,会占一个 Option ROM 槽位,但它替换的是现有 eSSD 槽位而非新增。
与 HBM 完全同理,HBF 以裸堆栈形式与 xPU 一同封装在中介层或 RDL 上,通过 UCIe 内存总线直连,不存在外挂固件存储的位置。⚠ 需要明确说明的一点:HBF 模组是否自带一颗小容量 SPI NOR 用于存放逻辑基片固件,目前没有任何原厂公开披露。本报告按「UCIe 内存总线设备的通行做法」推断为不带,并据此把单机 NOR 颗数定为 20—24 颗(与 HBM 服务器持平)。若后续厂商披露模组自带 SPI NOR,需重估这一结论——按 8 颗 HBF/台计算,若每颗配一颗 16—32 Mb NOR,单机将新增 8 颗、价值约 8—12 元,对中性档 TAM 的影响约 +5%~+7%。这是本报告中唯一一处「可能漏算的机会」,且其规模小于容量档迁移带来的影响。
容量分布:真正的变化在 512 Mb 到 2 Gb 这一段
| 板内位置 | 2026 主流容量 | 2030E 主流容量 | 颗数(8 加速器) | XTX 供给状态 |
|---|---|---|---|---|
| GPU / 加速器 VBIOS | 256 Mb / 512 Mb | 512 Mb / 1 Gb测算 | 8 | 512 Mb 有 9 款 MP;1 Gb 仅 2 款 MP |
| BMC / CPU BIOS | 512 Mb / 1 Gb | 1 Gb / 2 Gb测算 | 2—4 | 2 Gb 的 MP 量产为 0 |
| DPU / 智能网卡 | 256 Mb—512 Mb | 512 Mb—1 Gb测算 | 2—4 | 512 Mb 稳,1 Gb 偏紧 |
| PCIe Switch / Retimer | 256 Mb—512 Mb | 512 Mb测算 | 4—8 | 512 Mb 可覆盖 |
| 光模块 | 16 Mb—128 Mb | 128 Mb—256 Mb测算 | 4—8 | 128 Mb 有 22 款可选型 |
| CPLD / 电源时序 | 16—64 Mb | 32—64 Mb | 2—4 | 供给健康 |
| FRU / 板卡标识 | EEPROM 128 Kb—2 Mb | 同左 | 4—10 | 无 EEPROM 产品线 |
| HBF 模组本体 | — | — | 0 | 不产生槽位 |
这张表最后一行是它存在的理由:HBF 模组本体的 NOR 用量是 0。而倒数第二行(EEPROM)与第一行、第二行合起来,就是 2030 年 XTX 在这个品类里的全部机会与全部缺口:机会在 512 Mb—1 Gb,缺口在 2 Gb 与 EEPROM。
2026 年容量口径来自芯天下公开材料(2026)与兆易创新公开技术口径;2030 年取值为报告按整机柜统一固件镜像趋势外推测算。
3.3 单件价值与 TAM 测算
把上一节的器件清单折算成钱。价格取的是 2030 年口径——这一点必须反复强调,因为容量档位从 256 Mb 上移到 512 Mb / 1 Gb,单机价值自然会高于 2026 年的 110.7 元。涨的是单价与容量档,不是颗数。
| 档位 | 占比 | 2030E 出货 | 单机非易失存储价值 | 档位 TAM |
|---|---|---|---|---|
| 主流推理(Grade 2) | 40% | 34 万台测算 | 170 元测算 | 0.58 亿元测算 |
| 入门推理(Grade 1) | 32% | 27 万台测算 | 100 元测算 | 0.27 亿元测算 |
| 高配推理(Grade 3) | 16% | 13 万台测算 | 240 元测算 | 0.31 亿元测算 |
| H³ 混合架构 | 12% | 10 万台测算 | 250 元测算 | 0.25 亿元测算 |
| 合计 / 加权 | 100% | 84 万台 | 168.4 元测算 | 1.41 亿元测算 |
加权单机价值 168.4 元测算,乘以 84 万台得中性档 TAM 1.41 亿元测算。三档敏感性结果如下——这张表是本报告最应该被引用的一张,因为它把「不确定」量化了。
| 档位 | 规模出货起点 | 服务器当量 | 加权单机价值 | TAM | SAM(74.5%) |
|---|---|---|---|---|---|
| 乐观 | 2028 年 | 214 万台测算 | 180 元测算 | 3.85 亿元测算 | 2.87 亿元测算 |
| 中性(工作值) | 2029 年 | 84 万台测算 | 168.4 元测算 | 1.41 亿元测算 | 1.05 亿元测算 |
| 悲观 | 2031 或更晚 | 38 万台测算 | 150 元测算 | 0.57 亿元测算 | 0.43 亿元测算 |
可覆盖比例为什么从 82% 降到 74.5%
HBM 报告的可覆盖比例是 82%,本报告是 74.5%,下降 7.4 个百分点。原因不是市场变差了,而是需求跑到了供给前面。
- EEPROM(约 12 元/台)——真结构性缺口。FRU 板卡标识与 DDR5 SPD 需要字节级改写与 I²C 接口,NOR 是扇区擦除,在寿命与软件栈上都不成立。XTX 产品线里没有 EEPROM,除非新增产品线,否则这一块永远拿不到。
- 2 Gb NOR(约 18 元/台)——可争取但需投入。2030 年 BMC / CPU BIOS 与整机柜统一镜像要走到 2 Gb,而 XTX 库内 7 款 2 Gb 的 MP 量产型号为 0(2 款小批 SS、4 款认证中 QS、1 款在研 UD),全部为 BGA24 6×8 mm / 1.7—2.0 V。这是产品规划问题,不是技术不可行,但需要 2—3 年的提前量。
- BMC 高容量 eMMC(约 22 元/台)——可争取但需验证。32—64 GB 段,64 GB 有 1 款 MP + 1 款小批,32 GB 全部处于 CS 或 LTB。门槛在 OpenBMC 兼容性验证与长期供货承诺,需要投入工程资源。
把中性档 1.41 亿元与新荣证券预测的 2030 年 HBF 市场 120 亿美元放在一起,比例是 0.016%。这个对比不是为了打击信心,而是为了防止资源错配:如果按「AI 存储红利」的叙事在 2026 年就为 HBF 备货,会押在一个连量产时点都还标着 TBD 的品类上。反过来,如果把 HBF 当作「把容量档位推向 512 Mb—2 Gb 的一股确定性力量」,那么正确的投入与时点无关:把 2 Gb 的量产节点定在 2028 年前,把 256 Mb / 512 Mb 的 -40~+105 °C 温度档补齐——这两件事对 HBM、HBF、AI 算力模块三个品类同时有效,无论 HBF 走乐观档还是悲观档都不会白做。分档占比的最大不确定性在入门推理档——若其占比从 32% 升到 45%,加权单机价值会降到约 145 元,TAM 相应降到 1.22 亿元。
3.4 电源与驱动器件用量
为口径完整起见列出,但结论要先说:HBF 推理服务器的电源与驱动器件 XTX 一颗都进不去。多相 VRM 长期由 MPS、Infineon、Renesas、TI 垄断,且必须通过 GPU 厂商的供电参考设计认证。
按 8 加速器机型估算,单机约 50—60 颗电源与驱动器件,可覆盖部分接近于零。HBF 时代还有一个额外的不利因素:TrendForce 预计液冷渗透率从 2024 年的 14% 升到 2026 年的 53%、2027 年逼近 60%,泵驱动与风扇驱动的用量结构会变,但这两类同样不在 XTX 的产品线里(库内只有 1 款 LED 驱动、1 款负载开关,且均为在研)。建议:本品类不做电源侧的任何产能规划。
4 · 技术演进
技术演进这一章的重点是 4.4 与 4.5——前者解释 HBF 为什么是一个「容量器件」而不是「廉价 HBM」,后者给出 XTX 真正要跟的容量路线。
4.1 容量与接口演进
OCP 规范把 HBF 分成三个带宽等级。把这三个等级与 HBM 摆在一起看,HBF 的定位就非常清楚了:它是一个带宽只到 HBM3E 水平、容量却是 HBM 十几倍的器件。
| 等级 | 堆叠 / 容量 | UCIe 速率 | 读取带宽 | 目标场景 |
|---|---|---|---|---|
| Grade 1 | 8-Hi / 256 GB | 8 GT/s | 约 0.4 TB/s | 轻量化推理、边缘 AI |
| Grade 2 | 16-Hi / 512 GB | 16 GT/s | 约 1.6 TB/s | 主流 AI 推理(闪迪第一代目标) |
| Grade 3 | 16-Hi / 512 GB | 32 GT/s(UCIe 2.0) | 约 3.0 TB/s | 大规模算力集群,接近 HBM3E 水平 |
带宽差异的来源值得写清楚:HBM 的带宽来自超宽接口(2048-bit)与高时钟,HBF 的带宽来自上千个子阵列的并发读取。现代 3D NAND 内部有成百上千个独立存储子阵列,每个配独立驱动电路;HBF 的逻辑基片把这些子阵列当作独立通道并发调度,配合数千位宽的超宽总线,即使单次读取延迟为几十微秒,聚合带宽仍能达到 TB/s 级。这个机制决定了它适合规则、可预测的顺序读取(模型权重加载),而不适合随机小写。
4.2 形态演进
闪迪第一代 HBF 采用 16-Hi 堆叠、512 GB、1.6 TB/s。往后的代际路线没有任何厂商指引,本报告按 3D NAND 层数演进节奏外推,并明确标注为报告测算。
| 代际 | 堆叠层数 | 单堆栈容量 | 时点 | 约束 |
|---|---|---|---|---|
| HBF Gen1 | 16-Hi | 512 GB | 样品 2026 H2,量产 2029E测算 | 超低翘曲堆叠工艺、CBA 铜铜混合键合良率 |
| HBF Gen2 | 24-Hi测算 | 1 TB测算 | 约 2029—2030测算 | 多层堆叠良率是首要难题;生产周期约 9 个月 |
| HBF Gen3 | 32-Hi测算 | 2 TB测算 | 约 2031 及以后测算 | 热管理成为并列瓶颈;互联复杂度指数级增长 |
三个约束必须同时看到:① 良率——多层 3D NAND 堆叠的翘曲控制是首要工程难题;② 周期——生产周期约 9 个月,意味着任何一次返工都会把时点推后大半年;③ 热管理——上层芯片的信号要通过 TSV 连到底部中介层,布线密度逼近物理极限,且堆叠层数越多、散热路径越长。这三条合起来,就是本报告把「全面量产」列为 TBD 的原因。
4.3 可靠性与温度
HBF 的封装路线与 HBM 有交集也有分叉。交集是都用 TSV 做垂直互连、都放在中介层或 RDL 上;分叉在键合工艺——HBM 用 MR-MUF(SK 海力士)或混合键合,HBF 用 CBA(CMOS Directly Bonded to Array)铜铜混合键合,把存储阵列与外围电路分别在两片晶圆上制造后面对面键合。
CBA 的意义是:存储阵列不再受外围电路布局制约,位密度更高;键合距离极短,寄生 RC 大幅下降,有利于提升接口速率与降低功耗。这条路线与铠侠 / 闪迪的 BiCS 架构、长江存储的 Xtacking 架构在原理上相通。对 XTX 而言这一节的结论只有一句:整条封装与键合价值链都在 NOR/NAND 之外,且比 HBM 的距离更远——XTX 连 NAND 晶圆这一层都没有。
4.4 替代技术演进
这是本报告最重要的一节,因为它决定了「HBF 到底会不会推高板上 NOR 的价值」。答案取决于它在系统里扮演什么角色。
| 维度 | HBM3E(基准 1) | HBF(相对倍数) | eSSD(相对倍数) | 含义 |
|---|---|---|---|---|
| 单堆栈容量 | 24 GB(基准 1) | 21 倍(512 GB) | 2,560 倍(61.44 TB) | HBF 的核心价值是容量,不是带宽 |
| 读取带宽 | 1.2 TB/s(基准 1) | 1.3 倍(1.6 TB/s) | 0.012 倍(14 GB/s) | HBF 的带宽增益只有 30% |
| 单位容量成本 | 12.5 美元/GB(基准 1) | 0.28 倍(3.5 美元/GB) | 0.005 倍(0.06 美元/GB) | 成本降到 HBM 的约 1/3.5 |
| 单次访问延迟 | 纳秒级(基准) | 微秒级,高一个数量级以上 | 百微秒级 | 延迟是 HBF 的硬伤,不是带宽 |
| 静态功耗 | 需持续刷新(基准) | 约 0.6—0.8 倍 | 更低 | 非易失、无需刷新,是 HBF 的第二个卖点 |
| 写耐久 | 近乎无限(基准) | 约 10 万次擦写 | 数千—数万次 | 写密集场景直接失格 |
这张表最重要的信息在第二行与第一行之间:HBF 拿到的容量增益是 21 倍,带宽增益只有 1.3 倍。这个不对称解释了两件事:① 为什么 OXMIQ 说「HBM for the rack, HBF for the box」——机架级追求吞吐,单机箱级追求装得下;② 为什么《HBF Sucks?》会得出负面结论——KV 卸载这个场景要的是读写混合与低延迟,而 HBF 恰好在这两项上最弱。
把上面这张表与第 3.2 节的槽位矩阵合起来,HBF 对 XTX 的全部传导路径就只剩一条:它把时间推到 2028—2030,届时整机柜统一固件镜像把板上 NOR 的主力容量档从 256 Mb 推到 512 Mb / 1 Gb,天花板档推到 2 Gb。不新增颗数、不新增槽位、不改变决策链——只改一个参数:容量。而容量这一项,恰恰是 XTX 当前供给最薄的地方(1 Gb 仅 2 款 MP、2 Gb MP 为 0)。这就是本报告的判断:HBF 不是机会本身,它是把 XTX 的容量短板提前暴露出来的一面镜子。
4.5 XTX 在整机价值中的占比
把视角从 HBF 拉回 NOR。2026 年到 2030 年,AI 服务器带来的不只是颗数增加,更是容量档位的整体上移:
| 板内位置 | 2026 主流 | 2030E 主流 | 升级幅度 | XTX 供给状态 |
|---|---|---|---|---|
| BMC / CPU BIOS | 512 Mb / 1 Gb | 1 Gb / 2 Gb测算 | 2—4 倍 | 2 Gb MP 量产为 0(库内 7 款:2 小批、4 认证中、1 在研) |
| GPU / 加速器 VBIOS | 256 Mb / 512 Mb | 512 Mb / 1 Gb测算 | 2—4 倍 | 512 Mb 有 9 款 MP(1 款达 105 °C);1 Gb 仅 2 款 MP |
| DPU / 智能网卡 | 256 Mb—512 Mb | 512 Mb—1 Gb测算 | 2 倍 | 512 Mb 稳;1 Gb 供给偏紧 |
| 光模块 | 16 Mb—128 Mb | 128 Mb—256 Mb测算 | 2 倍 | 128 Mb 有 22 款可选型,供给健康 |
这张表是本报告最有用的产出之一,也是它最刺眼的一行:2030 年 BMC / CPU BIOS 要走到 2 Gb,而 XTX 在这一档的 MP 量产型号是 0。按 HBF 与 zHBM 共同推动的容量迁移节奏,2 Gb 必须在 2028 年前完成量产,否则会错过 2028—2031 这一轮完整的容量升级窗口。这一条与 HBM 报告的结论完全一致——不是巧合,因为两条技术路线推向的是同一个终点。