果核Pulse
📡 X 信号

英伟达把Rubin Ultra HBM堆叠从12层砍到8层

Nvidia 把 Rubin Ultra 的 HBM 規格從 12-Hi 降到 8-Hi,因為真正的瓶頸是「每單位頻寬的成本($/bandwidth)」,而不是「每單位容量的成本($/capacity)」。

容量 ≈ 堆疊數 × 每堆疊晶片層數 × 每層 GB
頻寬 ≈ 堆疊數 × 介面寬度 × pin 速度
堆疊高度買到的是容量,不是頻寬。

從 12-Hi 砍到 8-Hi,會少掉三分之一的 DRAM 晶片(這是 BOM 上供給最緊張的矽),但頻寬維持不變甚至還會略升。

單位容量的頻寬因此提升 50%,在 HBM 價格上漲之際,每單位頻寬的成本會明顯改善。

推論(inference)是頻寬受限的:每解碼一個 token,都要重新讀取權重與 KV cache。

----- (Rubin Ultra · HBM4 · 12-Hi → 8-Hi):

- 堆疊高度買到的是容量,不是頻寬
- 同樣 2,048-bit 介面、同樣 pin 速度,每堆疊少三分之一 DRAM 晶片
- 12-Hi(Rubin):每堆疊 36 GB,每 GPU 288 GB
- 8-Hi(Rubin Ultra):每堆疊 24 GB,每 GPU 192 GB
- DRAM 晶片數 -33%(砍掉 BOM 上供給最緊的那部分成本)
- 頻寬 ±0(實際上 Rubin Ultra 還會略升)
- 單位 GB 頻寬 +50%,HBM 漲價時每美元能買到的頻寬更好

查看 X 原帖

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部