一句話總結:NVIDIA 正式推出 NVHBM 客製化記憶體架構,把控制器塞進 HBM 堆疊裡面,一口氣釋放運算晶片 25% 的寶貴面積,頻寬還順便拉了 30% 上去——這不是小改款,是直接把 HBM 的遊戲規則翻過來寫。
核心要點
- 頻寬飆升 30%:相較標準 JEDEC HBM4E 規範,NVHBM 的記憶體頻寬直接多出三成,單堆疊理論頻寬最高可達 5.2TB/s 的驚人水準。
- 運算裸片面積釋放 25%:傳統架構下記憶體控制器必須佔用昂貴的先進製程運算裸片,NVHBM 把控制器移到 HBM 內部,直接幫晶片「瘦身」四分之一的控制器占用面積。
- PHY 介面面積縮減 67%:客製化實體介面把 I/O 面積砍掉將近七成,中介層走線佈局難度大幅降低,整體封裝空間額外釋放高達 80%。
- 功耗降低 15%:單顆晶片節省的電力看似不多,但放到 1GW 規模的超大資料中心,省下來的電力與散熱餘裕可以 多塞 1.5 萬顆 XPU。
- 三星 HBM4E 進度明確:三星已在 Hot Chips 2026 大會確認 16Gbps 版本 HBM4E 準備出貨,單堆疊頻寬推向 4TB/s,疊上 NVHBM 的 30% 加成直接挑戰 5.2TB/s。
- 亞馬遜率先上車:Annapurna Labs 成為首家公開合作夥伴,AWS 自研 AI 晶片可望率先導入 NVHBM 技術。
傳統 HBM 設計有個很尷尬的物理瓶頸:記憶體控制器非得擺在運算裸片上。這個「非得」的代價是什麼?是昂貴的 5 奈米、3 奈米晶片面積被拿去做控制器的雜務,而不是拿來塞更多 CUDA Core 或快取記憶體。NVIDIA 這次做的事其實很直接——把控制器丟回 HBM 堆疊裡面,運算裸片就專心做運算就好。
說真的,這個邏輯早該有人做了。只是要把控制器整合進 HBM 堆疊,難度不在架構設計,而在於誰能同時搞定晶片設計、封裝技術、還有跟記憶體廠的規格談判。NVIDIA 偏偏是那個三件事都能拍板的人。
數字會說話。25% 的運算裸片面積釋放代表什麼?代表下一代旗艦 GPU 可以在同樣的晶片尺寸下塞進更多運算單元,要不然就是把晶片縮小來降低成本。更誇張的是 PHY 介面面積縮減 67%,中介層走線釋放 80% 空間——這在需要圍繞運算裸片塞進 8 組、12 組甚至更多 HBM 堆疊的高階加速器上,根本是物理限制的解壓縮。
功耗那個 15% 看起來還好對吧?但 NVIDIA 給了一個很具體的計算方式:一座 1GW 規模的頂級 AI 資料中心,單顆 XPU 功耗 2000W。透過 NVHBM 省下來的電力和散熱餘裕,理論上可以「多塞 1.5 萬顆 XPU」。這不是什麼環保訴求,這是直接換算成算力密度和投資報酬率的問題——同樣的電費帳單,你能跑更多模型、訓練更快、賺更多錢。
編輯觀點:從產業面來看,NVHBM 最有趣的地方不是技術數據多漂亮,而是 NVIDIA 正在把「客製化記憶體」變成自己的另一個護城河。過去 HBM 是 JEDEC 標準規格,誰都能用,差異化有限。但 NVHBM 是 NVIDIA 自己定義的架構,控制器設計、PHY 介面、甚至跟三星、SK 海力士的供貨規格都是閉門談出來的。這等於是把記憶體這個原本「標準化」的元件,也拉進 NVIDIA 的生態系鎖定效應裡面。AMD 或 Intel 要不要跟?跟了就要重新設計控制器、重新談供貨、重新驗證封裝——等他們追上來,NVIDIA 已經跑下一圈了。
三星在 Hot Chips 2026 上給的數字也值得注意。16Gbps 的 HBM4E 已經在準備出貨,單堆疊頻寬 4TB/s。疊上 NVHBM 的 30% 加成,5.2TB/s 這個數字不是夢幻規格,是工程上已經有明確路徑的目標。而且 NVIDIA 特別強調 NVHBM 會開放給多家記憶體供應商驗證——這話的弦外之音是:我不只跟三星玩,SK 海力士跟美光也歡迎,但規格是我定的。
亞馬遜 Annapurna Labs 的加入是另一個信號。AWS 是全球雲端龍頭,他們自研的 Trainium、Inferentia 晶片如果導入 NVHBM,代表這技術不是只留在 NVIDIA 自家 GPU 上,而是整個 AWS 的算力軍備競賽都會被這條架構影響。雲端客戶可能根本不會知道 NVHBM 這個名字,但他們租用的算力變便宜了、模型訓練變快了,這就是背後的底層技術在發力。
當然,整個故事還有一個沒明說的伏筆:成本。客製化 HBM 的價格肯定比標準 HBM 貴,NVIDIA 有沒有辦法用「面積節省」和「功耗降低」帶來的系統級效益來說服終端客戶買單?這題沒有標準答案,但從 AWS 已經跳進來合作的動作來看,雲端巨頭的算力成本模型已經算過這筆帳了——而且答案應該是「划得來」。
接下來你可以做三件事
如果你在 AI 基礎建設或雲端運算相關領域,NVHBM 不是一個「以後再說」的技術。第一,盤點你現有算力部署的功耗與散熱瓶頸,NVHBM 的節能效益在機櫃等級會被放大,現在就可以開始試算 15% 功耗節省對你的機櫃密度提升多少。第二,關注 AWS 下一代 Trainium/Inferentia 的規格發布,Annapurna Labs 的導入進度會是 NVHBM 實際落地的風向球。第三,如果你正在評估下一代 AI 訓練叢集的硬體採購,直接把 NVHBM 支援與否列入規格檢查清單——這項技術不是行銷話術,是真實影響總體擁有成本的物理層級變革。
一句話結論
NVIDIA 用 NVHBM 證明了記憶體控制器不需要乖乖待在運算晶片上,而這個「不需要」三個字,背後是 25% 的晶片面積、30% 的頻寬、15% 的功耗,以及 1.5 萬顆 XPU 的算力差距。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
NVHBM 跟標準 HBM4E 有什麼不同?
最大差異在記憶體控制器的位置。標準 HBM4E 的控制器佔用運算裸片面積,NVHBM 把控制器整合進 HBM 堆疊內部,釋放運算晶片面積並提升頻寬。
NVHBM 什麼時候會實際出現在產品中?
NVIDIA 尚未公布具體時間表,但亞馬遜 Annapurna Labs 已確認合作,三星 16Gbps HBM4E 也在出貨準備階段,實際產品推估在 2027 年有機會問世。
NVHBM 會讓顯示卡變更貴嗎?
客製化 HBM 成本可能高於標準規格,但運算裸片面積節省與功耗降低帶來的系統效益能否抵銷成本,取決於終端應用的規模,目前尚無明確定論,建議諮詢硬體採購專業評估。
AMD 或 Intel 可以用 NVHBM 嗎?
NVHBM 是 NVIDIA 定義的客製化架構,理論上其他廠商若要使用需取得授權或重新設計控制器,目前 NVIDIA 僅表示開放給記憶體供應商驗證,未提及開放給競爭晶片廠。
5.2TB/s 的頻寬是真的嗎?
這是基於三星 16Gbps HBM4E 的 4TB/s 單堆疊頻寬,疊加 NVHBM 宣稱的 30% 頻寬提升計算出的理論值,NVIDIA 官方並未直接公布 5.2TB/s 這個數字,屬於合理工程推估。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。