AI 伺服器資料路徑
AI 伺服器為什麼同時需要 HBM、SSD 與 HDD?
記憶體和儲存怎麼分工,答案不在三張規格表,而在同一批資料隨時間換了幾次狀態。
直接答案:HBM 放 GPU 此刻正在計算的模型與資料,SSD 負責快速載入、暫存與 checkpoint,HDD 或以 HDD 為主的大量共享儲存保存完整資料集、歷史版本與長期副本。工作負載會改變三者的比例,但只買最快或容量最大的一種,都無法完成整條資料流程。
假設一家台灣電子零件廠累積了 10TB 產線瑕疵影像,準備微調視覺檢測模型。台灣電子零件廠不會把 10TB 影像一次塞進 GPU。完整影像先留在共享儲存,訓練節點把即將反覆使用的資料片段複製到本機 NVMe SSD,訓練程式再把一個批次與模型工作狀態送進 HBM。同一批資料先被保存,再靠近 GPU,最後才進入計算。
01/工作檯
HBM 只放 GPU 現在要算的部分
GPU 使用 HBM 當作高速工作檯。NVIDIA 把 GPU memory 放在 AI 資料層級的最上方,因為 GPU 能直接取得這一層的資料。模型權重、運算中的張量與當前影像批次要進入 HBM,GPU 才能持續計算。HBM 容量綁在 GPU 上,斷電後內容也不會保留。NVIDIA 的技術文件同時提醒,模型或資料若在運算中頻繁換到外部儲存,訓練速度會明顯下降。
台灣電子零件廠的 10TB 影像遠大於單一 GPU 的 HBM,訓練程式只能分批載入。較大的 HBM 可以減少批次與資料交換,但 HBM 仍然不是保存完整資料集的地方。同一批影像會在多個 epoch 反覆使用,訓練節點因此需要另一層儲存縮短重複讀取。
02/中繼月台
SSD 把重複路程縮短
本機 NVMe SSD 位在共享儲存與 HBM 之間。NVIDIA 的 DGX 文件寫明,系統第一次從共享儲存讀取資料後,可以把副本放到本機 NVMe;後續讀取就從本機快取取得,不必再次走完整網路路徑。台灣電子零件廠可以把常用影像片段留在 SSD,訓練程式再把需要的批次送進 HBM。SSD 不替 HBM 做運算,SSD 縮短的是 GPU 等資料的時間。
同一批影像,讀取路徑有何不同?
第一次讀取:10TB 完整資料仍在共享儲存,訓練節點把即將使用的片段複製到本機 SSD,再送入 HBM。
03/流向反轉
Checkpoint 讓計算結果往下寫回
訓練程式還要處理中斷與復原。台灣電子零件廠若只把進度留在 HBM,停電、節點故障或程式錯誤都可能讓數小時訓練消失。訓練程式因此會定期寫出 checkpoint,保存模型權重、最佳化器狀態與進度。NVIDIA 的 DGX 文件指出,本機 NVMe 可以先承接較快的暫時 checkpoint,再把主要 checkpoint 送到可靠的共享儲存。KIOXIA 的技術白皮書把 checkpoint 寫入速度列為 GPU 等待時間的來源;效能數字屬 KIOXIA 引用與整理的供應商資料,checkpoint 會占用訓練時間的機制則和 NVIDIA 的系統設計一致。
Checkpoint 讓資料開始反向移動。資料先從共享儲存經 SSD 進入 HBM,運算一段時間後,又從 HBM 寫回 SSD 與共享儲存。SSD 若寫得太慢,GPU 會停下來等;checkpoint 若只留在本機快取,節點故障時又可能一起遺失。速度與可靠性必須分開處理,長期容量才有明確位置。
04/容量回到後方
HDD 保存不必每毫秒讀取的資料
台灣電子零件廠完成模型後,10TB 原始影像不會消失。清理後資料、不同訓練版本、checkpoint、錯誤案例與推論輸出還會繼續增加。這些資料不需要每毫秒讀取,卻要為重新訓練、品質追蹤或稽核保存。HDD 或以 HDD 為主的大量儲存可以承接這一層;SSD 保留需要快速讀取的熱資料,HBM 只保留 GPU 當下要算的部分。
SK hynix 在 2026 年 7 月 29 日的財報中表示,AI 需求同時拉動 HBM、AI 伺服器 DRAM 與企業 SSD。Seagate 在 2026 年 7 月 28 日的財報中則把雲端資料中心需求與 AI 產生的資料連到大量儲存。兩家公司談的是各自看到的訂單與展望,不能當成獨立市場統計。兩份財報仍提供一個可核對的供應鏈訊號:GPU 附近的高速記憶體與 SSD 增加時,後方的大量持久儲存也可能一起增加。這個訊號只能說三層需求可能同時成長,不能替每座機房指定同一種配置。
公司財報能回答「供應商看到哪些需求」,不能直接回答「你的機房該買多少」。供應鏈訊號與實際配置必須分開讀。
05/比例不是配方
工作負載與瓶頸會改變三層比例
每座 AI 機房不一定照同一比例採購。小型模型與小資料集可能只需要 HBM 加 SSD,訓練節點本身甚至沒有 HDD。全快閃共享儲存可以把 HDD 排除在架構之外,代價要回到容量、成本、功耗與保存週期評估。雲端物件儲存只向客戶顯示服務介面,底層用了多少 SSD 或 HDD 也可能不公開。媒體比例只是第一層答案;比例選對以後,資料仍要走完從儲存到 GPU 的路徑。
資料路徑還可能卡在網路、PCIe、檔案系統或前處理。台灣電子零件廠即使換上更快 SSD,只要共享儲存到訓練節點的網路不足,GPU 仍然會等。HDD 只要留在長期保存層,不直接進入延遲最敏感的訓練路徑,較慢的單碟速度就不等同於較慢的 GPU 計算。採購問題因此要從資料狀態開始,不能只比較單一零件規格。
切換工作負載,三層責任如何改變?
06/從資料狀態開始採購
四個問題,比單一零件規格更接近答案
採購 AI 伺服器時,可以先問四個具體問題:GPU 現在要算哪些資料、哪些資料會反覆讀取、故障後多久必須恢復、哪些資料要保存數月或數年。第一個問題決定 HBM,第二與第三個問題決定 SSD 和共享儲存速度,第四個問題決定長期容量。只看總 TB 或單一讀寫速度,會把不同責任混在一起。
回到台灣電子零件廠的 10TB 影像,完整資料與歷史版本留在大量持久儲存,會反覆使用的片段與暫時 checkpoint 放在 SSD,GPU 當下要計算的批次與模型狀態才進入 HBM。AI 伺服器同時需要 HBM、SSD 與 HDD,因為同一批資料會在運算、等待、復原與長期保存之間換狀態。三層各自解決一段時間問題,單一媒體再快或再大都無法包辦。
不是把三種零件排在一起,而是把同一批資料的現在、下一次與很久以後,各自放對位置。