拓撲(Topology) 與佈線一次設計對,
跨節點頻寬全開
跨節點頻寬全開
訓練效能常受限於跨節點通訊。拓撲與佈線在設計階段一次做對,實測頻寬方能貼近理論值;此項在單機測試中無法驗證,須於全叢集完成實測。
Fat-Tree 通用性高,適用多數訓練任務;Rail-Optimized 針對 GPU 與網卡對應關係最佳化,減少跨交換器跳數。
含高速交換器 Q3400-RA/SN5600/SN4700、管理交換器 SN2201、管理節點、企業級防火牆與整套光纖收發器及線材。
設計階段以 3D 環境模擬走線路徑,精算每條線纜長度,避免現場長度不足或大量剩料。
以 NCCL 於全叢集實測跨節點 all-reduce 頻寬,對照理論值後出具報告。
B300 世代伺服器出廠標準配置
GB200 NVL72 參考規格(依 NVIDIA 公開資料)
GB300 NVL72 參考規格(依 NVIDIA 公開資料)
叢集內每台 B300 伺服器的出廠標準配置:8U 模組化機箱、NVIDIA HGX B300-SXM6 288GB、6+6 路 Titanium 電源與 8×OSFP 800G 高速埠。
| 項目 | 規格 |
|---|---|
| 機箱 | 8U 模組化,6+6 3000W(240V)Titanium 電源 |
| GPU | NVIDIA HGX B300-SXM6 288GB |
| CPU | Intel 6767P,64 核 2.4GHz,336MB 快取,350W ×2 |
| 記憶體 | 96GB DDR5 RDIMM 6400MHz ×32 |
| 系統碟 | 960GB PCIe Gen4×4 M.2 ×2 |
| 資料碟 | 3,840GB PCIe Gen4×4 U.2 ×4 |
| 網路卡 | NVIDIA BlueField-3 B3240 400G QSFP112 Gen5 雙埠 |
| 高速埠 | 8×OSFP 800G |
| 擴充 | 4×FHHL PCIe 5.0 ×16,8×2.5" Gen5 NVMe/SATA |
| 管理 | BMC AST2600,Intel X710 雙埠 10G |
架構設計到驗收,四階段整案交付
從 InfiniBand 拓撲與供電散熱評估定案,到跨國物流清關、佈線與系統部署,再到 NCCL 實測與 24 小時燒機,每一階段均由專責團隊把關,交付標的是通過驗收的叢集。
- 01架構設計
定案整體架構、InfiniBand 拓撲、機櫃佈局、供電散熱與可擴充及容錯設計。
- 02到場與佈線
海外專案含跨國物流清關;進場後卸載、上架與 400G/800G 佈線,部署作業系統、NVIDIA 驅動與 UFM。
- 03測試與驗收
以 NCCL 頻寬測試驗證拓撲與佈線,全叢集滿載燒機 24 小時以上,報告作為完工驗收依據。
- 04驗收移交
燒機報告與拓撲驗證結果一併移交,叢集自移交日起進入維運範圍。
五階段逐層開機,異常當場定位
叢集不同時開機,先確認運算節點正常,再逐層疊加高速網通、管理監控、網路邊界與雲平台。逐層開機使每一層的異常在該層當場定位,不需在全系統上線後回頭逐項排查。
- 01GPU 伺服器
- 02高速網通
- 03管理節點
- 04防火牆
- 05雲平台
累計交付 3,856 張 GPU,
交付實績輻射亞洲市場
專案涵蓋台灣、日本與馬來西亞,機型自 A100 至 B300 多個世代;最大案場為馬來西亞的百台等級伺服器、1,024 張 B300,整案交付並通過驗收後移交。
常見問題
若需訓練大模型,需要整個 GPU 叢集,亞洲還有哪些供應商?
B200/B300 叢集在亞洲哪裡可以建?
我還沒有符合規格的機房,也能做嗎?
叢集設計會影響機房的機電規劃嗎?
GPU 伺服器採購該找原廠還是整合商?
如何驗證拓撲與佈線是否正確?
燒機測試一定要 24 小時嗎?
液冷或貨櫃式的專案是否也在承接範圍?
叢集的高速網路用什麼規格?
常一起評估的服務
準備啟動 GPU 叢集部署專案?
說明訓練規模與機房條件,我們回覆叢集架構與交付時程。