設備交付不等於日常維運有人接手
所有權轉移不等於有人接手日常:告警要專人值守,硬體故障要有人開 RMA 追到料,叢集網路要有人隔離故障節點,這些都在上線後才展開。
日常維運涵蓋六項核心工作
值班人員即時監看告警並當場判讀分類,多數事件於遠端完成排除,回應時間最短。確認硬體故障後開立 RMA,追蹤至料件到位與更換完成;需現場作業的事件即刻派工到場,按次計費,依平日假日與時段分級。
- 問題
上線後缺乏專責維運人力
監控、告警與 RMA 沒有專責窗口,只能由既有 IT 人員兼辦。
解法主動監控與
告警接收 設備狀態與告警由值班人員 24/7 即時監看,於遠端完成判讀、分類與第一線排除。
解法AIOps 智慧維運平台
Day-2 遠端維運均運行於此平台,產出儀表板與報表,資安更新依排程執行。
- 問題
叢集網路技能落差
GPU 叢集網路與一般機房網路差異大,缺乏經驗時難以即時定位異常。
解法NVIDIA UFM 叢集網路維運
持續監控高速網路狀態,偵測鏈路異常並隔離故障節點。
解法技術人員教育訓練
業主技術人員可納入教育訓練,接手一線判讀與例行檢查。
- 問題
原廠保固與
現場處理脫節 保固條款寫在合約裡,但現場拆換、送修與復機仍需人到場執行。
問題故障排除未先約定處理時限
沒有約定回應與到場時限,異常發生時只能被動等待。
解法故障排除與原廠 RMA 協調
確認硬體故障後向原廠開立 RMA,全程追蹤至料件到位與更換完成。
解法緊急到場支援
需現場作業的事件由工程師到場處置,按次計費,依平日假日與時間內外分級。
- 01監控與告警
持續監看設備與叢集網路。
- 02判讀與分級
確認事件影響與回應責任。
- 03處理與追蹤
排除問題、協調 RMA 並記錄。
服務水準兩種模式,
依責任範圍選擇
設備與場域由同一方負責時,採可用率保證模式,以整體可用率為承諾標的,並約定未達標的服務費調整機制;責任橫跨多方時,採回應時效保證模式,承諾告警回應與故障處置的時限。可用率同受電力、機電與設備品質影響,模式與責任邊界於簽約前一併確認。
可用率保證模式
以整體可用率為承諾標的,未達標時的服務費調整比例與上限於合約載明。
回應時效保證模式
承諾告警回應與故障處置的時限,可用率依實際場域條件另行評估。
維運費的涵蓋範圍,
簽約時完整界定
簽約時完整界定
維運費的邊界於簽約時一次寫定:哪些日常維護含在月費,哪些屬料件與工程須另行計價,以及驅動與框架升級後的相容性問題。
維運費涵蓋
月費涵蓋日常維運的人力與作業,不因事件次數另行計價。
不含在維運費內
屬料件成本、新增工程或業主端環境的項目,依實際項目另行報價。
維運範圍涵蓋整條算力路徑
叢集故障不只出現在 GPU 伺服器:交換機鏈路異常、管理節點排程失效、儲存掛載中斷,任一項都會使訓練中斷。維運需涵蓋整條路徑,計價依逐台台數與類別核算。
- GPU 伺服器
硬體告警監看、故障判讀、原廠 RMA 開立與追蹤
- 交換機
鏈路狀態監控、故障埠隔離、韌體版本控管
- 管理與儲存節點
排程服務可用性、掛載狀態、容量水位監看
- 負載平衡器
拓撲健康度、跨節點頻寬劣化偵測
24/7 值守
上線後的設備監控、告警判讀與硬體報修均由值班團隊遠端接手;每筆事件的狀態、處置與時程全數留存,責任邊界清晰可稽。
常見問題
GPU 叢集出問題時,多久會有人回應?
維運合約涵蓋哪些設備?
維運費是如何計算的?
短期專案可以只簽數個月嗎?
維運過程中提供哪些報表?
我們自有 IT 團隊,可以一起維運嗎?
康斯特的機房符合哪些資安標準?
常一起評估的服務
機房上線,維運團隊到位了嗎?
提供設備清單,我們回覆維運範圍與服務等級。