KONST
AI 訓練計算器聯絡我們
繁中
AI TRAINING CALCULATOR| AI 訓練計算器

模型的下一步,
需要多少顯存?

比較推論與 LoRA 微調的容量需求,從模型權重、KV Cache 到 GPU 張數逐項估算。

MEMORY ESTIMATE| 記憶體估算
21.2估算總顯存 · GB
模型權重
16.0 GB
KV Cache
0.5 GB
Activations
3.2 GB
框架預留
1.5 GB

容量規劃示意,不代表實測結果。

GPU CAPACITY| GPU 容量

需要幾張 GPU?

此表僅依顯存總容量推算;多卡配置仍需模型切分、框架及互連支援,並不保證直接運行。

GPU顯存 / 卡至少張數總容量容量使用率
B300可交付288 GB1288 GB7.4%
B200180 GB1180 GB11.8%
H200可交付141 GB1141 GB15.1%
H100 NVL94 GB194 GB22.6%
A100 80GB80 GB180 GB26.5%
H100 SXM5可交付80 GB180 GB26.5%
L40S48 GB148 GB44.2%
A100 40GB40 GB140 GB53.1%
RTX 409024 GB124 GB88.5%
ASSUMPTIONS| 假設條件

把估算的前提說清楚

查看計算公式與限制

GB 採十進位;權重 = 參數量 × 精度 bytes;KV Cache = 2 × 層數 × KV Heads × Head Dim × 上下文長度 × Batch Size × 2 bytes。Cache 固定採 FP16。

推論 activation 以權重的 20% 估算;LoRA 微調啟用 Gradient Checkpointing 時為 25%,停用時為 60%。LoRA Rank 8/16/32/64 對應 2%/4%/6%/8% 的估算比例,LoRA 狀態 = 參數量 × 比例 × 2 × 13 bytes。框架固定預留 1.5 GB。微調模式也計入 KV Cache,並不等於實際訓練時的 cache 行為。

自訂模型以參數量近似推算架構,無法取代模型設定檔。

LoRA 比例與 activation 均為粗估。不同框架、模型架構、量化及最佳化器會影響實際用量。INT8/INT4 微調需相容的量化 LoRA 工具鏈。本工具不估算訓練時間,也不執行訓練工作。

一起規劃,下一階段的算力

帶著試算結果,與業務團隊談規格