パラメータ:
14 GB
重み · fp16 · 2 B/重み
1.07 GB
KV キャッシュ · バッチ 1
15.07 GB
合計 VRAM · 重み + KV キャッシュ
| カードクラス | VRAM | 読込後の空き | 状態 |
|---|---|---|---|
| RTX 3060 Ti / RTX 4060 / RX 7600 | 8 GB | — | 小さすぎる |
| RTX 3060 12 GB / RTX 4070 | 12 GB | — | 小さすぎる |
| RTX 4060 Ti 16 GB / RTX 5080 | 16 GB | 0.93 GB | 収まる |
| RTX 3090 / RTX 4090 | 24 GB | 8.93 GB | 収まる |
| RTX A6000 / L40S | 48 GB | 32.93 GB | 収まる |
| A100 80 GB / H100 / H200 | 80 GB | 64.93 GB | 収まる |
重み = パラメータ数 × バイト/重み · KV = 2 × レイヤー数 × コンテキスト長 × KV ヘッド数 × ヘッド次元 × 2 B × バッチ · 10進 GB(10⁹ バイト);活性化と実行オーバーヘッドは含まない
機能の説明
VRAM Calculator は、何かをダウンロードしたりレンタルしたりする前に、大規模言語モデルにどれだけの GPU メモリーが必要かを推定します。パラメーター数とその量子化(FP16、INT8、Q4_K_M、…)を入力すると、重みのフットプリントを計算します。さらにコンテキスト長、バッチサイズ、モデルのアテンション形状を追加すると、そのコンテキストを実際に提供する際の KV キャッシュのコストが加算されます。そして、合計を一般的な GPU メモリー階層 — 8 GB のコンシューマーカードから 80 GB のデータセンターボードまで — と照合し、モデルをロードした後にどれだけの空きが残るかを表示します。すべて 100% クライアント側で実行されます。
使い方
- パラメータープリセット(0.5B 〜 70B)を選ぶか、Parameters (billions) に任意の値を入力します。
- Quantization を選びます。重み 1 個あたりのバイト数(4、2、1、0.5、Q4_K_M なら約 0.61)が重みサイズを決定します。
- Context length と Batch size を設定します。どちらも KV キャッシュに掛け算されます。
- モデルの形状が分かる場合は、Attention architecture 配下の Layers、KV heads (after GQA)、Head dimension を上書きします。デフォルト(32 / 8 / 128)は最新の GQA モデルに適合します。
- Weights / KV cache / Total タイルを読み、GPU fit テーブルでどのカードに収まるか、どれだけの VRAM が空くかを確認します。
- Copy total で主要な数値をコピーするか、Copy share link で正確な構成をそのまま共有します。
例
7B モデルを FP16、コンテキスト 8K(デフォルト)
Parameters 7B · FP16 · context 8192 · batch 1 · layers 32 · kvHeads 8 · headDim 128
Weights 14 GB + KV cache 1.07 GB = Total 15.07 GB
Fits: 16 GB cards (0.93 GB free), 24 GB, 48 GB, 80 GB. Does NOT fit 8 GB or 12 GB.
70B モデルを Q4_K_M、コンテキスト 4K、Llama-2-70B の形状
Parameters 70B · Q4_K_M (~0.61 B/weight) · context 4096 · layers 80
Weights 42.44 GB + KV cache 1.34 GB = Total 43.78 GB
Fits: 48 GB (RTX A6000 / L40S, 4.22 GB free) and 80 GB. Not a 24 GB RTX 4090.
8B モデルを INT4、コンテキスト不要
Parameters 8B · INT4 · context 0
Weights 4 GB + KV cache 0 GB = Total 4 GB → fits an 8 GB card with 4 GB to spare.
補足事項
- 単位は 10 進 GB(10⁹ バイト)です。“70B” やカード容量の表記方法と揃えています。
- KV キャッシュの式: 2 × layers × context × kvHeads × headDim × 2 バイト(FP16 の K+V)× batch。GQA モデルは KV ヘッドのみをキャッシュするため、8 ≠ 32 が結果に効いてきます — モデルカードで確認してください。
- 合計は下限値です: アクティベーション、CUDA コンテキスト、推論エンジンのオーバーヘッド(通常 0.5〜2 GB)は含まれていません — 余裕を持ってください。
- プライベート: すべての計算はブラウザー内でローカルに実行されます。サーバーには何も送信されません。
- 関連ツール: LLM Cost Calculator、Token Estimator、Model Picker。