参数:
14 GB
权重 · fp16 · 2 B/权重
1.07 GB
KV 缓存 · 批量 1
15.07 GB
总 VRAM · 权重 + KV 缓存
| 显卡级别 | VRAM | 加载后剩余 | 状态 |
|---|---|---|---|
| RTX 3060 Ti / RTX 4060 / RX 7600 | 8 GB | — | 太小 |
| RTX 3060 12 GB / RTX 4070 | 12 GB | — | 太小 |
| RTX 4060 Ti 16 GB / RTX 5080 | 16 GB | 0.93 GB | 放得下 |
| RTX 3090 / RTX 4090 | 24 GB | 8.93 GB | 放得下 |
| RTX A6000 / L40S | 48 GB | 32.93 GB | 放得下 |
| A100 80 GB / H100 / H200 | 80 GB | 64.93 GB | 放得下 |
权重 = 参数量 × 字节/权重 · KV = 2 × 层数 × 上下文长度 × KV 头数 × 头维度 × 2 B × 批量 · 十进制 GB(10⁹ 字节);不含激活值和运行时开销
功能说明
VRAM 计算器在你下载或租用任何东西之前,估算一个大语言模型需要多少 GPU 显存。输入参数量和量化方式(FP16、INT8、Q4_K_M……),它会计算权重的占用;再加上上下文长度、批量大小和模型的注意力结构,它就会附加实际服务该上下文所需的 KV-cache 开销。然后它把总量与常见 GPU 显存档位对照 — 从 8 GB 消费级显卡到 80 GB 数据中心板卡 — 显示模型加载之后还剩多少空闲。一切 100% 在客户端运行。
使用方法
- 选择一个参数预设(0.5B … 70B),或在**参数量(Parameters (billions))**里输入任意值。
- 选择量化(Quantization) — 每权重字节数(4、2、1、0.5,或 Q4_K_M 约为 0.61)决定权重的大小。
- 设置上下文长度(Context length)和批量大小(Batch size) — 两者都会成倍放大 KV cache。
- 如果你了解模型的结构,可在 Attention architecture 下覆盖层数(Layers)、KV 头数(KV heads (after GQA))和头维度(Head dimension);默认值(32 / 8 / 128)适用于现代 GQA 模型。
- 读取 Weights / KV cache / Total 磁贴,再查看 GPU fit 表确认哪些显卡装得下、剩余多少 VRAM。
- **复制总量(Copy total)拿到头号数字,或复制分享链接(Copy share link)**发送确切的配置。
示例
7B 模型 FP16、8K 上下文(默认值)
Parameters 7B · FP16 · context 8192 · batch 1 · layers 32 · kvHeads 8 · headDim 128
Weights 14 GB + KV cache 1.07 GB = Total 15.07 GB
Fits: 16 GB cards (0.93 GB free), 24 GB, 48 GB, 80 GB. Does NOT fit 8 GB or 12 GB.
70B 模型 Q4_K_M、4K 上下文、Llama-2-70B 结构
Parameters 70B · Q4_K_M (~0.61 B/weight) · context 4096 · layers 80
Weights 42.44 GB + KV cache 1.34 GB = Total 43.78 GB
Fits: 48 GB (RTX A6000 / L40S, 4.22 GB free) and 80 GB. Not a 24 GB RTX 4090.
8B 模型 INT4、无需上下文
Parameters 8B · INT4 · context 0
Weights 4 GB + KV cache 0 GB = Total 4 GB → fits an 8 GB card with 4 GB to spare.
补充说明
- 单位是十进制 GB(10⁹ 字节),与 “70B” 和显卡容量的标称方式一致。
- KV 公式: 2 × layers × context × kvHeads × headDim × 2 字节(FP16 K+V)× batch。GQA 模型只缓存 KV 头,所以 8 ≠ 32 很关键 — 请查看模型卡。
- 总量只是下限: 激活值、CUDA context 和推理引擎开销(通常 0.5–2 GB)未包含在内 — 请留出余量。
- 私密: 所有计算都在你的浏览器中本地运行;不向服务器发送任何数据。
- 相关工具: LLM Cost Calculator、Token Estimator、Model Picker。