| Classe de placa | VRAM | Livre após carregar | Status |
|---|---|---|---|
| RTX 3060 Ti / RTX 4060 / RX 7600 | 8 GB | — | Pequena demais |
| RTX 3060 12 GB / RTX 4070 | 12 GB | — | Pequena demais |
| RTX 4060 Ti 16 GB / RTX 5080 | 16 GB | 0.93 GB | Cabe |
| RTX 3090 / RTX 4090 | 24 GB | 8.93 GB | Cabe |
| RTX A6000 / L40S | 48 GB | 32.93 GB | Cabe |
| A100 80 GB / H100 / H200 | 80 GB | 64.93 GB | Cabe |
pesos = params × bytes/peso · KV = 2 × camadas × contexto × cabeças KV × dimensão de cabeça × 2 B × batch · GB decimais (10⁹ bytes); ativações e overhead de execução não incluídos
O que faz
A Calculadora de VRAM estima quanta memória de GPU um modelo de linguagem grande precisa antes de você baixar ou alugar qualquer coisa. Informe a contagem de parâmetros e sua quantização (FP16, INT8, Q4_K_M, …) e ela calcula o espaço ocupado pelos pesos; adicione o comprimento de contexto, o tamanho do batch e o formato de atenção do modelo e ela soma o custo do KV cache para servir esse contexto. Ela então compara o total com os tiers comuns de memória de GPU — de uma placa de consumo de 8 GB a uma placa de datacenter de 80 GB — mostrando quanto sobra depois que o modelo carrega. Tudo roda 100% no cliente.
Como usar
- Escolha um preset de parâmetros (0.5B … 70B) ou digite qualquer valor em Parâmetros (bilhões).
- Escolha uma Quantização — os bytes por peso (4, 2, 1, 0.5, ou ~0.61 para Q4_K_M) determinam o tamanho dos pesos.
- Defina o Comprimento de contexto e o Tamanho do batch — ambos multiplicam o KV cache.
- Se você conhece o formato do modelo, sobrescreva Camadas, Cabeças KV (após GQA) e Dimensão da cabeça em Arquitetura de atenção; os padrões (32 / 8 / 128) servem para um modelo GQA moderno.
- Leia os blocos Pesos / KV cache / Total e verifique a tabela de ajuste em GPU para ver quais placas comportam o modelo e quanto de VRAM sobra.
- Use Copiar total para o número principal, ou Copiar link de compartilhamento para enviar a configuração exata.
Exemplos
Modelo 7B em FP16, contexto 8K (padrões)
Parameters 7B · FP16 · context 8192 · batch 1 · layers 32 · kvHeads 8 · headDim 128
Weights 14 GB + KV cache 1.07 GB = Total 15.07 GB
Fits: 16 GB cards (0.93 GB free), 24 GB, 48 GB, 80 GB. Does NOT fit 8 GB or 12 GB.
Modelo 70B em Q4_K_M, contexto 4K, formato Llama-2-70B
Parameters 70B · Q4_K_M (~0.61 B/weight) · context 4096 · layers 80
Weights 42.44 GB + KV cache 1.34 GB = Total 43.78 GB
Fits: 48 GB (RTX A6000 / L40S, 4.22 GB free) and 80 GB. Not a 24 GB RTX 4090.
Modelo 8B em INT4, sem contexto necessário
Parameters 8B · INT4 · context 0
Weights 4 GB + KV cache 0 GB = Total 4 GB → fits an 8 GB card with 4 GB to spare.
Bom saber
- As unidades são GB decimais (10⁹ bytes), coerente com como “70B” e os tamanhos de placa são cotados.
- Fórmula do KV: 2 × layers × context × kvHeads × headDim × 2 bytes (FP16 K+V) × batch. Modelos com GQA só fazem cache das cabeças KV, então 8 ≠ 32 importa — verifique o model card.
- O total é um piso: ativações, contexto CUDA e overhead do motor de inferência (tipicamente 0.5–2 GB) não estão incluídos — deixe margem.
- Privado: toda a matemática roda localmente no seu navegador; nada é enviado a um servidor.
- Ferramentas relacionadas: LLM Cost Calculator, Token Estimator, Model Picker.