| Clase de tarjeta | VRAM | Libre tras cargar | Estado |
|---|---|---|---|
| RTX 3060 Ti / RTX 4060 / RX 7600 | 8 GB | — | Demasiado pequeña |
| RTX 3060 12 GB / RTX 4070 | 12 GB | — | Demasiado pequeña |
| RTX 4060 Ti 16 GB / RTX 5080 | 16 GB | 0.93 GB | Cabe |
| RTX 3090 / RTX 4090 | 24 GB | 8.93 GB | Cabe |
| RTX A6000 / L40S | 48 GB | 32.93 GB | Cabe |
| A100 80 GB / H100 / H200 | 80 GB | 64.93 GB | Cabe |
pesos = params × bytes/peso · KV = 2 × capas × contexto × cabezas KV × dimensión de cabeza × 2 B × batch · GB decimales (10⁹ bytes); sin incluir activaciones ni sobrecarga de ejecución
Qué hace
La Calculadora de VRAM estima cuánta memoria de GPU necesita un modelo de lenguaje grande antes de que descargues o alquiles nada. Introduce el número de parámetros y su cuantización (FP16, INT8, Q4_K_M, …) y calcula la huella de los pesos; añade tu longitud de contexto, el tamaño de lote y la forma de atención del modelo y suma el coste de la caché KV de servir ese contexto. Luego compara el total con los niveles de memoria de GPU habituales — desde una tarjeta de consumo de 8 GB hasta una placa de datacenter de 80 GB — mostrando cuánto queda libre tras cargar el modelo. Todo se ejecuta 100% en el lado cliente.
Cómo usarlo
- Elige un preset de parámetros (0.5B … 70B) o escribe cualquier valor en Parámetros (miles de millones).
- Elige una Cuantización — los bytes por peso (4, 2, 1, 0.5, o ~0.61 para Q4_K_M) gobiernan el tamaño de los pesos.
- Ajusta la Longitud de contexto y el Tamaño de lote — ambos multiplican la caché KV.
- Si conoces la forma del modelo, sobrescribe Capas, Cabezas KV (tras GQA) y Dimensión de cabeza bajo Arquitectura de atención; los valores por defecto (32 / 8 / 128) encajan con un modelo GQA moderno.
- Lee las fichas Pesos / Caché KV / Total y revisa la tabla de encaje en GPU para ver qué tarjetas lo soportan y cuánta VRAM queda libre.
- Pulsa Copiar total para la cifra principal, o Copiar enlace para compartir para enviar la configuración exacta.
Ejemplos
Modelo de 7B en FP16, contexto de 8K (valores por defecto)
Parameters 7B · FP16 · context 8192 · batch 1 · layers 32 · kvHeads 8 · headDim 128
Weights 14 GB + KV cache 1.07 GB = Total 15.07 GB
Fits: 16 GB cards (0.93 GB free), 24 GB, 48 GB, 80 GB. Does NOT fit 8 GB or 12 GB.
Modelo de 70B en Q4_K_M, contexto de 4K, forma de Llama-2-70B
Parameters 70B · Q4_K_M (~0.61 B/weight) · context 4096 · layers 80
Weights 42.44 GB + KV cache 1.34 GB = Total 43.78 GB
Fits: 48 GB (RTX A6000 / L40S, 4.22 GB free) and 80 GB. Not a 24 GB RTX 4090.
Modelo de 8B en INT4, sin necesidad de contexto
Parameters 8B · INT4 · context 0
Weights 4 GB + KV cache 0 GB = Total 4 GB → fits an 8 GB card with 4 GB to spare.
Buen saber
- Las unidades son GB decimales (10⁹ bytes), como se citan los “70B” y los tamaños de tarjeta.
- Fórmula KV: 2 × capas × contexto × cabezasKV × dimCabeza × 2 bytes (K+V en FP16) × lote. Los modelos GQA solo guardan en caché las cabezas KV, así que 8 ≠ 32 importa — revisa la ficha del modelo.
- El total es un suelo mínimo: las activaciones, el contexto CUDA y la sobrecarga del motor de inferencia (típicamente 0.5–2 GB) no están incluidas — deja margen.
- Privado: todos los cálculos se ejecutan localmente en tu navegador; nada se envía a un servidor.
- Herramientas relacionadas: LLM Cost Calculator, Token Estimator, Model Picker.