Skip to content

Calculadora de VRAM

Estime a VRAM de que um LLM precisa — pesos por quantização mais o KV cache do seu contexto e batch — e veja quais GPUs de consumo e de datacenter a comportam.

AI & Agents
cosmodev ~/tools/vram-calculator-
Parâmetros:
14 GB
Pesos · fp16 · 2 B/peso
1.07 GB
Cache KV · batch 1
15.07 GB
VRAM total · pesos + cache KV
Classe de placaVRAMLivre após carregarStatus
RTX 3060 Ti / RTX 4060 / RX 76008 GB—Pequena demais
RTX 3060 12 GB / RTX 407012 GB—Pequena demais
RTX 4060 Ti 16 GB / RTX 508016 GB0.93 GBCabe
RTX 3090 / RTX 409024 GB8.93 GBCabe
RTX A6000 / L40S48 GB32.93 GBCabe
A100 80 GB / H100 / H20080 GB64.93 GBCabe

pesos = params × bytes/peso · KV = 2 × camadas × contexto × cabeças KV × dimensão de cabeça × 2 B × batch · GB decimais (10⁹ bytes); ativações e overhead de execução não incluídos