| Classe de carte | VRAM | Libre après chargement | Statut |
|---|---|---|---|
| RTX 3060 Ti / RTX 4060 / RX 7600 | 8 GB | — | Trop petite |
| RTX 3060 12 GB / RTX 4070 | 12 GB | — | Trop petite |
| RTX 4060 Ti 16 GB / RTX 5080 | 16 GB | 0.93 GB | Tient |
| RTX 3090 / RTX 4090 | 24 GB | 8.93 GB | Tient |
| RTX A6000 / L40S | 48 GB | 32.93 GB | Tient |
| A100 80 GB / H100 / H200 | 80 GB | 64.93 GB | Tient |
poids = params × octets/poids · KV = 2 × couches × contexte × têtes KV × dimension de tête × 2 o × batch · Go décimaux (10⁹ octets) ; activations et surcoût d'exécution non inclus
Ce que ça fait
Le Calculateur VRAM estime la mémoire GPU dont un grand modèle de langage a besoin avant que vous ne téléchargiez ou ne louiez quoi que ce soit. Entrez le nombre de paramètres et sa quantization (FP16, INT8, Q4_K_M, …) et il calcule l’empreinte des poids ; ajoutez votre longueur de contexte, la taille de batch et la forme d’attention du modèle et il ajoute le coût du KV-cache pour réellement servir ce contexte. Il compare ensuite le total aux paliers de mémoire GPU courants — d’une carte grand public de 8 Go à une carte datacenter de 80 Go — en montrant combien il reste de libre une fois le modèle chargé. Tout s’exécute à 100 % côté client.
Comment l’utiliser
- Choisissez un préréglage de paramètres (0,5B … 70B) ou tapez n’importe quelle valeur dans Parameters (billions).
- Choisissez une Quantization — les octets par poids (4, 2, 1, 0,5, ou ~0,61 pour Q4_K_M) déterminent la taille des poids.
- Réglez Context length et Batch size — les deux multiplient le KV cache.
- Si vous connaissez la forme du modèle, surchargez Layers, KV heads (after GQA) et Head dimension sous Attention architecture ; les valeurs par défaut (32 / 8 / 128) conviennent à un modèle GQA moderne.
- Lisez les tuiles Weights / KV cache / Total, puis consultez le tableau GPU fit pour savoir quelles cartes le contiennent et combien de VRAM il reste.
- Copy total pour le chiffre headline, ou Copy share link pour envoyer la configuration exacte.
Exemples
Modèle 7B en FP16, contexte 8K (valeurs par défaut)
Parameters 7B · FP16 · context 8192 · batch 1 · layers 32 · kvHeads 8 · headDim 128
Weights 14 GB + KV cache 1.07 GB = Total 15.07 GB
Fits: 16 GB cards (0.93 GB free), 24 GB, 48 GB, 80 GB. Does NOT fit 8 GB or 12 GB.
Modèle 70B en Q4_K_M, contexte 4K, forme Llama-2-70B
Parameters 70B · Q4_K_M (~0.61 B/weight) · context 4096 · layers 80
Weights 42.44 GB + KV cache 1.34 GB = Total 43.78 GB
Fits: 48 GB (RTX A6000 / L40S, 4.22 GB free) and 80 GB. Not a 24 GB RTX 4090.
Modèle 8B en INT4, aucun contexte nécessaire
Parameters 8B · INT4 · context 0
Weights 4 GB + KV cache 0 GB = Total 4 GB → fits an 8 GB card with 4 GB to spare.
Bon à savoir
- Les unités sont des Go décimaux (10⁹ octets), cohérent avec la façon dont « 70B » et les tailles de cartes sont annoncées.
- Formule KV : 2 × layers × context × kvHeads × headDim × 2 octets (FP16 K+V) × batch. Les modèles GQA ne cachent que les têtes KV, donc 8 ≠ 32 compte — vérifiez la model card.
- Le total est un plancher : activations, contexte CUDA et overhead du moteur d’inférence (typiquement 0,5-2 Go) ne sont pas inclus — laissez de la marge.
- Privé : tous les calculs s’exécutent localement dans votre navigateur ; rien n’est envoyé à un serveur.
- Outils liés : LLM Cost Calculator, Token Estimator, Model Picker.