| Kartenklasse | VRAM | Frei nach Laden | Status |
|---|---|---|---|
| RTX 3060 Ti / RTX 4060 / RX 7600 | 8 GB | — | Zu klein |
| RTX 3060 12 GB / RTX 4070 | 12 GB | — | Zu klein |
| RTX 4060 Ti 16 GB / RTX 5080 | 16 GB | 0.93 GB | Passt |
| RTX 3090 / RTX 4090 | 24 GB | 8.93 GB | Passt |
| RTX A6000 / L40S | 48 GB | 32.93 GB | Passt |
| A100 80 GB / H100 / H200 | 80 GB | 64.93 GB | Passt |
Gewichte = Params × Bytes/Gewicht · KV = 2 × Layer × Kontextlänge × KV-Heads × Head-Dimension × 2 B × Batch · dezimale GB (10⁹ Bytes); Aktivierungen und Laufzeit-Overhead nicht enthalten
Was es tut
Der VRAM-Rechner schätzt, wie viel GPU-Speicher ein großes Sprachmodell braucht, bevor du etwas herunterlädst oder mietest. Gib die Parameteranzahl und ihre Quantisierung ein (FP16, INT8, Q4_K_M, …) und er berechnet den Platzbedarf der Gewichte; füge deine Kontextlänge, Batch-Größe und die Attention-Form des Modells hinzu und er addiert die KV-Cache-Kosten dafür, diesen Kontext tatsächlich zu bedienen. Er prüft dann die Summe gegen gängige GPU-Speicherstufen - von einer 8-GB-Consumer-Karte bis zu einem 80-GB-Rechenzentren-Board - und zeigt, wie viel nach dem Laden des Modells frei bleibt. Alles läuft zu 100 % clientseitig.
So verwendest du es
- Wähle einen Parameter-Preset (0.5B … 70B) oder tippe einen beliebigen Wert in Parameter (Milliarden).
- Wähle eine Quantisierung - die Bytes pro Gewicht (4, 2, 1, 0.5 oder ~0.61 für Q4_K_M) treiben die Größe der Gewichte.
- Stelle Kontextlänge und Batch-Größe ein - beide multiplizieren den KV-Cache.
- Wenn du die Form des Modells kennst, überschreibe Layers, KV-Heads (nach GQA) und Head-Dimension unter Attention-Architektur; die Standardwerte (32 / 8 / 128) passen zu einem modernen GQA-Modell.
- Lies die Kacheln Gewichte / KV-Cache / Gesamt, dann prüfe in der GPU-Fit-Tabelle, welche Karten es fassen und wie viel VRAM frei bleibt.
- Gesamt kopieren für die Kernzahl oder Teilen-Link kopieren, um die exakte Konfiguration zu senden.
Beispiele
7B-Modell in FP16, 8K-Kontext (Standardwerte)
Parameters 7B · FP16 · context 8192 · batch 1 · layers 32 · kvHeads 8 · headDim 128
Weights 14 GB + KV cache 1.07 GB = Total 15.07 GB
Fits: 16 GB cards (0.93 GB free), 24 GB, 48 GB, 80 GB. Does NOT fit 8 GB or 12 GB.
70B-Modell in Q4_K_M, 4K-Kontext, Llama-2-70B-Form
Parameters 70B · Q4_K_M (~0.61 B/weight) · context 4096 · layers 80
Weights 42.44 GB + KV cache 1.34 GB = Total 43.78 GB
Fits: 48 GB (RTX A6000 / L40S, 4.22 GB free) and 80 GB. Not a 24 GB RTX 4090.
8B-Modell in INT4, kein Kontext nötig
Parameters 8B · INT4 · context 0
Weights 4 GB + KV cache 0 GB = Total 4 GB → fits an 8 GB card with 4 GB to spare.
Gut zu wissen
- Einheiten sind dezimale GB (10⁹ Bytes), passend dazu, wie “70B” und Kartengrößen zitiert werden.
- KV-Formel: 2 × layers × context × kvHeads × headDim × 2 Bytes (FP16 K+V) × batch. GQA-Modelle cachen nur die KV-Heads, deshalb ist 8 ≠ 32 wichtig - prüfe die Model Card.
- Die Summe ist eine Untergrenze: Aktivierungen, CUDA-Kontext und Overhead der Inferenz-Engine (typischerweise 0.5-2 GB) sind nicht enthalten - plane Puffer ein.
- Privat: die ganze Rechnung läuft lokal in deinem Browser; nichts wird an einen Server gesendet.
- Verwandte Tools: LLM Cost Calculator, Token Estimator, Model Picker.