1024 × 1024 px · Detail high · 4 Kacheln à 512 px · 85 Basis + 680 Detail = 765 Tokens
Was es tut
Der Bild-Token-Rechner schätzt, wie viele Tokens ein Bild kostet, bevor du es an eine Anfrage an ein Vision-Modell hängst. Vision-APIs berechnen Bilder nicht nach Dateigröße - sie skalieren das Bild herunter, zerschneiden es in 512-px-Kacheln und berechnen eine feste Anzahl Tokens pro Kachel. Dieses Tool fährt exakt diese Pipeline: Niedriger Detailaufwand kostet pauschal 85 Tokens, egal welche Größe; hoher Detailaufwand passt das Bild zuerst in ein 2048 × 2048 Quadrat, begrenzt dann die kürzeste Seite auf 768 px und berechnet danach 170 Tokens pro 512-px-Kachel plus 85 Tokens Grundpreis. Du erhältst das Kachelraster, die skalierten Abmessungen und die Aufschlüsselung aus Grundpreis + Details - damit du siehst, warum ein Bild kostet, was es kostet. Alles läuft zu 100 % clientseitig: nichts wird irgendwo hochgeladen.
So verwendest du es
- Gib die Pixel-Breite (px) und Höhe (px) des Bildes ein - oder tippe auf einen Beispiel-Chip (1024 × 1024, 1920 × 1080, 800 × 600, 4096 × 4096).
- Wähle einen Detail-Modus: Niedrig (pauschal 85 Tokens), Hoch (volle Kachel-Mathematik) oder Auto (die Heuristik des Modells selbst - niedriger Detailaufwand, solange beide Seiten ≤ 512 px sind, sonst hoher).
- Lies die Token-Kopfzahl, dann die Aufschlüsselung: genutzte Kacheln (z. B. 2 × 2), Basis-Tokens, Detail-Tokens und die skalierten Pixelabmessungen, auf deren Basis die Kacheln gezählt wurden.
- Teilen-Link kopieren speichert Breite, Höhe und Detailmodus in der URL (
?w=...&h=...&d=...), sodass ein Link die exakte Berechnung reproduziert.
Beispiele
Ein quadratischer Screenshot mit hohem Detailaufwand
Eingabe: 1024 × 1024, high → 765 tokens (skaliert auf 768 × 768, 4 Kacheln: 85 + 4 × 170)
Ein Full-HD-Hintergrundbild
Eingabe: 1920 × 1080, auto → 1105 tokens (kürzeste Seite auf 768 begrenzt → 1365 × 768, 3 × 2 = 6 Kacheln: 85 + 6 × 170)
Ein hochkantes 4K-Screenshot - der klassische 1105-Fall
Eingabe: 2048 × 4096, high → 1105 tokens (ins 2048-Quadrat eingepasst → 1024 × 2048, dann kürzeste Seite 1024 → 768 × 1536, 6 Kacheln)
Dasselbe Bild, niedriger Detailaufwand
Eingabe: 4096 × 8192, low → 85 tokens (niedriger Detailaufwand ignoriert die Größe komplett)
Gut zu wissen
- Niedriger Detailaufwand kostet immer 85 Tokens. Wenn das Modell nur die Kernaussage eines Bildes braucht (ist auf diesem Foto ein Hund?), überspringt
lowdie Kachel-Mathematik komplett - ein 4096 × 8192 Scan und ein 16 × 16 Icon kosten dasselbe. - Große Bilder kollabieren auf dieselbe Rechnung. Nach den beiden Herunterskalierungsschritten wird jedes quadratische Bild ≥ 768 px zu 768 × 768 → 4 Kacheln → 765 Tokens. Ein 1024 × 1024 und ein 4096 × 4096 kosten im hohen Detailmodus dasselbe.
- Auto ist eine Schätzung der Modellwahl. Echte
detail: "auto"-Entscheidungen trifft der Server; dieses Tool nutzt die übliche Heuristik (niedrig, solange beide Seiten ≤ 512 px). Abgerechnet wird nach dem Detaillevel, das das Modell tatsächlich genutzt hat. - Modell-Abdeckung: die Formel aus 85 Basis-Tokens + 170 pro Kachel deckt kachelbasierte Vision-Modelle ab (GPT-4o, GPT-4.1, GPT-4V, o-Serie außer o4-mini). Neuere patch-basierte Modelle (o4-mini, gpt-4.1-mini/nano-Snapshots, gpt-5.x-Minis) tokenisieren Bilder stattdessen als 32-px-Patches - dort weichen die Zahlen ab. Claude-Vision-Modelle nutzen eine andere Schätzung: (w×h)/750.
- Per Link teilbar: Abmessungen und Detailmodus reisen in der URL - ein Link reproduziert die exakte Schätzung.
- Privat: läuft zu 100 % clientseitig - keine Uploads, keine Requests.
- Verwandte Tools: Token Estimator, Context Window Planner, Secure Token Generator.