1024 × 1024 px · détail high · 4 tuiles de 512 px · 85 de base + 680 de détail = 765 tokens
Ce que ça fait
Le Calculateur de tokens d’image estime combien de tokens coûtera une image avant que vous ne la joigniez à une requête vers un modèle de vision. Les API de vision ne facturent pas les images selon la taille du fichier — elles réduisent l’image, la découpent en tuiles de 512 px et facturent un nombre fixe de tokens par tuile. Cet outil exécute exactement ce pipeline : le niveau de détail bas coûte un forfait de 85 tokens quelle que soit la taille ; le niveau de détail haut fait d’abord tenir l’image dans un carré de 2048 × 2048, puis plafonne le côté le plus court à 768 px, puis facture 170 tokens par tuile de 512 px plus une base de 85 tokens. Vous obtenez la grille de tuiles, les dimensions mises à l’échelle et la décomposition base + détail, pour voir pourquoi une image coûte ce qu’elle coûte. Tout s’exécute à 100 % côté client : rien n’est téléversé nulle part.
Comment l’utiliser
- Saisissez la Largeur (px) et la Hauteur (px) de l’image en pixels, ou touchez une puce d’exemple (1024 × 1024, 1920 × 1080, 800 × 600, 4096 × 4096).
- Choisissez un mode de Détail : Bas (forfait 85 tokens), Haut (calcul complet des tuiles), ou Auto (l’heuristique propre au modèle — détail bas tant que les deux côtés sont ≤ 512 px, sinon détail haut).
- Lisez le chiffre des tokens, puis la décomposition : tuiles utilisées (ex. 2 × 2), tokens de base, tokens de détail, et les dimensions en pixels mises à l’échelle sur lesquelles les tuiles ont été comptées.
- Copier le lien de partage encode la largeur, la hauteur et le mode de détail dans l’URL (
?w=...&h=...&d=...), pour qu’un lien reproduise le calcul exact.
Exemples
Une capture d’écran carrée en détail haut
Entrée : 1024 × 1024, high → 765 tokens (mis à l’échelle en 768 × 768, 4 tuiles : 85 + 4 × 170)
Un fond d’écran Full HD
Entrée : 1920 × 1080, auto → 1105 tokens (côté le plus court plafonné à 768 → 1365 × 768, 3 × 2 = 6 tuiles : 85 + 6 × 170)
Une capture d’écran 4K verticale — le cas classique des 1105 tokens
Entrée : 2048 × 4096, high → 1105 tokens (tenu dans le carré de 2048 → 1024 × 2048, puis côté le plus court 1024 → 768 × 1536, 6 tuiles)
La même image, détail bas
Entrée : 4096 × 8192, low → 85 tokens (le détail bas ignore totalement la taille)
Bon à savoir
- Le détail bas coûte toujours 85 tokens. Si le modèle n’a besoin que de l’essentiel d’une image (y a-t-il un chien sur cette photo ?),
lowsaute complètement le calcul des tuiles — un scan de 4096 × 8192 et une icône de 16 × 16 coûtent pareil. - Les grandes images retombent sur la même facture. Après les deux étapes de réduction, toute image carrée ≥ 768 px devient 768 × 768 → 4 tuiles → 765 tokens. Une 1024 × 1024 et une 4096 × 4096 coûtent pareil en détail haut.
- Auto est une estimation du choix du modèle. Les vraies décisions
detail: "auto"sont prises côté serveur ; cet outil utilise l’heuristique conventionnelle (bas quand les deux côtés ≤ 512 px). La facturation suit le niveau de détail réellement utilisé par le modèle. - Couverture des modèles : la formule base 85 + 170 par tuile couvre les modèles de vision à base de tuiles (GPT-4o, GPT-4.1, GPT-4V, série o sauf o4-mini). Les modèles plus récents à base de patchs (o4-mini, snapshots gpt-4.1-mini/nano, minis gpt-5.x) tokenisent les images en patchs de 32 px à la place — les chiffres y différeront. Les modèles de vision Claude utilisent une estimation différente, (l×h)/750.
- Partageable : les dimensions et le mode de détail voyagent dans l’URL, pour qu’un lien reproduise l’estimation exacte.
- Privé : s’exécute à 100 % côté client — aucun téléversement, aucune requête.
- Outils liés : Token Estimator, Context Window Planner, Secure Token Generator.