1024 × 1024 px · detalle high · 4 tiles de 512 px · 85 de base + 680 de detalle = 765 tokens
Qué hace
La Calculadora de tokens de imagen estima cuántos tokens costará una imagen antes de que la adjuntes a una petición a un modelo de visión. Las APIs de visión no cobran las imágenes por tamaño de archivo — las reducen de escala, las cortan en tiles de 512 px y facturan un número fijo de tokens por tile. Esta herramienta ejecuta ese pipeline exacto: el detalle bajo son 85 tokens planos sea cual sea el tamaño; el detalle alto primero encaja la imagen dentro de un cuadrado de 2048 × 2048, luego limita el lado más corto a 768 px, y luego cobra 170 tokens por tile de 512 px más una base de 85 tokens. Obtienes la cuadrícula de tiles, las dimensiones escaladas y el desglose base + detalle, para que veas por qué una imagen cuesta lo que cuesta. Todo se ejecuta 100% en el cliente: nada se sube a ningún sitio.
Cómo usarlo
- Introduce la anchura (px) y la altura (px) en píxeles de la imagen, o toca un chip de ejemplo (1024 × 1024, 1920 × 1080, 800 × 600, 4096 × 4096).
- Elige un modo de Detail: Low (85 tokens planos), High (el cálculo completo de tiles) o Auto (la heurística del propio modelo — detalle bajo mientras ambos lados sean ≤ 512 px, si no detalle alto).
- Lee el titular de tokens y luego el desglose: tiles usados (p. ej. 2 × 2), tokens base, tokens de detalle, y las dimensiones en píxeles escaladas sobre las que se contaron los tiles.
- Copy share link codifica la anchura, la altura y el modo de detalle en la URL (
?w=...&h=...&d=...), así un enlace reproduce el cálculo exacto.
Ejemplos
Una captura cuadrada en detalle alto
Entrada: 1024 × 1024, high → 765 tokens (escalada a 768 × 768, 4 tiles: 85 + 4 × 170)
Un fondo de pantalla full-HD
Entrada: 1920 × 1080, auto → 1105 tokens (lado más corto limitado a 768 → 1365 × 768, 3 × 2 = 6 tiles: 85 + 6 × 170)
Una captura 4K vertical — el caso clásico de 1105
Entrada: 2048 × 4096, high → 1105 tokens (encaja en el cuadrado de 2048 → 1024 × 2048, luego lado más corto 1024 → 768 × 1536, 6 tiles)
La misma imagen, detalle bajo
Entrada: 4096 × 8192, low → 85 tokens (el detalle bajo ignora el tamaño por completo)
Buen saber
- El detalle bajo son siempre 85 tokens. Si al modelo solo le hace falta la esencia de una imagen (¿hay un perro en esta foto?),
lowse salta el cálculo de tiles por completo — un escaneo de 4096 × 8192 y un icono de 16 × 16 cuestan lo mismo. - Las imágenes grandes colapsan a la misma factura. Tras los dos pasos de reducción, cualquier imagen cuadrada ≥ 768 px se convierte en 768 × 768 → 4 tiles → 765 tokens. Una de 1024 × 1024 y una de 4096 × 4096 cuestan lo mismo en detalle alto.
- Auto es una estimación de la elección del modelo. Las decisiones reales de
detail: "auto"se toman en el servidor; esta herramienta usa la heurística convencional (low cuando ambos lados ≤ 512 px). La facturación sigue el nivel de detalle que el modelo usó realmente. - Cobertura de modelos: la fórmula de base 85 + 170 por tile cubre los modelos de visión basados en tiles (GPT-4o, GPT-4.1, GPT-4V, la serie o salvo o4-mini). Los modelos más nuevos basados en parches (o4-mini, las snapshots gpt-4.1-mini/nano, los gpt-5.x minis) tokenizan las imágenes como parches de 32 px — ahí los números diferirán. Los modelos de visión de Claude usan una estimación diferente de (w×h)/750.
- Compartible: las dimensiones y el modo de detalle viajan en la URL, así un enlace reproduce la estimación exacta.
- Privado: se ejecuta 100% en el cliente — sin subidas, sin peticiones.
- Herramientas relacionadas: Token Estimator, Context Window Planner, Secure Token Generator.