1024 × 1024 px · detalhe high · 4 tiles de 512 px · 85 de base + 680 de detalhe = 765 tokens
O que faz
A Calculadora de Tokens de Imagem estima quantos tokens uma imagem vai custar antes de você anexá-la a uma requisição para um modelo de visão. APIs de visão não cobram imagens por tamanho de arquivo — elas reduzem a escala da imagem, cortam em blocos de 512 px e cobram um número fixo de tokens por bloco. Esta ferramenta executa exatamente esse pipeline: low detail é um valor fixo de 85 tokens, seja qual for o tamanho; high detail primeiro encaixa a imagem dentro de um quadrado de 2048 × 2048, depois limita o lado mais curto a 768 px, então cobra 170 tokens por bloco de 512 px mais uma base de 85 tokens. Você recebe a grade de blocos, as dimensões escaladas e o detalhamento de base + detalhe, para entender por que uma imagem custa o que custa. Tudo roda 100% no cliente: nada é enviado a lugar algum.
Como usar
- Informe a Largura (px) e a Altura (px) da imagem em pixels, ou toque em um chip de exemplo (1024 × 1024, 1920 × 1080, 800 × 600, 4096 × 4096).
- Escolha um modo de Detail: Low (fixo em 85 tokens), High (cálculo completo de blocos) ou Auto (a heurística do próprio modelo — low detail enquanto ambos os lados forem ≤ 512 px, caso contrário high detail).
- Leia o número principal de tokens, depois o detalhamento: blocos usados (ex. 2 × 2), tokens base, tokens de detalhe e as dimensões em pixels, já escaladas, sobre as quais os blocos foram contados.
- Copiar link de compartilhamento codifica a largura, a altura e o modo de detalhe na URL (
?w=...&h=...&d=...), então um link reproduz o cálculo exato.
Exemplos
Um screenshot quadrado em high detail
Entrada: 1024 × 1024, high → 765 tokens (escalado para 768 × 768, 4 blocos: 85 + 4 × 170)
Um papel de parede full-HD
Entrada: 1920 × 1080, auto → 1105 tokens (lado mais curto limitado a 768 → 1365 × 768, 3 × 2 = 6 blocos: 85 + 6 × 170)
Um screenshot 4K em retrato — o caso clássico de 1105
Entrada: 2048 × 4096, high → 1105 tokens (encaixado no quadrado de 2048 → 1024 × 2048, depois lado mais curto 1024 → 768 × 1536, 6 blocos)
A mesma imagem, low detail
Entrada: 4096 × 8192, low → 85 tokens (low detail ignora o tamanho completamente)
Bom saber
- Low detail é sempre 85 tokens. Se o modelo só precisa da essência de uma imagem (tem um cachorro nessa foto?),
lowpula o cálculo de blocos completamente — um exame de 4096 × 8192 e um ícone de 16 × 16 custam o mesmo. - Imagens grandes colapsam para a mesma conta. Após as duas etapas de redução de escala, qualquer imagem quadrada ≥ 768 px vira 768 × 768 → 4 blocos → 765 tokens. Uma 1024 × 1024 e uma 4096 × 4096 custam o mesmo em high detail.
- Auto é uma estimativa da escolha do modelo. Decisões reais de
detail: "auto"são tomadas no servidor; esta ferramenta usa a heurística convencional (low quando ambos os lados ≤ 512 px). A cobrança segue o nível de detalhe que o modelo realmente usou. - Cobertura de modelos: a fórmula de base 85 + 170 por bloco cobre modelos de visão baseados em blocos (GPT-4o, GPT-4.1, GPT-4V, série o, exceto o4-mini). Modelos mais novos baseados em patches (o4-mini, snapshots gpt-4.1-mini/nano, minis do gpt-5.x) tokenizam imagens como patches de 32 px — os números vão diferir nesses. Modelos de visão da Claude usam uma estimativa diferente, (w×h)/750.
- Compartilhável: as dimensões e o modo de detalhe viajam na URL, então um link reproduz a estimativa exata.
- Privado: roda 100% no cliente — sem uploads, sem requisições.
- Ferramentas relacionadas: Token Estimator, Context Window Planner, Secure Token Generator.