1024 × 1024 px · 细节 high · 4 个 512 px 图块 · 基础 85 + 细节 680 = 765 个 token
功能说明
图片 Token 计算器用于在把图片附到视觉模型请求之前,估算它会消耗多少 token。视觉 API 并不按文件大小为图片计费——它们会先缩小图片、切成 512 px 的瓦片,再按每个瓦片固定数量的 token 计费。本工具执行的正是这套流程:低细节(low detail)无论尺寸一律 85 token;高细节(high detail)先把图片缩进 2048 × 2048 的正方形,再把最短边限制到 768 px,然后按每个 512 px 瓦片 170 token 计费,外加 85 token 的基础费用。你会看到瓦片网格、缩放后的尺寸,以及基础 + 细节的明细,从而明白一张图片的费用为什么是这个数。所有计算 100% 在客户端完成:不会向任何地方上传数据。
使用方法
- 输入图片的像素宽度 (px) 和高度 (px),或点选一个示例(1024 × 1024、1920 × 1080、800 × 600、4096 × 4096)。
- 选择细节模式:Low(固定 85 token)、High(完整瓦片计算)或 Auto(模型自身的启发式——两边都 ≤ 512 px 时用低细节,否则用高细节)。
- 先读 tokens 总数,再看明细:使用的瓦片数(如 2 × 2)、基础 token、细节 token,以及按其计数瓦片的缩放后像素尺寸。
- 复制分享链接会把宽度、高度和细节模式编码进 URL(
?w=...&h=...&d=...),打开链接即可复现完全相同的计算。
示例
高细节下的正方形截图
输入:1024 × 1024, high → 765 tokens(缩放为 768 × 768,4 块瓦片:85 + 4 × 170)
全高清壁纸
输入:1920 × 1080, auto → 1105 tokens(最短边限制到 768 → 1365 × 768,3 × 2 = 6 块瓦片:85 + 6 × 170)
一张竖长的 4K 截图——经典的 1105 案例
输入:2048 × 4096, high → 1105 tokens(先缩进 2048 正方形 → 1024 × 2048,再最短边 1024 → 768 × 1536,6 块瓦片)
同一张图,低细节
输入:4096 × 8192, low → 85 tokens(低细节完全忽略尺寸)
补充说明
- 低细节永远是 85 token。 如果模型只需要图片的大意(这张照片里有狗吗?),
low会完全跳过瓦片计算——一张 4096 × 8192 的扫描图和一个 16 × 16 的图标费用相同。 - 大图会坍缩到同一笔账单。 经过两步缩小之后,任何 ≥ 768 px 的正方形图片都会变成 768 × 768 → 4 块瓦片 → 765 token。高细节下,1024 × 1024 和 4096 × 4096 的费用相同。
- Auto 是对模型选择的估算。 真实的
detail: "auto"决策在服务端做出;本工具采用业界通行的启发式(两边都 ≤ 512 px 时为 low)。计费以模型实际使用的细节级别为准。 - 模型覆盖范围: 85 基础 + 每瓦片 170 的公式适用于按瓦片计费的视觉模型(GPT-4o、GPT-4.1、GPT-4V、o 系列中除 o4-mini 之外的全部)。较新的按 patch 计费的模型(o4-mini、gpt-4.1-mini/nano 快照、gpt-5.x mini 系列)改为按 32 px patch 对图片分词——数字会有所不同。Claude 视觉模型使用另一种 (w×h)/750 估算。
- 可分享: 尺寸和细节模式都编码在 URL 中,链接可以复现完全相同的估算。
- 私密: 100% 客户端运行——不上传、不请求。
- 相关工具: Token Estimator、Context Window Planner、Secure Token Generator。