节省 $0.33 (43.33%) $0.75 未缓存 → $0.43 已缓存 · 5 次请求 盈亏平衡: 13 缓存命中——读取须偿还一次写入溢价
uncached = hits × (prompt×in$/M + output×out$/M) / 1M
= 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
cached = (prompt×write$/M + hits × (prompt×read$/M + output×out$/M)) / 1M
= (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.43
break-even hits = ceil(write$/M / read$/M) = ceil($12.5 / $1) = 13数据截至 2026-09-27T12:03:11.094Z
功能说明
缓存节省计算器展示:在一个重复的工作负载上,提示词缓存(prompt caching)究竟能省多少钱。输入你的提示词和输出 token 数量,以及有多少次请求复用缓存的提示词,选择一个模型,它就会把无缓存的账单与有缓存的账单做对比 - 包括缓存反而更贵这个诚实的情形。
它捕捉到的关键细节是写入溢价(write premium):第一个请求支付额外的费用来存储提示词,之后的每次命中都按便宜得多的缓存读取费率计费,而不是完整的输入价格。盈亏平衡数字告诉你需要多少次命中,才能让便宜的读摊平那一次写。
使用方法
- 用步进器设置每请求提示词 token 数、每请求输出 token 数和缓存命中次数。
- 选择模型 - 带缓存定价的模型排在前面;没有公布缓存费率的模型标注“no cache rates”(无缓存费率),并显示解释性的空状态。
- 阅读头条数字:缓存省钱时为绿色,反而更贵时为红色(命中次数太少,摊不平写入成本)。
- 查看 The math(计算过程)区块 - 两条公式都用该模型的实时费率代入你的数字渲染。
- 复制节省金额或复制分享链接,把精确场景发给别人。
示例
一个重复 10k token 的提示词(5 次命中)
输入:10,000 提示词 token、1,000 输出 token、5 次缓存命中,费率为 $10/M 输入、$50/M 输出、$1/M 缓存读、$12.5/M 缓存写:
uncached = 5 × (10,000×$10 + 1,000×$50) / 1M = $0.75
cached = (10,000×$12.5 + 5 × (10,000×$1 + 1,000×$50)) / 1M = $0.425
savings = $0.325 (43.33%) · break-even = ceil(12.5 / 1) = 13 hits
单次请求 - 缓存吃亏
同样的参数,1 次缓存命中:
uncached = $0.15 · cached = $0.185 · savings = −$0.035
一次命中永远摊不平写入溢价;工具用错误色调显示负数结果,而不是把它藏起来。
补充说明
- 盈亏平衡数的是读取次数,不是请求数。
ceil(write$/M ÷ read$/M)是需要多少次缓存命中,累计读取花费才等于一次写入溢价 - 低于它,缓存就更贵。 - 费率是快照。 每个数字都来自一份带日期的模型快照 - 查看 “Data as of” 行确认新鲜度;没有公布缓存费率的模型不返回结果,而不是给出残缺的计算。
- 私密: 一切 100% 客户端运行 - token 数量和费率都不会离开你的浏览器。
- 相关工具: LLM 成本计算器、Token 估算器、嵌入分块规划器。