Paste your prompt as labeled sections — system prompt, retrieved docs, conversation history. Each paste is token-estimated client-side, then laid against every selected model’s context window. Pick models above to see fill bars, free headroom, and overflow warnings.
功能说明
上下文窗口规划器展示一个真实提示词如何填充模型的上下文窗口。把你请求的各个部分作为带标签的分节粘贴进来——系统提示词、检索到的文档、对话历史——工具会对每一节做令牌估算,求和,并把总量对照每个所选模型的窗口渲染成填充条。
它回答的是让生产环境中的 LLM 请求失败的两个问题:这个提示词到底放不放得下? 以及 如果放得下,留给回答的空间还剩多少? 设定一个输出预留后,每个模型都会报告剩余空余是否覆盖它,因此一个技术上放得下、却让回答无路可走的提示词,会在你上线之前被标记出来。
使用方法
- 把你的系统提示词、文档和历史粘贴进堆叠的分节中。按你真实提示词的结构增删分节。
- 设置输出预留——你希望为模型回复保留的令牌数(输出被截断的一个常见原因就是预留为零)。
- 切换模型芯片(窗口最宽的排在前面),跨厂商、跨档次比较填充情况。
- 阅读填充条:输入放得下时为蓝色,放不下时为红色并显示溢出量;“预留不足”标记那些放得下但剩余空余少于你预留值的输入。
- 复制摘要或复制分享链接,发送完全相同的情景。
示例
一个两节提示词对照 1M 令牌窗口
下面每一节都是一行 1,600 字符的散文(按每令牌 4 字符约合 400 令牌):
System: 1,600 chars → 400 tokens
Docs: 1,600 chars → 400 tokens
beta-pro (1,000,000 ctx): 800 / 1,000,000 · free 999,200 · fits yes · reserve ok
同一个提示词放得下,却让预留挨饿
input 800 · output reserve 1,000,000
beta-pro: fits yes · reserve SHORT ← raw fit passes, no room for the answer
一次溢出,连同数量一起标记
单独一段 4.4M 字符的粘贴(约合 1.1M 令牌)对照 1M 窗口:
beta-pro: 1,100,000 / 1,000,000 · overflow −100,000 · fits NO
补充说明
- 放得进窗口不等于放得进回答。
fits表示原始输入在上下文窗口之内;预留检查表示仍有空间容纳回复。一个健康的请求必须两项都通过。 - **令牌数是启发式估算(±15%),**按行分类为散文、代码、JSON 或 CJK——不是真正的 BPE 分词器运行。只需要估算明细的话,请用 Token Estimator。
- 模型规格是一个快照。 窗口大小和输出上限来自一份带日期的模型快照——查看“Data as of”一行确认新鲜度。
- 私密: 一切 100% 在客户端运行——任何提示词文本都不会离开你的浏览器。
- 相关工具: Token Estimator、Model Picker、LLM Cost Calculator。