Paste your prompt as labeled sections — system prompt, retrieved docs, conversation history. Each paste is token-estimated client-side, then laid against every selected model’s context window. Pick models above to see fill bars, free headroom, and overflow warnings.
O que faz
O Planejador de Janela de Contexto mostra como um prompt real preenche a janela de contexto de um modelo. Cole as partes da sua requisição como seções rotuladas — prompt de sistema, documentos recuperados, histórico da conversa — e a ferramenta estima os tokens de cada uma, soma tudo e posiciona o total contra a janela de cada modelo selecionado como uma barra de preenchimento.
Ele responde às duas perguntas que quebram requisições LLM em produção: este prompt sequer cabe? e se cabe, quanto espaço sobra para a resposta? Defina uma reserva de saída e cada modelo informa se a folga livre a cobre, então um prompt que tecnicamente cabe mas priva a resposta é sinalizado antes de você publicá-lo.
Como usar
- Cole seus prompts de Sistema, Docs e Histórico nas seções empilhadas. Adicione ou remova seções para refletir o formato real do seu prompt.
- Defina a Reserva de saída — os tokens que você quer manter livres para a resposta do modelo (uma causa comum de saída truncada é uma reserva zero).
- Alterne os chips de modelos (janelas mais largas primeiro) para comparar preenchimentos entre fornecedores e níveis.
- Leia as barras de preenchimento: azuis enquanto a entrada cabe, vermelhas com o valor de excedente quando não cabe; “reserva insuficiente” marca entradas que cabem mas deixam menos folga que a sua reserva.
- Use Copiar resumo ou Copiar link de compartilhamento para enviar o cenário exato.
Exemplos
Um prompt de duas seções contra uma janela de 1M de tokens
Cada seção abaixo é uma linha de prosa de 1.600 caracteres (≈400 tokens a 4 chars/token):
System: 1,600 chars → 400 tokens
Docs: 1,600 chars → 400 tokens
beta-pro (1,000,000 ctx): 800 / 1,000,000 · free 999,200 · fits yes · reserve ok
O mesmo prompt que cabe, mas priva a reserva
input 800 · output reserve 1,000,000
beta-pro: fits yes · reserve SHORT ← raw fit passes, no room for the answer
Um excedente, sinalizado com o valor
Uma única colagem de 4,4M de caracteres (≈1,1M de tokens) contra uma janela de 1M:
beta-pro: 1,100,000 / 1,000,000 · overflow −100,000 · fits NO
Bom saber
- Caber na janela não é o mesmo que caber a resposta.
fitssignifica que a entrada bruta está dentro da janela de contexto; a checagem de reserva significa que ainda há espaço para a resposta. Ambas precisam passar para uma requisição saudável. - As contagens de tokens são estimativas heurísticas (±15%), classificadas por linha como prosa, código, JSON ou CJK — não é uma execução real de tokenizador BPE. Só para o detalhamento da estimativa, veja o Token Estimator.
- As especificações de modelos são um retrato datado. Tamanhos de janela e limites de saída fluem de um único snapshot de modelos datado — confira a linha “Data as of” para verificar a atualidade.
- Privado: tudo roda 100% no lado do cliente — nenhum texto de prompt sai do seu navegador.
- Ferramentas relacionadas: Token Estimator, Model Picker, LLM Cost Calculator.