Paste your prompt as labeled sections — system prompt, retrieved docs, conversation history. Each paste is token-estimated client-side, then laid against every selected model’s context window. Pick models above to see fill bars, free headroom, and overflow warnings.
Ce que ça fait
Le Planificateur de fenêtre de contexte montre comment un vrai prompt remplit la fenêtre de contexte d’un modèle. Collez les morceaux de votre requête sous forme de sections étiquetées - prompt système, documents récupérés, historique de conversation - et l’outil estime les tokens de chacune, les additionne, et confronte le total à la fenêtre de chaque modèle sélectionné sous forme de barre de remplissage.
Il répond aux deux questions qui cassent les requêtes LLM en production : ce prompt tient-il ? et s’il tient, combien de place reste-t-il pour la réponse ? Définissez une réserve de sortie et chaque modèle indique si la marge libre la couvre, pour qu’un prompt qui tient techniquement mais affame la réponse soit signalé avant l’expédition.
Comment l’utiliser
- Collez vos prompts System, Docs et History dans les sections empilées. Ajoutez ou retirez des sections pour correspondre à la forme réelle de votre prompt.
- Définissez la Output reserve - les tokens que vous voulez garder libres pour la réponse du modèle (une cause fréquente de sortie tronquée est une réserve à zéro).
- Activez les puces de modèles (fenêtres les plus larges d’abord) pour comparer les remplissages entre fournisseurs et gammes.
- Lisez les barres de remplissage : bleues tant que l’entrée tient, rouges avec le montant de débordement sinon ; « reserve short » marque les entrées qui tiennent mais laissent moins de marge que votre réserve.
- Copy summary ou Copy share link pour envoyer le scénario exact.
Exemples
Un prompt à deux sections contre une fenêtre d’un million de tokens
Chaque section ci-dessous est une ligne de prose de 1 600 caractères (≈400 tokens à 4 caractères/token) :
System: 1,600 chars → 400 tokens
Docs: 1,600 chars → 400 tokens
beta-pro (1,000,000 ctx): 800 / 1,000,000 · free 999,200 · fits yes · reserve ok
Le même prompt qui tient, mais affame la réserve
input 800 · output reserve 1,000,000
beta-pro: fits yes · reserve SHORT ← raw fit passes, no room for the answer
Un débordement, signalé avec le montant
Un seul collage de 4,4 M de caractères (≈1,1 M de tokens) contre une fenêtre de 1 M :
beta-pro: 1,100,000 / 1,000,000 · overflow −100,000 · fits NO
Bon à savoir
- Tenir dans la fenêtre, ce n’est pas tenir pour la réponse.
fitssignifie que l’entrée brute est dans la fenêtre de contexte ; la vérification de réserve signifie qu’il reste de la place pour la réponse. Les deux doivent passer pour une requête saine. - Les comptages de tokens sont des estimations heuristiques (±15 %), classées ligne par ligne comme prose, code, JSON ou CJK - pas une exécution d’un vrai tokeniseur BPE. Pour le détail de l’estimation seul, voir le Token Estimator.
- Les spécifications des modèles sont un instantané. Les tailles de fenêtre et plafonds de sortie proviennent d’un seul instantané daté - consultez la ligne « Data as of » pour la fraîcheur.
- Privé : tout s’exécute 100 % côté client - aucun texte de prompt ne quitte jamais votre navigateur.
- Outils liés : Token Estimator, Model Picker, LLM Cost Calculator.