Collez du texte à estimer Explain how HTTP caching works to a junior developer. Cover ETags, Cache-Control, and the Vary header in under 200 words.
Ce que ça fait
L’estimateur de tokens vous donne un comptage rapide et approximatif des tokens pour n’importe quel texte, code ou JSON avant de l’envoyer à un LLM. Au lieu d’exécuter un vrai tokenizer, il classe chaque ligne comme prose, code, JSON ou texte CJK et divise par le taux typique de caractères par token de ce type de contenu (4 / 3.5 / 3 / 1.5), puis rapporte une estimation ponctuelle avec une bande de ±15 % - parce que les vrais tokenizers BPE varient selon le vocabulaire et le mélange de langues. Il peut aussi ajouter le surcoût d’encadrement de chat (~5 tokens par message) pour les marqueurs de rôle et les délimiteurs. Tout s’exécute à 100 % côté client : rien de ce que vous collez n’est jamais envoyé à un serveur, donc c’est sûr pour les prompts sensibles.
Comment l’utiliser
- Collez votre texte ou code dans la zone Texte ou code (ou cliquez Exemple pour charger un prompt de démonstration).
- Laissez Type de contenu sur Auto pour détecter chaque ligne, ou forcez Prose / Code / JSON / CJK pour appliquer un seul taux à toute l’entrée.
- Réglez Messages de chat au nombre de messages de votre conversation - chacun ajoute 5 tokens d’encadrement au total.
- Lisez le titre Tokens estimés, la plage basse-haute, les caractères / mots / lignes, et le type de contenu résolu.
- Copier les tokens pour récupérer le nombre, ou Copier le lien de partage pour envoyer l’entrée et les réglages exacts à un collègue.
Exemples
Prose simple
Entrée : Hello world → 3 tokens (≈ 3–3, type: prose)
Code
Entrée : const x = 1; → 3 tokens (type: code)
Le JSON obtient automatiquement le taux dense
Entrée : {"a": 1, "b": 2} → 5 tokens (type: json — tout le document se parse comme JSON, donc chaque ligne utilise le taux de 3 caractères/token)
Un bloc plus long avec une bande visible
Entrée : 100 × a → 25 tokens (≈ 21–29)
Bon à savoir
- Ce sont des estimations, pas des comptes exacts : chaque résultat porte une bande de ±15 % et aucun tokenizer ne s’exécute réellement. Traitez le nombre comme une aide au budget, pas comme une facture - les fournisseurs de modèles comptent les tokens avec des vocabulaires spécifiques à chaque modèle.
- Le mode Auto détecte les documents JSON dans leur ensemble : si votre entrée se parse comme un JSON valide, chaque ligne utilise le taux JSON. Forcez un type de contenu pour l’outrepasser.
- Le texte CJK est coûteux : le chinois, le japonais et le coréen tassent environ un token pour 1,5 caractère - la même « page » de texte peut coûter 2 à 3× plus de tokens que l’anglais.
- Partageable : votre entrée et vos options sont encodées dans l’URL (
?t=...&type=...&msg=...), donc un lien reproduit l’estimation exacte. - Privé : toute l’estimation se fait localement - sûr pour les secrets et les identifiants.
- Outils liés : Word Counter, Secure Token Generator, JSON Formatter.