Estimateur de tokens et de contexte LLM

Collez le prompt et définissez le budget de contexte. Les nombres sont estimés ; le tokenizer et le format du modèle peuvent produire d’autres totaux.

Fonctionne localement dans votre navigateur
Il s’agit d’une estimation locale transparente et non d’un tokenizer exact du fournisseur. Aucun contenu d'invite n'est transmis.
Texte d'invite ou de message

Planifier les entrées et les sorties ensemble

Les limites contextuelles incluent généralement les instructions système, l'historique des conversations, les messages des outils, le texte d'invite et la sortie générée. Conservez une marge de sécurité pour les différences de cadrage et de tokenizer spécifiques au fournisseur.

Comment estimer les tokens et le contexte restant

Collez l’invite ou le message que vous allez envoyer, choisissez la façon de compter le texte : le panneau affiche la taille estimée de l’entrée, le budget total que la requête occupera et la place restante dans la fenêtre de contexte.

L’estimation est recalculée dans la page à chaque frappe. Aucun texte ne quitte le navigateur ; le calculateur fonctionne aussi sans connexion.

  1. Collez ou tapez l’invite dans le champ source. Le panneau se met à jour au fil de la saisie ; le bouton Estimer l’utilisation relance simplement le calcul.
  2. Choisissez le profil adapté : Texte équilibré pour de la prose, Beaucoup de code quand l’invite est surtout du code, Multilingue lorsqu’elle mélange les alphabets ou est principalement en CJK.
  3. Indiquez la fenêtre de contexte du modèle visé, les tokens réservés pour la réponse et le surcoût par message.
  4. Total prévu correspond au budget qu’occupera la requête (entrée + réserve + surcoût) ; Restant indique ce qu’il reste.
  5. Surveillez la barre : elle passe à l’ambre au-delà de 85 % de la fenêtre et au rouge lorsque le plan ne tient plus. Le bouton Effacer vide l’invite et le résultat sans toucher aux valeurs du budget.

Ce que l’estimation couvre – et ce qu’elle ne couvre pas

Comment comptent les trois profils

Texte équilibré compte environ quatre lettres ou chiffres latins pour un token, avec de petits poids pour la ponctuation et les espaces. Beaucoup de code compte les lettres plus serré (environ 3,35 par token) et accorde plus de poids à la ponctuation. Multilingue part de la longueur en octets UTF-8 (environ 3,15 octets par token) et compte les caractères CJK presque un pour un. Les emoji comptent pour environ deux tokens dans tous les profils.

Un exemple suffit : « Hello world » estime 3 tokens en Texte équilibré et 4 en Beaucoup de code ou Multilingue, tandis que « 你好,世界 » estime 5 tokens pour seulement 15 octets. Le profil compte donc plus que le nombre de caractères.

Le plan face à la fenêtre de contexte

Total prévu = entrée estimée + sortie réservée + surcoût des messages. Avec les valeurs par défaut — fenêtre de 128 000, réserve de 4 096 et surcoût de 12 — « Hello world » affiche 3 tokens d’entrée et 4 111 prévus, laissant 123 889 libres : la barre reste à 3,2 % de la fenêtre.

La barre passe à l’ambre lorsque le plan dépasse 85 % de la fenêtre, signe qu’une réponse longue risque de ne pas tenir, et au rouge avec la mention Dépassement quand les tokens prévus dépassent la fenêtre elle-même.

Pourquoi un vrai tokenizer peut diverger

Ces nombres proviennent d’une heuristique sur les caractères, l’écriture et les octets, pas du vocabulaire réel du modèle. Chaque tokenizer découpe le texte différemment et chaque version a son propre vocabulaire : considérez le résultat comme une estimation de planification et comparez une vraie requête au compteur du fournisseur lorsque le budget est serré.

Gardez une marge pour les instructions système, l’historique de conversation et les messages d’outils qui accompagnent l’invite, et réservez assez de tokens de sortie pour la réponse attendue.

Outils récents :