Découpage de texte pour RAG

Collez un document et voyez où commence et finit chaque segment, la part de texte chevauchée et le coût approximatif en jetons. Le calcul se fait dans le navigateur ; rien n’est envoyé ni transformé en embedding.

Fonctionne localement dans votre navigateur
Les estimations de découpage et de jetons s'exécutent localement. Aucun contenu de document n'est téléversé, vectorisé ni envoyé à un modèle.
Document source

Ajustez les limites des segments avant de créer des embeddings

La taille et le chevauchement des segments affectent le rappel, la duplication du contexte et le coût. Cet aperçu utilise des heuristiques transparentes ; évaluez les segments obtenus avec des questions représentatives avant utilisation en production.

Comment utiliser le « Découpage de texte pour RAG »

L’outil découpe un document en unités de récupération déterministes : fenêtres de caractères, mots séparés par des espaces, phrases ou sections de titres Markdown, avec un chevauchement optionnel entre segments successifs.

Tout s’exécute dans la page. Les limites, les estimations de caractères et de jetons et l’export JSONL proviennent du texte collé ; l’outil n’appelle aucun modèle d’embedding ni service distant.

  1. Collez le document dans le panneau source et choisissez une stratégie : caractères, mots, phrases ou sections Markdown.
  2. Réglez la taille des segments dans les unités de cette stratégie et le chevauchement dans les mêmes unités ; le chevauchement doit rester inférieur à la taille.
  3. Cliquez sur Diviser le document. Le pipeline liste les segments dans l’ordre et la fiche de détails indique la plage de caractères et les jetons estimés du segment sélectionné.
  4. Cliquez sur Copier JSONL pour exporter un objet JSON par segment avec son id, son texte, sa plage et ses jetons estimés.

Contexte et précision

Ce que découpe chaque stratégie

Les caractères sont des grappes de graphèmes Unicode : les drapeaux emoji, les familles avec ZWJ et les accents combinés ne sont jamais coupés en deux. Les mots sont des unités séparées par des espaces ; chaque caractère CJK compte pour un mot, le chinois et le japonais sont donc découpés dans les paragraphes sans espaces.

Les phrases se terminent par . ! ? ou leurs équivalents pleine chasse, et les lignes sans ponctuation de phrase restent des unités à part entière au lieu d’être perdues. Les sections Markdown commencent aux titres ATX (# à ######) ; les titres situés dans des blocs de code sont ignorés, un commentaire shell dans un bloc ``` ne devient donc pas une limite de section.

Limites, chevauchement et estimations

Chaque segment est rogné jusqu’à son premier et son dernier caractère non blanc, et la plage affichée correspond exactement au texte. Avec un chevauchement N, chaque segment suivant reprend les N dernières unités du précédent, ce qui protège les faits proches d’une limite.

L’estimation de jetons est une heuristique, pas un tokenizer : un caractère CJK compte environ 1,05 jeton et les autres écritures environ un jeton pour quatre caractères. Utilisez-la pour comparer les stratégies, puis mesurez les jetons réels avec le tokenizer du modèle visé.

Utiliser l’export JSONL

Copier JSONL écrit un objet par segment — id, text, start, end et estimated_tokens — dans l’ordre de lecture. Les plages se rapportent au texte d’origine, les segments chevauchants peuvent donc être rattachés au document.

L’export est prêt pour un pipeline d’embeddings, mais cette page ne crée pas d’embeddings et n’envoie aucun texte. Conservez le JSONL en local ou transmettez-le uniquement au service prévu.

Outils récents :