Compteur de caractères pondéré

Ce compteur conserve sa règle d'origine : chaque unité UTF-16 de U+0000 à U+00FF vaut 1, et toute autre unité vaut 2. Les six statistiques suivent la saisie. Le total pondéré ne mesure ni les mots ni la taille d'un fichier.

Fonctionne localement dans votre navigateur

Vérifier la pondération

Saisissez ou collez du texte pour actualiser les six valeurs automatiquement. Le calcul se fait dans le navigateur, sans transmettre le texte dans des requêtes de comptage. Effacer vide le champ et remet toutes les statistiques à zéro.

  1. Saisissez A你😀1. Le total est 8 : A et 1 valent chacun 1, 你 vaut 2 et les deux unités UTF-16 de 😀 valent ensemble 4.
  2. Les lignes affichent 1, 2, 3, 2, 1 et 8, dans cet ordre. Toutes les unités au-delà de U+00FF comprend déjà la plage Han et les autres unités.
  3. Modifiez la saisie pour recalculer, ou utilisez Effacer. Les six valeurs, y compris le total, reviennent alors à 0.

Plages prises en compte

Des lignes qui se recouvrent

La ligne Han compte les occurrences de U+4E00 à U+9FA5, répétitions comprises. Elle ne couvre pas tous les caractères Han d'Unicode. Les autres unités au-delà de U+00FF excluent cette plage ; la ligne Toutes les unités réunit les deux groupes.

La plage U+0000-U+00FF comprend notamment les lettres Latin-1, les signes ASCII, les espaces et les caractères de contrôle de cet intervalle. Chiffres ASCII ne compte que 0-9, déjà inclus dans cette plage. Le total est unités U+0000-U+00FF + 2 × unités au-delà de U+00FF. Additionner toutes les lignes ferait des doubles comptes.

La longueur visible peut être différente

😀 occupe deux unités UTF-16 et vaut 4. La séquence familiale 👨‍👩‍👧‍👦 occupe 11 unités et vaut 22. Le compteur ne segmente pas le texte en mots ni en caractères visibles.

Aucune normalisation Unicode n'est appliquée : é vaut 1, alors que e suivi de U+0301 vaut 3. Par exemple, U+9FA6 est classé dans les autres unités au-delà de U+00FF. Le calcul reste compatible avec l'ancien compteur.

Questions sur le total pondéré

Les espaces et retours à la ligne sont-ils comptés ?

Oui. Un espace, une tabulation ou LF vaut 1. Le champ transforme les fins de ligne CR et CRLF réelles en LF : un retour Windows collé vaut donc 1. Le noyau appelé directement compte un CRLF brut comme deux unités.

Le total convient-il à une limite de mots ou d'octets UTF-8 ?

Non. hello world donne 11, et non 2 mots. é vaut 1 ici mais utilise deux octets en UTF-8. Seule la règle de pondération affichée est mesurée.

Le HTML est-il interprété et les Han répétés sont-ils dédupliqués ?

Le texte est compté littéralement : <b>A</b> vaut 8 et &amp; vaut 5. Les balises ne sont pas rendues et les références ne sont pas décodées. Chaque occurrence compte ; 你你 donne un total Han de 2.

Outils récents :