Passer du texte aux échappements

Les échappements percent-u servent notamment dans d'anciennes représentations textuelles de caractères chinois. Le décodeur accepte aussi les valeurs %XX et les références hexadécimales terminées par un point-virgule. Le traitement a lieu dans le navigateur, sans transmettre la saisie dans des requêtes de conversion.

  1. Encodez Aé你😀 pour obtenir Aé%u4F60%uD83D%uDE00. La lettre é reste telle quelle ; l'emoji est représenté par deux unités UTF-16.
  2. Décodez %u4F60 ou 你 pour retrouver 你. La saisie left; A donne left; A et garde sa ponctuation ainsi que son espace.
  3. Copiez la sortie en texte brut. Modifier la saisie supprime l'ancien résultat. Effacer vide l'entrée et la sortie ; une erreur de décodage retire également tout résultat précédent.

Interprétation des séquences

%XX ne désigne pas ici une suite d'octets UTF-8

%E4%F6%FC devient äöü : chaque paire est convertie séparément en U+00XX. Ainsi, la séquence d'URL UTF-8 %E4%BD%A0 ne devient pas 你 avec cet outil. Utilisez le décodeur d'URL pour ce cas.

L'encodage laisse les espaces, la ponctuation, le signe % et les autres caractères jusqu'à U+00FF inchangés. Il ne reproduit pas intégralement escape() et ne produit pas d'échappements JavaScript à barre oblique inversée.

Une seule passe et des références terminées

A donne A et 😀 donne 😀. Ces références terminées par un point-virgule sont converties directement en valeurs scalaires Unicode ; les valeurs de substituts et celles supérieures à U+10FFFF sont refusées. Ce traitement n'analyse pas un document HTML complet.

L'ancienne forme &#x4F60 sans point-virgule reste acceptée et donne 你 comme unité UTF-16. Elle exige un x minuscule et exactement quatre chiffres hexadécimaux, sans chiffre hexadécimal supplémentaire à la suite. Les autres références non terminées restent littérales.

%25u0041 produit le texte littéral %u0041. Les références décimales ou nommées, \u0041, %U0041 et les échappements percentuels incomplets ne changent pas. Les séquences %u et l'ancienne référence à quatre chiffres conservent les unités UTF-16, y compris les substituts isolés : l'outil ne valide pas l'ensemble du texte Unicode.

Questions sur la notation %u

L'aller-retour conserve-t-il toujours la saisie ?

Non. Une séquence littérale comme %41 reste inchangée à l'encodage, puis devient A au décodage. Le champ transforme aussi les fins de ligne CR et CRLF réelles en LF. Aucune normalisation Unicode n'est appliquée.

Pourquoi l'ancien nom évoquait-il UTF-8 vers GBK ?

Ce libellé ne correspondait pas au code. La fonction conservée transforme des échappements textuels, pas les octets de fichiers entre jeux de caractères. Les balises HTML présentes dans le résultat sont affichées comme du texte et ne sont pas exécutées.

Outils récents :