Générateur de robots.txt et sitemap

Indiquez l’agent, les chemins autorisés ou bloqués et les URL de sitemaps. Ajoutez les URL des pages pour générer le plan XML.

Fonctionne localement dans votre navigateur
Tout dans cet outil est traité dans ce navigateur. KivTools ne télécharge pas, ne stocke pas et n’appelle aucune API tierce avec votre entrée.
EntréeUtilisez un chemin ou URL par ligne. Ce générateur valide la syntaxe localement ; il ne récupère pas de site.

Comment générer robots.txt et sitemap.xml

Remplissez les cinq champs et cliquez sur Construire des fichiers : robots.txt est écrit à partir des lignes agent, Disallow, Allow et Sitemap, et sitemap.xml à partir de la liste d’URL. Les deux sont produits dans ce navigateur ; aucun site n’est consulté et rien n’est envoyé.

Seules les adresses absolues http et https entrent dans le sitemap. Tout le reste est écarté du fichier et listé sous les champs, pour qu’aucune entrée mal formée n’atteigne votre site.

  1. Saisissez le nom du robot dans Agent utilisateur, ou gardez la valeur par défaut * pour tous les robots. Plusieurs noms peuvent être séparés par des virgules ou placés sur des lignes distinctes ; chacun devient sa propre ligne User-agent.
  2. Listez les chemins bloqués dans Interdire les chemins et les exceptions dans Autoriser les chemins, un par ligne. Un chemin sans barre oblique initiale, ou une URL complète, est réécrit en chemin et signalé.
  3. Ajoutez l’adresse de chaque sitemap publié dans URL du plan du site et collez les adresses de pages pour sitemap.xml dans le dernier champ, une par ligne.
  4. Cliquez sur Construire des fichiers. Les deux panneaux se remplissent en même temps, avec le décompte des lignes modifiées, ignorées ou répétées.
  5. Copiez ou téléchargez chaque fichier, puis publiez-le à la racine du site : /robots.txt et /sitemap.xml.

Ce que font les fichiers, ce que le générateur modifie et ses limites

Ce que font les deux fichiers

robots.txt indique aux robots quels chemins ils peuvent demander. C’est une demande, pas une barrière de sécurité : un robot qui l’ignore accède toujours à la page, donc ce qui doit rester privé passe par une authentification. Une règle appartient au groupe d’agent situé au-dessus, c’est pourquoi le fichier généré commence par User-agent puis énumère les chemins.

sitemap.xml énumère les adresses que vous voulez voir indexées. Il aide la découverte plus que le classement, et une URL bloquée dans robots.txt ne sera pas indexée même si elle figure aussi dans le sitemap.

Ce que le générateur modifie dans votre saisie

Les chemins sont corrigés pour que le fichier reste valide : une barre oblique initiale manquante est ajoutée, une URL complète collée devient son chemin et sa requête, et une ligne qui ne peut toujours pas être un chemin est écartée du fichier et nommée dans l’état. Les lignes commençant par # sont conservées comme commentaires, ce que robots.txt autorise. Les lignes d’URL et de Sitemap répétées ne sont écrites qu’une fois et signalées comme doublons. Les jokers (*) et l’ancre de fin ($) passent inchangés.

Ce que cette page ne fait pas

Il n’y a pas de Crawl-delay, pas de groupe distinct par robot, ni lastmod, changefreq ou priority dans le sitemap. Un seul fichier de sitemap contient au maximum 50 000 URL, et la page le signale au lieu d’en écrire davantage. Rien n’est récupéré : une adresse qui n’existe plus est écrite telle quelle, la page ne peut pas savoir si une URL répond 200, redirige ou renvoie 404.

Outils récents :