Comment fonctionne la vérification des liens

Collez l’adresse d’une page : le serveur de KivTools la récupère, lit les liens qu’elle déclare, puis appelle chaque lien une fois pour enregistrer la réponse. Chaque lien occupe une ligne avec le titre déclaré par la cible et le code HTTP renvoyé, 20 lignes par page. Rien d’autre que la page indiquée n’est exploré.

La vérification s’exécute sur le serveur : la page inspectée voit donc l’adresse de KivTools, pas la vôtre. Les adresses privées, locales et de métadonnées sont refusées avant toute connexion, et le HTML récupéré sert uniquement à repérer des liens : il n’est jamais exécuté.

  1. Collez l’adresse de la page, https:// compris, dans le champ en haut de la page.
  2. Appuyez sur « Vérifier les liens ». Le serveur récupère la page et liste ce qu’il a trouvé, la page elle-même en premier.
  3. Attendez pendant que les lignes se remplissent : chaque lien a sa propre requête, jusqu’à 8 secondes, une page riche en liens prend donc un moment.
  4. Utilisez les numéros de page sous le tableau pour la suite de la liste, puis appuyez de nouveau sur le bouton après avoir corrigé un lien.

Ce que dit le résultat, et ce qu’il ne dit pas

Ce qui est collecté et ce qui est ignoré

Les liens proviennent des <a href> et <area href> du HTML récupéré, entre guillemets simples, doubles ou sans guillemets, et les entités comme &amp; sont décodées. Sont ignorés les fragments (#top), mailto:, tel:, javascript: et data: ; les doublons sont fusionnés en une ligne et chaque adresse relative est résolue par rapport à l’adresse qui a répondu au final, redirections et segments ../ compris.

Rien d’autre n’est lu dans la page : JavaScript n’est pas exécuté, les liens créés par un script, dans un framework ou derrière un clic n’apparaissent donc pas ici.

Lire une ligne

Une ligne affiche le numéro, le titre que la cible déclare dans son <title>, le lien absolu et le code HTTP. 404 signifie que la cible a répondu que l’adresse n’existe plus. « Aucune réponse » signifie que le serveur n’a rien obtenu : le nom ne se résout pas, la connexion a été refusée ou la cible est restée muette pendant 8 secondes.

Les liens vers des adresses privées ne sont jamais récupérés et sont signalés comme tels. Les titres viennent de la page cible : une page sans <title> ou avec un titre erroné n’affiche donc aucun titre ici ; le code HTTP, lui, est fiable.

Limites pratiques

Vérifier une page coûte une récupération plus une requête par lien, toutes depuis le serveur de KivTools, et les limites par adresse sont de 60 récupérations de page et 150 vérifications de lien par minute. Une page qui construit ses liens dans le navigateur paraîtra plus vide ici que dans votre propre navigateur.

Chaque numéro de page récupère à nouveau la page : la numérotation peut donc changer si la page évolue pendant votre travail. Pour auditer des milliers d’adresses de façon planifiée, lancez la vérification depuis votre propre machine.

Outils récents :