…

Vérifier robots.txt pour un robot et un chemin précis

Ce testeur indique si les règles fournies autorisent ou bloquent un chemin pour le robot choisi. En mode texte, renseignez le User-agent et le chemin. En mode URL, l'outil récupère le fichier public de l'hôte et teste le chemin saisi pour Googlebot.

Un résultat autorisé ne prouve pas que la page est indexée. Pour comprendre une absence dans Google, examinez aussi le statut HTTP, la canonique, les directives noindex et l'inspection d'URL dans Search Console.

  1. Collez le fichier complet à évaluer.
  2. En mode texte, choisissez le robot et indiquez un chemin commençant par /.
  3. Lisez la règle correspondante et la décision affichée.
  4. Testez les exceptions importantes, puis contrôlez le fichier réellement publié.

Exemple : autoriser une exception dans un répertoire bloqué

Testez séparément /brouillons/note/ et /brouillons/publics/guide/. La règle correspondante la plus précise distingue les deux cas. Vérifiez également les groupes propres au robot visé : le groupe générique ne décrit pas nécessairement sa décision.

Règles d'exemple
User-agent: *
Disallow: /brouillons/
Allow: /brouillons/publics/

Distinguer exploration, indexation et accès privé

robots.txt n'est pas une protection des données. Utilisez une authentification pour les ressources privées. Si Google doit lire une directive noindex, laissez la réponse accessible à son robot.

Le fichier ne s'applique qu'à son hôte, son protocole et son port. Le sous-domaine possède son propre périmètre. Un test de texte ne vérifie ni la disponibilité du serveur ni la version en cache chez Google : contrôlez aussi la réponse publiée et les données de Search Console.

Méthode

Évalue les règles par robot et chemin, puis produit un fichier lisible avec avertissements.

Comment les moteurs explorent, indexent et affichent les résultats

Confidentialité

Les données sont traitées de manière éphémère afin de produire le résultat. Les fichiers CSV sont analysés uniquement dans ce navigateur ; ils ne sont ni téléversés ni conservés.

Limites

robots.txt régit l’exploration compatible ; il ne supprime pas à lui seul une URL connue de l’index.

Sources primaires

WhatsApp