TontonTools
Référencement dans les moteurs de recherche

Comment écrire un fichier robots.txt (avec exemples)

Enyong Carinton Tegum· March 12, 2026· 4 min de lecture
Robot representing search engine crawler automation
Photo by Tara Winstead on Pexels

Le fichier robots.txt est un petit fichier texte doté d'une puissance démesurée : il indique aux robots des moteurs de recherche à quelles parties de votre site ils peuvent ou non accéder. Bien utilisé, il permet aux robots d’exploration de se concentrer sur ce qui compte. Utilisée avec négligence, une seule ligne peut accidentellement cacher l’intégralité de votre site à Google. Voici comment y parvenir.

Ce que robots.txt fait (et ne fait pas)

Il réside à la racine de votre domaine (votresite.com/robots.txt) et donne des instructions d'exploration. Fondamentalement, il contrôle l'exploration, et non l'indexation : une page bloquée dans robots.txt peut toujours apparaître dans les résultats si d'autres sites y renvoient. Pour vraiment garder une page hors de la recherche, utilisez plutôt une balise méta noindex. La documentation robots.txt de Google l'explique clairement.

La syntaxe de base

Deux directives principales : User-agent (à quel robot la règle s'applique) et Disallow (ce qu'il ne faut pas explorer). Un fichier simple qui permet tout :

Agent utilisateur : *
Interdire :

Et celui qui bloque un dossier privé pour tous les robots :

Agent utilisateur : *
Interdire : /private/

L'erreur dangereuse

Cette seule ligne bloque l'intégralité de votre site de tous les robots :

Agent utilisateur : *
Interdire : //

C'est un accident courant sur les sites déplacés d'un environnement de test, où tout bloquer était intentionnel. Vérifiez toujours cette ligne avant et après le lancement : c'est la principale raison pour laquelle un nouveau site n'apparaît jamais sur Google.

Ajoutez votre plan de site

La meilleure pratique consiste à diriger les robots d'exploration vers votre plan de site à partir du fichier robots.txt :

Plan du site : https://votresite.com/sitemap.xml

Générez-le sans risque

Plutôt que de l'éditer manuellement et d'espérer, notre générateur de robots.txt gratuit crée un fichier correct à partir d'options simples, afin que vous ne bloquiez pas accidentellement la mauvaise chose. Associez-le à un plan de site XML pour un contrôle complet de l'exploration.

Autoriser les règles et les blocages spécifiques au robot

Au-delà de Disallow, vous pouvez utiliser Autoriser pour créer des exceptions – par exemple, bloquer un dossier entier mais autoriser un fichier à l'intérieur. Vous pouvez également cibler des robots d'exploration spécifiques par leur nom : un bloc User-agent : Googlebot s'applique uniquement à Google, tandis que User-agent : * couvre tout le monde. Cela vous permet, par exemple, d'autoriser un accès complet à Google tout en restreignant un robot plus agressif. Les règles correspondent en premier, de manière la plus spécifique, de sorte qu'un robot nommé suit son propre bloc et ignore le caractère générique.

Gérer le budget d'exploration sur les grands sites

Sur les grands sites, robots.txt joue un rôle de performance : il empêche les robots d'exploration de perdre du temps sur des URL de faible valeur (paramètres de recherche à facettes, résultats de recherche internes, combinaisons de filtres infinies) et ils dépensent donc leur « budget d'exploration » limité sur des pages qui comptent. Pour les petits sites, cela constitue rarement un problème, mais à mesure que vous grandissez, le blocage des pièges d'exploration permet à Google de se concentrer sur votre contenu important plutôt que sur des millions d'URL de paramètres presque identiques.

Testez avant de lui faire confiance

Étant donné qu'une mauvaise ligne peut masquer l'intégralité de votre site, ne modifiez jamais le fichier robots.txt à l'aveugle. Google Search Console comprend un rapport robots.txt qui montre comment Google lit votre fichier et signale les erreurs. Après toute modification, vérifiez que les pages que vous souhaitez indexer ne sont pas accidentellement bloquées et confirmez que la ligne de votre plan de site pointe vers l'URL du plan de site en direct. Un test de deux minutes évite l'erreur de référencement la plus dommageable qui soit.

Résultat

robots.txt guide les robots d'exploration vers les bonnes parties de votre site, mais n'oubliez pas qu'il régit l'exploration, pas l'indexation, et que Disallow : / cache tout. Générez-le soigneusement, liez votre plan de site et vérifiez-le après chaque lancement. Il s'agit d'une ligne de texte qui peut améliorer ou défaire votre visibilité.

Share X / Twitter Facebook LinkedIn WhatsApp

Continuez à lire

← Retour à tous les articles

We use cookies for analytics and to keep the tools free via ads. See our Privacy Policy.