Aller au contenu
Gratuit · Sans compte

Générateur de robots.txt

Ajoutez des règles Allow/Disallow pour un ou plusieurs robots (user-agent) et indiquez l'URL de votre sitemap : l'outil génère le fichier robots.txt correspondant.

Le robots.txt est le premier fichier qu’un robot d’exploration consulte sur un domaine : il y lit quelles zones du site il est invité à parcourir. Cet outil compose ce fichier groupe par groupe, avec un user-agent, ses règles Allow et Disallow, puis la ligne Sitemap. Il s’adresse à ceux qui doivent écarter du crawl un back-office, un moteur de recherche interne ou un tunnel de commande.

Règle 1

robots.txt généré

User-agent: *
Allow: /

Déposez ce fichier à la racine de votre site, à l’adresse /robots.txt.

Comment un robots.txt est structuré et interprété

Le fichier est une suite de groupes. Chaque groupe commence par une ligne User-agent qui nomme un robot (ou * pour tous ceux qui ne sont pas nommés ailleurs), suivie de ses directives Allow et Disallow. Un robot n’applique qu’un seul groupe : celui dont le user-agent lui correspond le plus précisément. Si vous créez un groupe GPTBot, ce robot ignorera entièrement le groupe * : les règles ne se cumulent pas, c’est l’erreur la plus fréquente.

Les chemins sont comparés depuis la racine du site. Disallow: /admin bloque /admin comme /administration, puisqu’il s’agit d’un préfixe. En cas de conflit entre deux règles, Google applique la plus spécifique, c’est-à-dire la plus longue : Allow: /blog/public l’emporte sur Disallow: /blog. La ligne Sitemap, elle, est indépendante des groupes et peut apparaître n’importe où ; c’est le moyen le plus simple de signaler votre sitemap à tous les moteurs à la fois.

Le respect du fichier est déclaratif. Les robots des grands moteurs s’y conforment, les aspirateurs de contenu malveillants non. Un robots.txt n’est donc pas un dispositif de sécurité : tout ce qu’il contient est public et lisible par n’importe qui à l’adresse /robots.txt.

Crawl classique et crawlers IA : deux décisions distinctes

Pour la recherche classique, l’usage courant consiste à laisser le site ouvert et à n’exclure que ce qui n’a rien à faire dans un index : pages d’administration, résultats de recherche interne, panier et tunnel de commande, URL de test. Bloquer trop large est un risque réel : un Disallow: / oublié en préproduction et recopié en production suffit à faire disparaître un site des résultats.

Pour les moteurs IA, la question est différente et vous appartient. Les principaux robots portent des noms distincts selon leur usage : GPTBot et ClaudeBot collectent du contenu, OAI-SearchBot, ChatGPT-User, Claude-SearchBot et PerplexityBot servent les réponses en direct, Google-Extended contrôle l’usage par Gemini sans affecter l’indexation Google Search. Les bloquer protège votre contenu de l’entraînement, mais vous retire aussi des réponses que ces moteurs génèrent. Si votre objectif est d’être cité, laissez-les passer.

Cas d’usage concrets

Écarter les zones inutiles

Empêcher l’exploration du back-office, des pages de compte et des résultats de recherche interne, qui consomment du budget de crawl sans jamais mériter d’être indexés.

Trier les robots IA

Autoriser les robots qui citent des sources en direct tout en refusant, si vous le souhaitez, ceux qui collectent du contenu pour l’entraînement.

Déclarer le sitemap

Ajouter la ligne Sitemap pour signaler votre index d’URL à tous les moteurs en une fois, sans passer par chaque interface de webmaster.

Ce que cet outil ne fait pas

Disallow empêche l’exploration, pas l’indexation. Une URL bloquée mais liée depuis d’autres sites peut encore apparaître dans les résultats, sans description, parce que Google en connaît l’existence sans pouvoir la lire. Pour retirer réellement une page de l’index, utilisez une balise meta robots noindex sur une page laissée accessible au crawl, ou une protection par mot de passe. Le fichier n’est enfin qu’un signal : les robots malveillants l’ignorent.

Pour aller plus loin

Questions fréquentes

Où dois-je déposer le fichier robots.txt généré ?+

À la racine de votre site, pour qu'il soit accessible à l'adresse https://votre-site.fr/robots.txt. C'est le seul emplacement reconnu par les robots d'indexation.

Puis-je définir des règles différentes pour ChatGPT, Claude ou Perplexity ?+

Oui, ajoutez un user-agent dédié (par exemple GPTBot, ClaudeBot ou PerplexityBot) avec ses propres règles Allow/Disallow, en plus de la règle générale pour *.

Que se passe-t-il si je ne mets aucune règle Disallow ?+

Cela signifie que tout le site reste autorisé au crawl pour ce user-agent. C'est un choix légitime si vous n'avez aucune page à exclure de l'indexation.

Un Disallow retire-t-il ma page des résultats de recherche ?+

Non. Il empêche le robot de lire la page, pas de connaître son existence. Une URL bloquée mais liée depuis ailleurs peut apparaître dans les résultats sans titre ni description. Pour la désindexer, laissez-la accessible au crawl et posez-y une balise meta robots noindex.

Les règles pour * s'appliquent-elles aussi aux robots nommés ?+

Non, et c'est un piège classique. Chaque robot applique un seul groupe, le plus spécifique qui le concerne. Dès que vous créez un groupe pour GPTBot, ce robot ignore intégralement le groupe * : ses règles doivent être répétées dans son propre groupe.

Un robots.txt bien écrit améliore-t-il mon positionnement ?+

Pas directement. Il oriente l'exploration et évite de gaspiller du budget de crawl sur des pages sans valeur, ce qui aide sur les gros sites. Sur un site de quelques dizaines de pages, l'effet est négligeable : le contenu et la structure interne pèsent bien davantage.

Envie d’automatiser tout votre SEO ?

GetRerank prolonge ces outils gratuits avec un plan de contenu, la rédaction et la publication automatiques, mesurés sur Google et six moteurs IA.

Découvrir GetRerank