Crawlers IA et robots d'indexation : les fiches de référence
GPTBot, ClaudeBot, PerplexityBot, Googlebot… chaque robot qui visite votre site a un opérateur, une finalité et des règles propres. Ces fiches de référence documentent, pour chaque crawler, les faits vérifiables : la chaîne user-agent, le jeton robots.txt, les plages d'IP officielles quand l'opérateur les publie, et ce que son passage signifie pour votre SEO et votre visibilité dans les réponses IA (GEO).
Chaque information technique renvoie à sa source primaire — la documentation officielle de l'opérateur. Les plages d'IP affichées sont rafraîchies automatiquement à chaque déploiement du site, depuis les fichiers publiés par les opérateurs eux-mêmes.
Tous les crawlers en un tableau : jeton robots.txt, finalité et coût du blocage
Ce tableau réunit les douze robots documentés sur ce site. La dernière colonne est celle qui compte pour une décision : ce que vous perdez réellement en bloquant chaque agent. Bloquer un robot d'entraînement et bloquer un robot de citation n'ont pas du tout les mêmes conséquences.
| Robot | Éditeur | Jeton robots.txt | Finalité | Vérifiable par IP | Ce que vous perdez en le bloquant |
|---|---|---|---|---|---|
| GPTBot | OpenAI | GPTBot | Entraînement | Oui | Aucun effet sur la recherche ChatGPT. Votre contenu sort des futurs corpus d'entraînement d'OpenAI. |
| OAI-SearchBot | OpenAI | OAI-SearchBot | Citation | Oui | Votre site disparaît de la recherche ChatGPT : il ne peut plus y être cité avec un lien. |
| ChatGPT-User | OpenAI | ChatGPT-User | Agent (temps réel) | Oui | Un utilisateur de ChatGPT qui suit un lien vers votre page ne peut plus la consulter. |
| ClaudeBot | Anthropic | ClaudeBot | Entraînement | Non | Aucun effet sur les réponses de Claude. Votre contenu sort des corpus d'entraînement d'Anthropic. |
| Claude-SearchBot | Anthropic | Claude-SearchBot | Citation | Non | Votre contenu n'est plus indexé pour les résultats de recherche de Claude. |
| Claude-User | Anthropic | Claude-User | Agent (temps réel) | Non | Un utilisateur de Claude qui demande la consultation de votre page ne l'obtient plus. |
| PerplexityBot | Perplexity | PerplexityBot | Citation | Oui | Votre site n'apparaît plus comme source citée dans les réponses de Perplexity. |
| Google-Extended | Google-Extended | Entraînement | Non | Aucun effet sur Google Search ni sur votre classement. Votre contenu n'alimente plus les produits d'IA générative de Google. | |
| GoogleOther | GoogleOther | Recherche | Oui | Aucun effet documenté sur l'indexation Google Search. Concerne des usages internes (R&D, produits). | |
| Googlebot⚠ multi-usages | Googlebot | Recherche | Oui | Désindexation progressive de Google Search : les pages cessent d'être réexplorées et le classement décroche. | |
| Bingbot⚠ multi-usages | Microsoft | Bingbot | Recherche | Oui | Désindexation de Bing, et perte de la source qui alimente Copilot. |
| Applebot⚠ multi-usages | Apple | Applebot | Recherche | Oui | Disparition de Siri, Spotlight et Apple Intelligence. |
Attention aux crawlers multi-usages. Googlebot, Applebot et Bingbot explorent pour indexer mais collectent aussi de la donnée susceptible de servir à l'entraînement. Cloudflare les traite selon la règle la plus restrictive : depuis son annonce du 1er juillet 2026, un site qui bloque la catégorie « Training » peut cesser de servir Googlebot — et donc sortir progressivement de l'index Google.
Ce que change la bascule du 15 septembre 2026 →Le jeton robots.txt indique ce que vous demandez. Seuls vos logs serveur montrent ce qui s'est réellement passé — et un user-agent se falsifie en une ligne de commande.
Détecter les crawlers IA dans ses logs serveur →Les fiches détaillées, par éditeur
OpenAI — ChatGPT
GPTBot
Crawler d'entraînement
Documentation officielle de GPTBot. User-agent, plages IP vérifiées, robots.txt, comment détecter et bloquer le crawler d'OpenAI dans les logs serveur.
OAI-SearchBot
Index de recherche ChatGPT
Documentation officielle d'OAI-SearchBot. User-agent, plages IP vérifiées, robots.txt : le crawler OpenAI qui vous rend visible dans la recherche ChatGPT.
ChatGPT-User
Consultation en direct (utilisateur)
ChatGPT-User visite une page quand un utilisateur de ChatGPT le demande. Ce n'est pas un crawler de masse : chaque hit est un lecteur potentiel. IP, robots.txt.
Anthropic — Claude
ClaudeBot
Crawler d'entraînement
ClaudeBot collecte du contenu web pour entraîner les modèles Claude d'Anthropic. User-agent, respect du robots.txt, et pourquoi sa vérification par IP est limitée.
Claude-SearchBot
Qualité des résultats de recherche
Documentation officielle de Claude-SearchBot. User-agent, robots.txt, comment détecter le crawler Anthropic dans vos logs serveur et l'autoriser pour la visibilité GEO.
Claude-User
Consultation en direct (utilisateur)
Claude-User consulte une page quand un utilisateur de Claude le demande. Chaque hit est une lecture humaine réelle via l'IA. Détection, robots.txt, mesure.
Google — Search, AI Overviews & Gemini
Google-Extended
Jeton robots.txt (entraînement Gemini)
Google-Extended n'est pas un crawler : c'est un jeton robots.txt qui contrôle l'usage de votre contenu pour entraîner Gemini — sans toucher votre SEO.
GoogleOther
Crawler générique (R&D, produits)
GoogleOther est le crawler « générique » de Google, utilisé hors indexation Search : R&D, produits, usages internes. Détection, plages IP, robots.txt.
Googlebot
Indexation Google Search
Googlebot alimente l'index de Google Search — et les AI Overviews. User-agent, plages IP officielles, vérification anti-usurpation, bonnes pratiques robots.txt.
Perplexity — moteur de réponses
Microsoft — Bing & Copilot
Apple — Siri & Apple Intelligence
Pour savoir lesquels de ces bots visitent réellement votre site — et vérifier leur authenticité par IP — glissez vos logs serveur dans notre analyseur : tout se passe dans votre navigateur, sans upload.
Analyser mes logs