Crawl Lab

Crawlers IA et robots d'indexation : les fiches de référence

GPTBot, ClaudeBot, PerplexityBot, Googlebot… chaque robot qui visite votre site a un opérateur, une finalité et des règles propres. Ces fiches de référence documentent, pour chaque crawler, les faits vérifiables : la chaîne user-agent, le jeton robots.txt, les plages d'IP officielles quand l'opérateur les publie, et ce que son passage signifie pour votre SEO et votre visibilité dans les réponses IA (GEO).

Chaque information technique renvoie à sa source primaire — la documentation officielle de l'opérateur. Les plages d'IP affichées sont rafraîchies automatiquement à chaque déploiement du site, depuis les fichiers publiés par les opérateurs eux-mêmes.

Tous les crawlers en un tableau : jeton robots.txt, finalité et coût du blocage

Ce tableau réunit les douze robots documentés sur ce site. La dernière colonne est celle qui compte pour une décision : ce que vous perdez réellement en bloquant chaque agent. Bloquer un robot d'entraînement et bloquer un robot de citation n'ont pas du tout les mêmes conséquences.

RobotÉditeurJeton robots.txtFinalitéVérifiable par IPCe que vous perdez en le bloquant
GPTBotOpenAIGPTBotEntraînementOuiAucun effet sur la recherche ChatGPT. Votre contenu sort des futurs corpus d'entraînement d'OpenAI.
OAI-SearchBotOpenAIOAI-SearchBotCitationOuiVotre site disparaît de la recherche ChatGPT : il ne peut plus y être cité avec un lien.
ChatGPT-UserOpenAIChatGPT-UserAgent (temps réel)OuiUn utilisateur de ChatGPT qui suit un lien vers votre page ne peut plus la consulter.
ClaudeBotAnthropicClaudeBotEntraînementNonAucun effet sur les réponses de Claude. Votre contenu sort des corpus d'entraînement d'Anthropic.
Claude-SearchBotAnthropicClaude-SearchBotCitationNonVotre contenu n'est plus indexé pour les résultats de recherche de Claude.
Claude-UserAnthropicClaude-UserAgent (temps réel)NonUn utilisateur de Claude qui demande la consultation de votre page ne l'obtient plus.
PerplexityBotPerplexityPerplexityBotCitationOuiVotre site n'apparaît plus comme source citée dans les réponses de Perplexity.
Google-ExtendedGoogleGoogle-ExtendedEntraînementNonAucun effet sur Google Search ni sur votre classement. Votre contenu n'alimente plus les produits d'IA générative de Google.
GoogleOtherGoogleGoogleOtherRechercheOuiAucun effet documenté sur l'indexation Google Search. Concerne des usages internes (R&D, produits).
Googlebotmulti-usagesGoogleGooglebotRechercheOuiDésindexation progressive de Google Search : les pages cessent d'être réexplorées et le classement décroche.
Bingbotmulti-usagesMicrosoftBingbotRechercheOuiDésindexation de Bing, et perte de la source qui alimente Copilot.
Applebotmulti-usagesAppleApplebotRechercheOuiDisparition de Siri, Spotlight et Apple Intelligence.

Attention aux crawlers multi-usages. Googlebot, Applebot et Bingbot explorent pour indexer mais collectent aussi de la donnée susceptible de servir à l'entraînement. Cloudflare les traite selon la règle la plus restrictive : depuis son annonce du 1er juillet 2026, un site qui bloque la catégorie « Training » peut cesser de servir Googlebot — et donc sortir progressivement de l'index Google.

Ce que change la bascule du 15 septembre 2026

Le jeton robots.txt indique ce que vous demandez. Seuls vos logs serveur montrent ce qui s'est réellement passé — et un user-agent se falsifie en une ligne de commande.

Détecter les crawlers IA dans ses logs serveur

Les fiches détaillées, par éditeur

OpenAI ChatGPT

Anthropic Claude

Google Search, AI Overviews & Gemini

Perplexity moteur de réponses

Microsoft Bing & Copilot

Apple Siri & Apple Intelligence

Pour savoir lesquels de ces bots visitent réellement votre site — et vérifier leur authenticité par IP — glissez vos logs serveur dans notre analyseur : tout se passe dans votre navigateur, sans upload.

Analyser mes logs