Crawlers IA et robots d'indexation : les fiches de référence
GPTBot, ClaudeBot, PerplexityBot, Googlebot… chaque robot qui visite votre site a un opérateur, une finalité et des règles propres. Ces fiches de référence documentent, pour chaque crawler, les faits vérifiables : la chaîne user-agent, le jeton robots.txt, les plages d'IP officielles quand l'opérateur les publie, et ce que son passage signifie pour votre SEO et votre visibilité dans les réponses IA (GEO).
Chaque information technique renvoie à sa source primaire — la documentation officielle de l'opérateur. Les plages d'IP affichées sont rafraîchies automatiquement à chaque déploiement du site, depuis les fichiers publiés par les opérateurs eux-mêmes.
OpenAI — ChatGPT
GPTBot
Crawler d'entraînement
GPTBot est le crawler d'OpenAI qui collecte du contenu pour entraîner ses modèles. User-agent, plages IP officielles, comment le vérifier et le bloquer.
OAI-SearchBot
Index de recherche ChatGPT
OAI-SearchBot construit l'index qui fait apparaître les sites dans la recherche ChatGPT. User-agent, plages IP, enjeux GEO : le bloquer vous retire des résultats.
ChatGPT-User
Consultation en direct (utilisateur)
ChatGPT-User visite une page quand un utilisateur de ChatGPT le demande. Ce n'est pas un crawler de masse : chaque hit est un lecteur potentiel. IP, robots.txt.
Anthropic — Claude
ClaudeBot
Crawler d'entraînement
ClaudeBot collecte du contenu web pour entraîner les modèles Claude d'Anthropic. User-agent, respect du robots.txt, et pourquoi sa vérification par IP est limitée.
Claude-SearchBot
Qualité des résultats de recherche
Claude-SearchBot améliore la qualité des résultats de recherche de Claude. Rôle, user-agent, robots.txt : le bot Anthropic à autoriser pour la visibilité.
Claude-User
Consultation en direct (utilisateur)
Claude-User consulte une page quand un utilisateur de Claude le demande. Chaque hit est une lecture humaine réelle via l'IA. Détection, robots.txt, mesure.
Google — Search, AI Overviews & Gemini
Google-Extended
Jeton robots.txt (entraînement Gemini)
Google-Extended n'est pas un crawler : c'est un jeton robots.txt qui contrôle l'usage de votre contenu pour entraîner Gemini — sans toucher votre SEO.
GoogleOther
Crawler générique (R&D, produits)
GoogleOther est le crawler « générique » de Google, utilisé hors indexation Search : R&D, produits, usages internes. Détection, plages IP, robots.txt.
Googlebot
Indexation Google Search
Googlebot alimente l'index de Google Search — et les AI Overviews. User-agent, plages IP officielles, vérification anti-usurpation, bonnes pratiques robots.txt.
Perplexity — moteur de réponses
Microsoft — Bing & Copilot
Apple — Siri & Apple Intelligence
Pour savoir lesquels de ces bots visitent réellement votre site — et vérifier leur authenticité par IP — glissez vos logs serveur dans notre analyseur : tout se passe dans votre navigateur, sans upload.
Analyser mes logs