ClaudeBot : le crawler d'entraînement d'Anthropic
ClaudeBot est le robot d'exploration d'Anthropic qui collecte du contenu web pour entraîner les modèles Claude. Comme GPTBot chez OpenAI, il constitue un corpus d'entraînement : il ne construit pas d'index de recherche et ne cite pas de sources. Anthropic documente qu'il respecte robots.txt — mais, particularité notable, ne publie pas de plages d'IP officielles, ce qui limite sa vérification.
Fiche technique
- Opérateur
- Anthropic
- Rôle
- Crawler d'entraînement
- Jeton robots.txt
ClaudeBot- User-agent (exemple)
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)- Respecte robots.txt
- Oui (documenté par Anthropic)
- Plages IP officielles
- Non publiées par l'opérateur (vérification par IP impossible)
- Documentation officielle
- Documentation Anthropic sur le crawl
Le rôle de ClaudeBot dans l'écosystème Anthropic
Anthropic distingue trois agents : ClaudeBot (collecte pour l'entraînement), Claude-SearchBot (amélioration des résultats de recherche) et Claude-User (consultation en direct quand un utilisateur de Claude le demande). Bloquer ClaudeBot est donc un opt-out d'entraînement qui ne supprime pas la capacité de Claude à consulter et citer vos pages à la demande.
Dans les logs de sites récents, ClaudeBot est souvent l'un des crawlers IA les plus actifs en volume — son passage régulier indique que votre contenu est jugé pertinent pour les corpus d'Anthropic.
La particularité : pas de plages d'IP publiées
Contrairement à OpenAI, Google, Microsoft, Apple ou Perplexity, Anthropic ne publie pas de liste officielle de plages d'IP pour ses agents. Conséquence directe : un hit « ClaudeBot » ne peut être ni formellement confirmé ni formellement infirmé par IP. Les analyses sérieuses le classent en « non vérifiable » plutôt qu'en « vérifié » — c'est exactement ce que fait notre analyseur, par honnêteté méthodologique.
Vérifier que c'est vraiment ClaudeBot
Faute de plages d'IP officielles, la vérification de ClaudeBot repose sur des indices faibles : cohérence du volume, provenance cloud plausible, comportement de crawl régulier. Notre analyseur affiche ce statut « doute » explicitement au lieu de feindre une certitude — un « ClaudeBot » au comportement agressif ou erratique mérite la méfiance.
Bloquer ou autoriser ClaudeBot (robots.txt)
Anthropic documente que ClaudeBot respecte robots.txt, y compris les directives Disallow ciblées. Le bloquer retire votre contenu des futurs corpus d'entraînement de Claude, sans effet sur Claude-User (consultation en direct) ni sur Claude-SearchBot, qui ont leurs propres jetons.
Pour le bloquer :
User-agent: ClaudeBot Disallow: /
Pour l'autoriser explicitement :
User-agent: ClaudeBot Allow: /
Questions fréquentes
Faut-il bloquer ClaudeBot ?
Même arbitrage que pour GPTBot : c'est un choix éditorial d'opt-out d'entraînement. Le bloquer n'empêche ni Claude de consulter vos pages à la demande d'un utilisateur (Claude-User), ni l'amélioration des résultats de recherche (Claude-SearchBot). Si votre priorité est la visibilité dans les réponses IA, le laisser passer ne coûte rien.
Comment vérifier qu'un hit ClaudeBot est authentique ?
On ne peut pas le prouver formellement : Anthropic ne publie pas de plages d'IP officielles, contrairement à OpenAI ou Google. La bonne pratique est de classer ces hits en « non vérifiable » et de surveiller les comportements anormaux (volume soudain, crawl agressif), signes probables d'un imposteur.
ClaudeBot respecte-t-il robots.txt ?
Oui, d'après la documentation officielle d'Anthropic : ClaudeBot lit et respecte les directives robots.txt, et Anthropic indique que les pages bloquées sont exclues de la collecte. Un agent se présentant comme ClaudeBot mais ignorant vos directives est vraisemblablement un faux.
Pourquoi ClaudeBot crawle-t-il autant mon site ?
Un volume élevé de ClaudeBot est courant, surtout après la découverte d'un site ou la publication de contenu frais : le crawl d'entraînement est périodique et large. S'il devient disproportionné, un Crawl-delay ou des règles Disallow ciblées dans robots.txt sont respectés d'après Anthropic.
Sources
Chaque fait de cette fiche s'appuie sur une source primaire — la documentation officielle de l'opérateur et, quand elle existe, sa liste d'IP publiée.
Voyez ce que ce bot fait sur votre site
Glissez vos fichiers access.log dans l'analyseur de logs Crawl Lab : il isole ClaudeBot, vérifie son authenticité et liste les pages qu'il consulte — entièrement dans votre navigateur, sans upload.
Analyser mes logs