Crawl Lab
Toutes les fiches crawlers

GPTBot : le crawler d'entraînement d'OpenAI

GPTBot est le robot d'exploration d'OpenAI chargé de collecter du contenu web pour entraîner ses modèles de fondation (la famille GPT). Il ne sert pas à répondre aux requêtes des utilisateurs de ChatGPT : ce rôle revient à OAI-SearchBot (index de recherche) et à ChatGPT-User (consultation en direct). Bloquer GPTBot retire votre contenu des futurs corpus d'entraînement, sans effet documenté sur votre visibilité dans la recherche ChatGPT.

Fiche technique

Opérateur
OpenAI
Rôle
Crawler d'entraînement
Jeton robots.txt
GPTBot
User-agent (exemple)
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.1; +https://openai.com/gptbot
Respecte robots.txt
Oui (documenté par OpenAI)
Plages IP officielles
336 plages publiées par l'opérateur, tous bots confondus (snapshot du 2026-07-23, rafraîchi à chaque déploiement)fichier officiel
Documentation officielle
Documentation des bots OpenAI

À quoi sert GPTBot exactement

Chaque page que GPTBot télécharge est susceptible d'alimenter les jeux de données servant à entraîner les prochains modèles d'OpenAI. C'est un crawl de masse, périodique, comparable dans sa mécanique à celui d'un moteur de recherche — mais sa finalité est différente : il ne construit pas un index qui renvoie du trafic, il constitue un corpus.

C'est la distinction clé pour vos décisions GEO : autoriser GPTBot, c'est accepter que votre contenu contribue aux connaissances « internes » des futurs modèles (qui pourront en restituer la substance sans vous citer) ; le bloquer ne vous retire ni de la recherche ChatGPT ni des réponses citées, qui reposent sur d'autres agents.

GPTBot dans vos logs serveur

Dans un fichier access.log, GPTBot se reconnaît à la sous-chaîne « GPTBot » du user-agent. Son crawl est généralement modéré en volume et ciblé sur les pages de contenu (articles, guides) plutôt que sur les ressources techniques. Une présence régulière de GPTBot indique que votre site est considéré comme une source de contenu utile pour l'entraînement.

Vérifier que c'est vraiment GPTBot

Le user-agent seul se falsifie trivialement : n'importe quel scraper peut se déclarer « GPTBot ». OpenAI publie la liste officielle de ses plages d'IP dans un fichier JSON dédié — la seule méthode fiable consiste à vérifier que l'adresse IP de chaque hit appartient à ces plages. C'est exactement ce que fait notre analyseur de logs, automatiquement et sans que vos fichiers quittent votre navigateur.

Consulter les plages IP officielles de GPTBot (JSON)

Bloquer ou autoriser GPTBot (robots.txt)

GPTBot respecte les directives robots.txt d'après la documentation d'OpenAI. Le bloquer est un choix éditorial légitime (opt-out d'entraînement) qui n'affecte ni Googlebot, ni la recherche ChatGPT. Attention à ne pas confondre : bloquer GPTBot ne bloque ni OAI-SearchBot ni ChatGPT-User, qui ont leurs propres jetons.

Pour le bloquer :

User-agent: GPTBot
Disallow: /

Pour l'autoriser explicitement :

User-agent: GPTBot
Allow: /

Questions fréquentes

Faut-il bloquer GPTBot ?

C'est un arbitrage éditorial, pas technique. Bloquer GPTBot retire votre contenu des futurs corpus d'entraînement d'OpenAI — utile si vous refusez cette réutilisation. En revanche, cela ne supprime pas votre visibilité dans la recherche ChatGPT (OAI-SearchBot) ni la consultation en direct de vos pages (ChatGPT-User). Beaucoup de sites orientés visibilité choisissent de tout autoriser.

GPTBot respecte-t-il le fichier robots.txt ?

Oui. OpenAI documente publiquement que GPTBot lit et respecte robots.txt, et publie ses plages d'IP pour permettre la vérification. Les tests publiés par des tiers confirment ce comportement. Un « GPTBot » qui ignore vos directives est très probablement un imposteur à vérifier par IP.

Comment savoir si GPTBot visite mon site ?

Seuls vos logs serveur le montrent : GPTBot n'exécute pas JavaScript, il est donc invisible pour Google Analytics et les outils à balise. Glissez vos fichiers access.log dans notre analyseur : il isole GPTBot, vérifie son authenticité par IP et liste les pages qu'il consulte.

Bloquer GPTBot fait-il disparaître mon site de ChatGPT ?

Non. Les réponses de ChatGPT qui citent des sites s'appuient sur l'index d'OAI-SearchBot et sur les consultations en direct de ChatGPT-User. GPTBot ne sert qu'à l'entraînement des modèles. Ce sont trois agents distincts, avec trois jetons robots.txt distincts.

Sources

Chaque fait de cette fiche s'appuie sur une source primaire — la documentation officielle de l'opérateur et, quand elle existe, sa liste d'IP publiée.

Voyez ce que ce bot fait sur votre site

Glissez vos fichiers access.log dans l'analyseur de logs Crawl Lab : il isole GPTBot, vérifie son authenticité et liste les pages qu'il consulte — entièrement dans votre navigateur, sans upload.

Analyser mes logs

Autres fiches crawlers