Crawl Lab
Toutes les fiches crawlers

Google-Extended : l'opt-out d'entraînement IA de Google

Google-Extended n'est pas un robot d'exploration : c'est un jeton de contrôle à utiliser dans robots.txt. Vous ne le verrez jamais dans vos logs serveur — aucun user-agent ne porte ce nom. Il indique à Google si le contenu déjà crawlé par ses robots habituels peut servir à entraîner les modèles Gemini et les API Vertex AI. Google documente que ce choix n'affecte ni le classement dans la recherche, ni l'inclusion dans les AI Overviews.

Fiche technique

Opérateur
Google
Rôle
Jeton robots.txt (entraînement Gemini)
Jeton robots.txt
Google-Extended
User-agent (exemple)
Aucun — jeton robots.txt uniquement, jamais visible dans les logs
Respecte robots.txt
Oui — c'est précisément un jeton robots.txt
Plages IP officielles
Non publiées par l'opérateur (vérification par IP impossible)
Documentation officielle
Documentation des crawlers Google

Comment fonctionne un jeton sans crawler

Google ne fait pas repasser un robot dédié pour l'IA : Googlebot et les autres crawlers collectent le contenu une seule fois, puis Google-Extended agit comme un interrupteur d'usage en aval. Bloquer Google-Extended dans robots.txt dit : « vous pouvez me crawler pour la recherche, mais pas utiliser mon contenu pour entraîner Gemini ».

C'est la raison pour laquelle chercher « Google-Extended » dans un fichier de logs est vain — et pourquoi un user-agent qui se présenterait ainsi serait, à coup sûr, un imposteur.

Ce que le blocage change (et ne change pas)

D'après la documentation officielle, bloquer Google-Extended retire votre contenu des données d'entraînement de Gemini, mais ne change rien à Google Search : indexation, classement et apparition dans les AI Overviews restent pilotés par Googlebot. C'est l'un des opt-out IA les plus « propres » du marché : un choix éditorial sans risque SEO documenté.

Vérifier que c'est vraiment Google-Extended

Il n'y a rien à vérifier dans les logs : Google-Extended n'émet aucune requête. Si un « Google-Extended » apparaît dans votre champ user-agent, c'est un faux — probablement un scraper espérant profiter de la confusion. Notre analyseur vérifie l'authenticité des vrais crawlers Google (Googlebot, GoogleOther) par leurs plages d'IP officielles.

Bloquer ou autoriser Google-Extended (robots.txt)

Le « blocage » de Google-Extended est l'usage même du jeton : une directive Disallow dans robots.txt suffit, et Google la respecte par construction. Décision purement éditoriale — votre SEO n'y gagne ni n'y perd rien, d'après la documentation Google.

Pour le bloquer :

User-agent: Google-Extended
Disallow: /

Pour l'autoriser explicitement :

User-agent: Google-Extended
Allow: /

Questions fréquentes

Google-Extended est-il un crawler ?

Non. La documentation Google le décrit comme un jeton (« product token ») utilisable dans robots.txt, pas comme un robot : aucun user-agent Google-Extended n'existe, aucune requête ne porte ce nom. Le contenu est collecté par les crawlers Google habituels ; le jeton contrôle son usage pour l'entraînement de Gemini.

Bloquer Google-Extended nuit-il à mon référencement Google ?

Non, d'après la documentation officielle : le jeton ne concerne que l'usage du contenu pour entraîner Gemini et Vertex AI. L'indexation, le classement dans la recherche et l'apparition dans les AI Overviews dépendent de Googlebot, qui n'est pas affecté par cette directive.

Comment refuser l'entraînement Gemini sans toucher ma visibilité ?

Ajoutez dans votre robots.txt : « User-agent: Google-Extended » suivi de « Disallow: / ». Votre site reste crawlé et classé normalement par Googlebot ; seul l'usage d'entraînement est retiré. C'est l'opt-out IA le mieux délimité du marché.

Pourquoi je ne vois jamais Google-Extended dans mes logs ?

Parce qu'il n'existe pas en tant qu'agent : c'est un jeton de politique, pas un robot. Les requêtes Google dans vos logs viennent de Googlebot, GoogleOther et des autres crawlers documentés. Un « Google-Extended » dans un user-agent est un signal d'usurpation.

Sources

Chaque fait de cette fiche s'appuie sur une source primaire — la documentation officielle de l'opérateur et, quand elle existe, sa liste d'IP publiée.

Voyez ce que ce bot fait sur votre site

Glissez vos fichiers access.log dans l'analyseur de logs Crawl Lab : il isole Google-Extended, vérifie son authenticité et liste les pages qu'il consulte — entièrement dans votre navigateur, sans upload.

Analyser mes logs

Autres fiches crawlers