Comment ChatGPT trouve-t-il les sites qu'il cite ?
Quand ChatGPT fait une recherche sur le web, il s'appuie sur des pages explorées par des robots : pour être cité avec un lien, un site doit être lisible par ces robots, et l'une de ses pages doit répondre à la question posée.
Sans recherche, un assistant répond à partir de ce qu'il a appris pendant son entraînement, sans lien vers ses sources. Chaque éditeur documente ses robots, et ils n'ont pas tous le même rôle :
| Robot | Rôle selon son éditeur | Si vous le bloquez |
|---|---|---|
| OAI-SearchBot (OpenAI) | Faire apparaître des sites dans les fonctions de recherche de ChatGPT | Le site n'apparaît plus dans les réponses de recherche de ChatGPT, sauf comme lien de navigation |
| GPTBot (OpenAI) | Collecter des contenus pouvant servir à entraîner les modèles | Le contenu ne doit plus servir à l'entraînement ; réglage indépendant de la recherche |
| ChatGPT-User (OpenAI) | Visiter une page à la demande d'un utilisateur | OpenAI précise que les règles du robots.txt peuvent ne pas s'appliquer à ces visites |
| PerplexityBot (Perplexity) | Faire apparaître et lier des sites dans les résultats de Perplexity | Perplexity recommande de l'autoriser pour figurer dans ses résultats |
| Claude-SearchBot (Anthropic) | Indexer des contenus pour améliorer les réponses de recherche de Claude | Anthropic prévient que la visibilité dans ces réponses peut baisser |
| Google-Extended (Google) | Autoriser l'entraînement de Gemini et l'ancrage dans les applications Gemini | Contenus exclus de l'entraînement de Gemini et de l'ancrage dans ses applications ; aucune incidence sur l'inclusion dans la recherche Google, dont les Aperçus IA relèvent de Googlebot |
OpenAI indique qu'il faut environ 24 heures, et Perplexity jusqu'à 24 heures, pour que leurs systèmes tiennent compte d'une modification du fichier robots.txt.
Étape 1 : les robots peuvent-ils lire votre site ?
Vérifiez trois verrous avant de retoucher le moindre texte, car une page que le robot ne lit pas ne sera jamais citée.
- Le fichier robots.txt ne doit interdire ni OAI-SearchBot, ni PerplexityBot, ni Claude-SearchBot, ni Googlebot. Refuser l'entraînement (GPTBot, ClaudeBot, Google-Extended) reste possible sans toucher aux robots de recherche, puisque OpenAI, Anthropic et Google utilisent des robots ou des jetons distincts pour l'entraînement et pour la recherche.
- Le pare-feu et le CDN : certains services de protection bloquent les robots qu'ils ne connaissent pas. OpenAI recommande d'autoriser les requêtes venant des plages d'adresses IP qu'il publie, et Google cite l'infrastructure CDN ou d'hébergement parmi les points à contrôler.
- Le texte dans le code de la page : Google demande que les contenus importants soient disponibles sous forme textuelle. Un tarif affiché dans une image, ou une FAQ chargée par un script après un clic, échappe à un robot qui lit le HTML.
Étape 2 : des pages qu'un assistant peut citer
Un assistant reprend des passages courts : la page retenue est souvent celle dont une phrase répond seule à la question, avec un fait vérifiable.
Comparez deux formulations pour une entreprise de maintenance de chaudières industrielles. Avant : « Nous accompagnons nos clients avec réactivité et expertise. » Après : « [Nom de l'entreprise] assure l'entretien et le dépannage de chaudières industrielles dans un rayon de 80 km autour de Dijon, avec une astreinte le week-end. » La seconde phrase nomme le sujet, le lieu et le service ; un assistant peut la reprendre telle quelle.
Dans son billet de février 2026 sur les citations dans les réponses IA, Microsoft recommande la même direction pour Bing et Copilot :
- des intertitres clairs, des tableaux et des sections FAQ, qui rendent l'information facile à reprendre ;
- des affirmations appuyées par des exemples, des données et des sources citées ;
- des contenus mis à jour régulièrement ;
- un texte, des images et des vidéos qui décrivent les mêmes produits de la même façon.
Google rappelle de son côté que les bonnes pratiques SEO restent valables pour les Aperçus IA et le Mode IA. Le guide GEO : le référencement dans les IA détaille ces principes.
Étape 3 : être décrit de la même façon partout
Les assistants croisent plusieurs sources : une entreprise dont l'adresse, les services ou la date de création changent d'un site à l'autre est plus difficile à présenter correctement.
- Une page d'identité factuelle sur votre site : activité, adresses, zone d'intervention, date de création, dirigeant, coordonnées. YMHB Web publie la sienne sur la page YMHB Web en bref.
- Des fiches à jour : Google demande de vérifier les informations de la fiche d'établissement et du compte Merchant Center ; Microsoft recommande Bing Places for Business pour que l'adresse, les horaires et les coordonnées restent exacts et puissent figurer dans les réponses générées par l'IA.
- Des données structurées fidèles au texte visible, comme le demande Google.
- Des mentions extérieures : annuaires professionnels, presse locale, partenaires, organisations professionnelles, qui décrivent votre activité dans les mêmes termes que vous.
Faut-il créer un fichier llms.txt ?
Ce n'est pas nécessaire : le fichier llms.txt est une proposition de format, pas un standard adopté par les moteurs ni une condition pour être cité.
La proposition, publiée par Jeremy Howard le 3 septembre 2024 et révisée en août 2026 sur llmstxt.org, consiste à placer à la racine du site un fichier en Markdown qui résume le site et pointe vers ses pages utiles pour les agents. Son auteur indique que des milliers de sites en publient un et que plusieurs laboratoires d'IA en proposent pour leur propre documentation. Google écrit en revanche qu'il n'est pas nécessaire de créer des fichiers textuels d'IA pour apparaître dans les Aperçus IA ou le Mode IA. Le fichier llms.txt reste un complément peu coûteux, à traiter après les trois étapes précédentes.
Comment vérifier que vos efforts portent ?
En mesurant, puisque rien ne garantit une citation : posez régulièrement aux assistants les questions de vos clients, surveillez les visites d'OAI-SearchBot dans vos journaux serveur et consultez le rapport AI Performance de Bing Webmaster Tools, qui affiche en préversion, depuis février 2026, les citations d'un site dans Copilot et les résumés IA de Bing. La méthode complète est décrite dans comment savoir si ChatGPT cite mon entreprise.
YMHB Web travaille ces étapes sur des sites sur mesure et mesure la présence dans les réponses avec VISIA, son outil qui passe 123 contrôles techniques et éditoriaux sur un site et interroge quatre assistants IA. L'offre est décrite sur la page audit et stratégie SEO. Aucune citation n'est promise : les assistants restent maîtres de leurs réponses.
Questions fréquentes
- Le référencement Google suffit-il pour apparaître dans ChatGPT ?
- Non, pas à lui seul. ChatGPT s'appuie sur son propre robot de recherche, OAI-SearchBot, et choisit lui-même les sources qu'il cite. Les fondations restent communes : pages ouvertes aux robots, texte lisible dans le HTML, réponses claires et faits vérifiables servent à la fois au référencement Google et à la visibilité dans ChatGPT, Perplexity ou Copilot.
- Faut-il bloquer GPTBot pour protéger ses contenus ?
- C'est un choix d'entreprise. Selon OpenAI, bloquer GPTBot indique que le contenu ne doit pas servir à entraîner ses modèles, sans retirer le site des résultats de recherche de ChatGPT, qui dépendent d'OAI-SearchBot. Une entreprise peut donc refuser l'entraînement tout en restant citable, à condition de laisser passer OAI-SearchBot dans son fichier robots.txt et son pare-feu.
- Combien de temps faut-il pour que ChatGPT prenne en compte un changement ?
- OpenAI indique qu'il faut environ 24 heures pour que ses systèmes tiennent compte d'une modification du fichier robots.txt. Pour le contenu, aucun délai n'est garanti : une page modifiée doit être explorée de nouveau, puis jugée pertinente pour une question donnée. Mieux vaut suivre la présence dans les réponses sur plusieurs semaines que tester le lendemain d'une mise à jour.
- Les Aperçus IA de Google demandent-ils une optimisation particulière ?
- Non. Google indique dans sa documentation Search Central qu'aucune exigence supplémentaire ni optimisation spéciale n'est requise pour apparaître dans les Aperçus IA ou le Mode IA. Une page doit être indexée et pouvoir s'afficher avec un extrait dans la recherche Google. Google précise aussi qu'il n'est pas nécessaire de créer des fichiers textuels d'IA ni un balisage particulier.
- Pourquoi ChatGPT ne cite-t-il pas mon site alors qu'il est bien référencé ?
- Plusieurs causes sont possibles : un pare-feu qui bloque OAI-SearchBot sans que vous le sachiez, une réponse rédigée sans recherche web, donc sans lien, des pages concurrentes qui répondent plus directement à la question, ou des informations sur votre entreprise qui se contredisent d'un site à l'autre. Vérifiez d'abord l'accès du robot dans vos journaux serveur, puis la clarté de vos pages.
À lire aussi
Sources
- OpenAI, Overview of OpenAI Crawlers (OAI-SearchBot, GPTBot, ChatGPT-User)
- Perplexity, Perplexity Crawlers (PerplexityBot, Perplexity-User)
- Anthropic, Does Anthropic crawl data from the web, and how can site owners block the crawler
- Google Search Central, Fonctionnalités d'IA et votre site Web (Aperçus IA et Mode IA)
- Google Search Central, Robots d'exploration communs de Google (Google-Extended)
- llmstxt.org, The /llms.txt file, v2 (proposition de Jeremy Howard, publiée le 3 septembre 2024)
- Microsoft Bing Blog, Introducing AI Performance in Bing Webmaster Tools Public Preview (10 février 2026)