Comment être cité par ChatGPT : ce qu’OpenAI documente ou non
Découvrez comment être cité par ChatGPT : autorisez OAI-SearchBot, distinguez les faits des hypothèses et suivez les visites depuis chatgpt.com.
Long Nguyen
Développeur fullstack · Ingénieur IA · Chercheur
Comment être cité par ChatGPT : ce qui est documenté ou non
Vous ne pouvez contrôler que la première étape : vérifiez que le robot d’exploration de ChatGPT est autorisé à consulter vos pages. Tout ce qui suit — les pages citées et celles qui sont écartées — n’est pas décrit dans les pages d’OpenAI que j’ai trouvées. Cet article distingue clairement ces deux aspects.
Les faits ci-dessous ont été vérifiés à partir de la documentation officielle d’OpenAI le .
| Question | OpenAI le documente-t-il ? | Que faire ? |
|---|---|---|
| N’importe quel site public peut-il apparaître dans la recherche ChatGPT ? | Oui | Ne bloquez pas OAI-SearchBot |
| Le blocage de GPTBot vous retire-t-il des résultats de recherche ? | Non : les contrôles sont distincts | Configurez GPTBot et OAI-SearchBot séparément |
| À quelle vitesse les changements de robots.txt sont-ils pris en compte ? | Oui, environ 24 heures pour la recherche | Attendez un jour avant d’évaluer le changement |
| Pouvez-vous suivre les visites provenant de ChatGPT ? | Oui, grâce à un paramètre UTM | Filtrez les données sur utm_source=chatgpt.com |
| Quelles pages sont citées, et dans quel ordre ? | Pas dans les documents que j’ai trouvés | Considérez tout conseil comme une hypothèse |
| llms.txt ou les données structurées augmentent-ils les chances d’être cité ? | Pas dans les documents que j’ai trouvés | N’attendez pas d’amélioration garantie |
Étape 1 : autoriser OAI-SearchBot à explorer votre site
La FAQ d’OpenAI destinée aux éditeurs indique que tout site public peut apparaître dans la recherche ChatGPT. Pour figurer dans les résumés et les extraits, vous devez donc ne pas bloquer OAI-SearchBot. Si votre fichier robots.txt le bloque, corrigez d’abord ce point : rien d’autre dans cette page ne sera utile tant que ce problème ne sera pas réglé.
Deux détails de la documentation d’OpenAI sur ses robots d’exploration sont faciles à manquer :
- Délai. OpenAI indique que les systèmes de recherche peuvent mettre environ 24 heures à s’adapter après une modification de robots.txt. Si vous modifiez le fichier à 9 h, ne refaites pas un test à 9 h 05.
- Pare-feu. OpenAI recommande d’autoriser ses plages d’adresses IP publiées en plus de la règle robots.txt. Une règle Cloudflare ou WAF qui met au défi les robots inconnus peut bloquer OAI-SearchBot même si robots.txt l’autorise. La liste des adresses IP est publiée à l’adresse openai.com/searchbot.json.
La chaîne user-agent se termine actuellement par OAI-SearchBot/1.4, mais OpenAI précise que le numéro de version peut changer. Lorsqu’il récupère lui-même le fichier robots.txt, le robot peut ajouter un marqueur robots.txt à la chaîne. Faites donc la correspondance sur le terme OAI-SearchBot, et non sur la chaîne complète.
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
Cette configuration permet à la recherche ChatGPT d’accéder à votre site et demande à OpenAI de ne pas utiliser vos pages pour l’entraînement. C’est la configuration la plus courante chez les éditeurs qui veulent gagner en visibilité sans contribuer aux données d’entraînement.
OAI-SearchBot, GPTBot et ChatGPT-User : quel robot contrôle quoi ?
OpenAI utilise trois user-agents que l’on confond souvent. Ils répondent à des besoins différents.
| User-agent | Rôle | Contrôle |
|---|---|---|
| OAI-SearchBot | Fait apparaître les sites dans la recherche ChatGPT | robots.txt : c’est le réglage d’inclusion ou d’exclusion de la recherche |
| GPTBot | Explore des contenus susceptibles d’être utilisés pour l’entraînement des modèles | robots.txt : bloquez-le pour refuser l’utilisation à des fins d’entraînement |
| ChatGPT-User | Récupère une page parce qu’une personne l’a demandé à ChatGPT | OpenAI indique que les règles robots.txt peuvent ne pas s’appliquer |
En pratique, une ligne de journal indiquant ChatGPT-User prouve qu’une personne a demandé des informations sur votre page, mais pas que celle-ci figure dans l’index de recherche. OpenAI précise par ailleurs que les exclusions de la recherche doivent être appliquées à OAI-SearchBot : bloquer ChatGPT-User ne constitue donc pas le réglage de recherche.
Comment vérifier votre robots.txt pour ChatGPT en 10 lignes
Ne vous contentez pas d’un examen visuel. Ce script utilise la bibliothèque standard de Python pour indiquer comment un fichier robots.txt traite les trois agents d’OpenAI, quelle que soit l’URL.
from urllib.robotparser import RobotFileParser
BOTS = ["OAI-SearchBot", "GPTBot", "ChatGPT-User"]
def check(site, path="/"):
rp = RobotFileParser(site.rstrip("/") + "/robots.txt")
rp.read()
for bot in BOTS:
ok = rp.can_fetch(bot, site.rstrip("/") + path)
print(bot, "ALLOWED" if ok else "BLOCKED")
check("https://example.com", "/blog/my-post")
J’ai confirmé un piège en exécutant ce script. Prenez un fichier robots.txt contenant un User-agent: * général avec Disallow: /, ajoutez un groupe nommé qui autorise uniquement OAI-SearchBot, puis une interdiction dédiée à GPTBot. L’analyseur de Python indique qu’OAI-SearchBot est autorisé, que GPTBot est bloqué et que ChatGPT-User est bloqué, car ce dernier n’a pas son propre groupe et relève donc de la règle générique.
Pour l’éligibilité dans les résultats de recherche, ce comportement convient puisque OAI-SearchBot est le robot important. Mais il montre comment une règle générique peut s’appliquer discrètement à tous les agents que vous n’avez pas nommés. L’analyseur de Python n’est pas celui d’OpenAI : vérifiez donc le comportement réel dans les journaux de votre serveur après le délai de 24 heures.
Pourquoi une page bloquée peut-elle quand même apparaître sous forme de lien ?
Bloquer OAI-SearchBot ne garantit pas une invisibilité totale. La FAQ d’OpenAI indique que si le service découvre l’URL d’une page interdite auprès d’un moteur de recherche tiers ou en explorant d’autres pages, et qu’il détecte des signaux indiquant que cette page est pertinente, il peut afficher uniquement le lien et le titre de la page. OpenAI précise ce point pour ChatGPT Atlas.
La solution documentée consiste à ajouter une balise meta noindex. Attention à un piège : le robot ne peut lire une balise meta que s’il est autorisé à récupérer la page. Si vous souhaitez à la fois exclure une page et la bloquer dans robots.txt, la balise noindex ne sera jamais visible. Autorisez l’exploration, diffusez la balise noindex et laissez celle-ci faire son travail.
Comment ChatGPT choisit-il les sources à citer ?
La réponse honnête est la suivante : OpenAI n’a pas publié la logique de sélection. J’ai consulté son centre d’aide et sa documentation destinée aux développeurs. J’y ai trouvé des règles concernant les robots d’exploration et un paramètre de provenance, mais aucun critère de classement, facteur de score ou liste de signaux.
C’est important, car Internet regorge de chiffres qui semblent précis : pourcentage de pages récupérées finalement citées, effet multiplicateur de certains éléments de structure, nombre de domaines référents nécessaires. Ces données proviennent presque toujours de fournisseurs d’outils SEO et GEO qui mesurent des corrélations dans leurs propres échantillons. Ce ne sont pas des informations communiquées par OpenAI, et plusieurs articles se contentent de reprendre les chiffres des autres. Utilisez-les comme des hypothèses à tester, pas comme des règles.
Une affirmation récurrente — selon laquelle la recherche ChatGPT s’appuierait sur l’index de Bing — n’est pas non plus confirmée dans les pages d’OpenAI que j’ai consultées. Vérifier votre site dans Bing Webmaster Tools ne prend que quelques minutes : c’est donc une précaution peu coûteuse. Mais ne construisez pas votre stratégie sur cette hypothèse comme s’il s’agissait d’un fait.
Comment rédiger des pages faciles à citer
La sélection n’étant pas documentée, cette section reflète mon analyse et non la politique d’OpenAI. Le raisonnement est simple : un système qui compose une réponse à partir de pages récupérées a besoin d’un passage qu’il puisse reprendre sans le réécrire. Facilitez-lui la tâche.
- Répondez d’abord. Placez la réponse directe dans les deux premières phrases sous chaque titre, puis apportez les nuances.
- Une question par H2. Formulez le titre comme une question que poserait un lecteur, afin que chaque section puisse être comprise seule et citée facilement.
- Soyez précis et datez vos informations. Les versions, les chiffres et une date visible donnent à un passage des éléments qu’une page générique ne peut pas égaler.
- Utilisez des tableaux pour les comparaisons. Un tableau est sans ambiguïté pour un analyseur et rapide à consulter pour un humain.
- Indiquez l’auteur et citez des sources primaires. Cela rend la page vérifiable, ce qui constitue le fondement de la confiance pour tout lecteur, humain ou machine.
- Gardez le contenu dans le HTML. Si la réponse n’apparaît qu’après l’exécution de JavaScript ou derrière une connexion, un robot d’exploration risque de ne jamais la voir.
Remarquez ce qui manque : les astuces. Aucun schéma, fichier ou formulation n’est documenté comme pouvant forcer une citation. Si vous préférez ne pas gérer vous-même l’accès des robots, les règles de pare-feu et la structure des pages, ce sont précisément les sujets couverts par le service SEO, AEO et GEO de Netalith.
Comment suivre le trafic provenant de ChatGPT
OpenAI indique que les sites qui autorisent OAI-SearchBot peuvent mesurer les visites générées, car ChatGPT ajoute utm_source=chatgpt.com aux liens qu’il envoie. Dans Google Analytics, filtrez les sessions dont la source est chatgpt.com, puis comparez les pages d’arrivée avec celles que vous pensiez voir citées.
Considérez ces données comme votre boucle de rétroaction. Vous ne pouvez pas voir directement les citations, mais vous pouvez identifier les URL qui ont généré un clic. Faites le point chaque semaine, et non chaque jour, compte tenu du délai de 24 heures pour les changements concernant les robots et de la variabilité des réponses d’une requête à l’autre.
llms.txt ou les données structurées aident-ils à être cité par ChatGPT ?
Aucun de ces deux éléments n’apparaît dans la documentation d’OpenAI que j’ai consultée comme un facteur de la recherche ChatGPT. Les données structurées ont une utilité bien établie pour les fonctionnalités de recherche traditionnelles, et un fichier llms.txt est peu coûteux à publier : aucun des deux n’est donc une mauvaise idée. Ne vous promettez pas, ni à un client, une citation ChatGPT en échange. Quiconque vend cette garantie vend quelque chose qu’OpenAI n’a pas documenté.
Un ordre des opérations réaliste
- Vérifiez qu’OAI-SearchBot est autorisé dans robots.txt et qu’il n’est pas bloqué par le pare-feu.
- Décidez séparément du traitement de GPTBot, selon que vous acceptez ou non l’utilisation de vos contenus pour l’entraînement.
- Attendez environ 24 heures, puis vérifiez dans les journaux du serveur la présence d’OAI-SearchBot.
- Réécrivez vos meilleures pages afin que chaque section réponde à une question dans ses deux premières phrases.
- Suivez chaque semaine les visites provenant de utm_source=chatgpt.com et comparez-les aux pages que vous avez réécrites.
Si vous souhaitez un regard extérieur sur les étapes 1 à 3, l’Audit + Roadmap à 20 $ de Netalith vérifie l’accès des robots à votre site et fournit une liste de corrections prioritaires sous 24 à 48 heures. Sources de cet article : FAQ d’OpenAI pour les éditeurs et les développeurs et présentation des robots d’exploration d’OpenAI.
FAQ
Questions fréquentes
Tous les sites web peuvent-ils être cités par ChatGPT ?
OpenAI indique que tout site web public peut apparaître dans la recherche ChatGPT. Pour figurer dans les résumés et les extraits, vous devez ne pas bloquer OAI-SearchBot. L’apparition n’est toutefois pas garantie, et OpenAI ne publie pas la méthode de sélection des sources.
Le blocage de GPTBot empêche-t-il ChatGPT de citer mon site ?
Non. GPTBot concerne l’entraînement des modèles, tandis qu’OAI-SearchBot concerne la recherche. Il s’agit de deux contrôles robots.txt distincts : vous pouvez donc interdire GPTBot tout en autorisant OAI-SearchBot.
Combien de temps après une modification de robots.txt ChatGPT la prendra-t-il en compte ?
OpenAI indique que ses systèmes de recherche peuvent mettre environ 24 heures à s’adapter après une mise à jour de robots.txt. Attendez donc au moins un jour avant d’évaluer le changement.
Comment voir le trafic provenant de ChatGPT dans les outils d’analyse ?
ChatGPT ajoute utm_source=chatgpt.com aux liens de provenance pour les sites qui autorisent OAI-SearchBot. Filtrez cette source dans Google Analytics ou dans tout outil qui lit les paramètres UTM.
llms.txt ou les données structurées garantissent-ils une citation par ChatGPT ?
Non. OpenAI ne documente aucun de ces éléments comme un facteur de la recherche ChatGPT. Ils peuvent être utiles pour d’autres raisons, mais aucun ne permet de garantir une citation.
Une page que j’ai bloquée peut-elle quand même apparaître dans ChatGPT ?
C’est possible. OpenAI indique qu’il peut afficher uniquement le lien et le titre d’une page interdite s’il en découvre l’URL ailleurs. Utilisez une balise meta noindex et laissez la page accessible à l’exploration afin que cette balise puisse être lue.