Ce que les fan-out queries de ChatGPT nous apprennent sur votre visibilité IA
Édouard Gonet
18 août 2026
ChatGPT ne cherche plus au hasard : il cible ses recherches sur des sites qu'il juge déjà fiables, via l'opérateur site:. Ce que révèle l'analyse de Lily Ray, et ce que ça change pour votre marque.
TLDR. ChatGPT ne fouille plus le web au hasard. Quand il cherche, il découpe votre question en plusieurs recherches parallèles (les « fan-out queries »), et il les cible de plus en plus avec l'opérateur site: sur des sources qu'il juge déjà fiables : sites officiels des marques, domaines .gov, Reddit, plateformes d'avis établies. D'après l'analyse de Lily Ray, cet opérateur site: fonctionne (au moins en partie) comme un filtre anti-spam, une version ChatGPT du E-E-A-T de Google. La conséquence est directe pour vous : si votre marque n'apparaît pas dès la première recherche interne de ChatGPT, vous n'entrez presque jamais dans la réponse finale. La limite, à garder en tête : ce filtrage se trompe encore parfois de domaine, un vrai risque pour les marques peu établies.
J'ai lu récemment un long article de Lily Ray qui rassemble, en un seul endroit, ce que plusieurs chercheurs du SEO et de l'AI search ont mesuré ces derniers mois sur le fonctionnement interne de ChatGPT. Le sujet est au cœur de ce qu'on construit avec Topya, alors je voulais le résumer et vous dire ce que j'en retiens concrètement.
Les « fan-out queries », c'est quoi
Toutes les questions posées à ChatGPT ne déclenchent pas une recherche web. Ce qui est dans ses données d'entraînement, il peut y répondre directement, sans aller chercher (et c'est moins cher pour OpenAI, donc les modèles gratuits ont tendance à le faire plus souvent). Mais dès que la question demande de l'information fraîche ou vérifiable, ChatGPT passe en mode recherche (le fameux RAG).
À ce moment, il ne lance pas une seule requête. Il décompose votre question en plusieurs recherches d'arrière-plan, les « fan-out queries », qu'il exécute en parallèle, puis il synthétise une réponse à partir de ce qui revient. Chaque mot qu'il met dans ces requêtes, et chaque opérateur qu'il utilise, nous dit ce qu'il cherche et où il s'attend à le trouver. C'est la fenêtre la plus honnête qu'on ait sur le raisonnement du modèle.
« Récupéré » n'est pas « cité »
Une distinction essentielle, souvent confondue. Une page « récupérée » (retrieved) est une page que ChatGPT est allé chercher pendant ses fan-out queries. Une page « citée » (cited) est une page qui finit visible dans la réponse, sous forme de lien. Les deux évoluent en sens inverse : le nombre de pages récupérées augmente, mais le nombre de domaines uniques réellement cités par réponse diminue. Plus de pages sont considérées, moins sont créditées.
Le vrai changement : site: partout
C'est le point qui m'a le plus marqué. Depuis quelques mois, ChatGPT lance beaucoup plus de recherches par question, et il les cible massivement avec l'opérateur site:. Quelques chiffres tirés de l'article, avec leurs sources :
- David Konitzny (Peec AI), le jour où ChatGPT 5.6 est devenu le modèle par défaut : la part des questions ne générant qu'une seule fan-out query est tombée de 94 % à 43,5 %, les sources récupérées ont à peu près doublé (d'environ 12 à 24), et l'opérateur
site:est passé d'environ 0,3 % à 23 % des fan-outs. - Chris Long (Nectiv), sur environ 4 000 prompts : les fan-out queries par prompt sont passées de 2,17 à 7,61, et
site:apparaît dans 64 % des requêtes. Les mots « site: », « official » et « gov » ressortent en tête. - Olivier de Segonzac (Resoneo) confirme dans l'autre sens : les domaines uniques cités par réponse ont baissé (de 19 à 15 après une mise à jour).
L'écart entre 23 % et 64 % s'explique surtout par la méthode de collecte (via l'API d'OpenAI pour l'un, via l'interface grand public pour l'autre). Peu importe le chiffre exact : la tendance est nette, site: explose. Autre signal intéressant relevé par Peec AI, les pages produit passent devant les listicles. Autrement dit, ChatGPT va de plus en plus directement chez la marque pour les prix et les specs, au lieu de tout faire transiter par des articles « top 10 » souvent auto-promotionnels.
La thèse : site: comme filtre anti-spam
L'idée que défend Lily Ray, et que je trouve convaincante : juger la qualité d'une page inconnue en temps réel, à l'échelle de ChatGPT (des centaines de millions de fois par jour), c'est cher et difficile. Restreindre ses recherches à des domaines déjà connus et fiables est une façon beaucoup moins coûteuse d'obtenir presque le même résultat. Plutôt que d'évaluer si une page vaut la peine, le modèle contourne le problème : il ne va chercher que là où il fait déjà confiance.
Et le routage est logique : les faits vont sur le domaine officiel de la marque, les questions santé ou juridiques vers les sites .gov, les opinions vers Reddit et les plateformes d'avis. C'est une version distillée, « façon ChatGPT », de ce que Google a mis des années à construire avec le E-E-A-T (expérience, expertise, autorité, confiance).
Le point le plus important pour votre marque : ChatGPT décide avant de chercher
Si vous ne devez retenir qu'une chose, c'est celle-là. En analysant le trafic réseau, Suganthan Mohanadasan a montré que ChatGPT met souvent des noms de marques dans sa toute première fan-out query, alors que l'utilisateur ne les a jamais cités. À la question « la meilleure app de prise de notes IA », la première requête contenait déjà Granola, Notion AI, Otter, Fireflies, etc.
Et voici le chiffre qui compte : une marque présente dans la fan-out query est citée dans la réponse 68,9 % du temps, contre 2,1 % pour une page seulement récupérée. Au total, environ 3,1 % des pages récupérées finissent dans une réponse. Le vrai jeu n'est donc pas d'optimiser une page : c'est d'être la marque à laquelle le modèle pense en premier, avant même de chercher.
« Official » : un mot qui monte
Le mot « official » revient de plus en plus dans les fan-out queries. ChatGPT cherche activement la source officielle d'une marque ou d'un produit. Ça vaut le coup de vérifier si « Site officiel » a sa place dans votre balise title ou votre meta description (sans en abuser), surtout si votre nom est partagé avec d'autres entités. C'est aussi la meilleure défense contre le problème suivant.
Les limites (parce qu'il y en a)
Je ne veux pas survendre ce filtrage, il a de vraies failles. Malte Landwehr et Netcraft ont montré que, quand ChatGPT hésite sur le bon domaine d'une marque, il le devine, et il se trompe parfois. Dans un cas, il cherchait site:census.com pour la startup Census, dont le vrai site est getcensus.com (et census.com est un domaine parké, achetable). L'étude Netcraft a trouvé qu'environ un tiers des liens de connexion générés par les LLM pointaient vers des domaines que la marque ne possédait pas. Le risque concret : quelqu'un achète le domaine parké, y met de faux prix ou un faux numéro de support, et ChatGPT le sert comme source « officielle ».
Deuxième nuance honnête : ce resserrement pourrait être autant une question de coût et de latence que de qualité. Vérifier une courte liste de domaines connus est simplement plus rapide. Vu de l'extérieur, ça ressemble à un filtre qualité, mais ce n'est pas forcément l'intention première. Bref, OpenAI progresse clairement vers des réponses de meilleure qualité, mais on est encore loin de la sophistication de Google.
Ce que j'en fais concrètement (et vous aussi)
- Construire la notoriété de la marque jusqu'à être celle à laquelle le modèle pense en premier. C'est là que pointe toute la donnée. Ça se gagne avec des avis, des comparatifs, des relations presse, de la couverture média, sur la durée, pas avec des astuces techniques.
- Mettre vos faits clés en HTML lisible sur votre propre domaine : prix, specs, références, contacts. Si ChatGPT lance
site:votremarque.com, il faut que ce soit du texte crawlable, pas une image ni du JavaScript rendu côté client. - Verrouiller votre domaine officiel et le renforcer partout, surtout si vous êtes une marque récente ou au nom ambigu.
- Prendre Reddit au sérieux : le modèle y va pour les opinions. Attention, il jette la plupart des pages Reddit récupérées, mais il les récupère tellement que Reddit reste en tête des domaines cités. À voir comme ce qui façonne la compréhension de votre catégorie par le modèle, pas comme une source de citation fiable. Et surtout, pas de faux avis : Reddit supprime désormais des milliers de posts spam par jour.
- Arrêter de courir après chaque fan-out query individuelle. Elles sont longue traîne et instables. Mieux vaut agréger les requêtes récurrentes pour trouver les sujets que le modèle priorise systématiquement, et suivre son classement sur ces sujets.
- Vérifier si vous êtes seulement dans la requête. Lancez cinq fois les prompts qui vous importent et regardez si votre marque apparaît dans les recherches initiales de ChatGPT, pas seulement dans la réponse. Si elle n'apparaît jamais, vous avez du travail de notoriété.
Le rapport avec Topya
C'est exactement pour ça qu'on a construit Topya. On mesure, catégorie par catégorie, quelles marques les IA recommandent réellement. Parce que si votre marque n'est pas dans cette première fan-out query, elle n'existe pas pour l'IA, quelle que soit la qualité de votre site. Nos classements vous montrent où vous en êtes face à vos concurrents, qui gagne du terrain et qui en perd, sur de la data plutôt que sur des avis sponsorisés. C'est le premier pas pour savoir sur quoi travailler.
Source
Cet article résume et commente l'analyse de Lily Ray, « What We Can Learn from Evolving ChatGPT Fan-Out Queries » (août 2026), qui compile les travaux de David Konitzny (Peec AI), Chris Long (Nectiv), Olivier de Segonzac et l'équipe Resoneo, Suganthan Mohanadasan, Malte Landwehr, Netcraft, Dan Petrovic et les données de citations d'Ahrefs. Les chiffres cités appartiennent à leurs auteurs respectifs.