Que dit Google sur le SEO ? /
SEO DeclarationsLabs SEOComment se faire citer par ChatGPT et les LLM ? Analyse d...

Comment se faire citer par ChatGPT et les LLM ? Analyse de 5 millions de réponses

MVP → LE Podcast SEO / GEO. MVP → LE Podcast SEO / GEO. Publie le 26/08/2026 ⏲ 36:32 Avance

Jacky (Link Garden) a passé au crible 5 millions de réponses ChatGPT, issues d'un million de prompts mensuels observés sur 5 mois. Reddit s'effondre : de 30 % à 5 % des citations. Les fanouts interrogent la formule « meilleur + année + pays », mais recourent aussi à l'opérateur « site: » appliqué à des domaines d'autorité. Entrer dans le dataset demande un an et demi. Une fois obtenues, les citations ne tiennent que 1 à 3 mois. Un site disposant de 5 RD peut être cité 200 fois quand un autre, fort de 200 RD, ne l'est jamais. Aucune différence constatée entre PBN et sites éditeurs. Les LLM restent consensuels, avec un sentiment moyen de +2/9. L'API ChatGPT et ChatGPT Web ne se comportent pas de la même façon.

Rédaction retravaillée

De quoi parle cet échange ?

Jacky, fondateur de Link Garden (plateforme de netlinking) et de l'outil Semnne, livre les résultats d'une analyse quantitative massive, 5 millions de réponses ChatGPT scrapées sur 5 mois à partir d'1 million de prompts lancés mensuellement, pour identifier quels sites sont cités, à quelle fréquence, dans quelles thématiques, et comprendre comment les LLM recommandent. La cible est claire. Praticiens SEO et entrepreneurs qui veulent anticiper le trafic venu des intelligences artificielles conversationnelles.

Cadre de lecture expert

Une hypothèse forte porte tout le raisonnement : le "GEO" (Generative Engine Optimization) fonctionnerait comme le SEO, avec d'autres leviers. Citations sur des sites tiers au lieu des backlinks classiques ; présence dans le dataset d'entraînement plutôt que dans l'index Google. Pour tester la reproductibilité, Jacky classe les prompts selon 700 catégories thématiques issues de la taxonomie IAB, ce qui, au lieu de s'en tenir aux moyennes globales, autorise une lecture secteur par secteur.

Un arbitrage est escamoté : le coût réel d'accès au dataset. Des citations à "10-20 balles" auraient le même effet que des citations à 1500€, dit-il, sans détailler les fournisseurs ni la méthodologie de placement. Second angle mort, la différence de comportement entre utilisateurs gratuits et payants de ChatGPT, alors même que le scraping porte sur la version non-connectée.

Points discutables et avis expert

Selon moi, l'affirmation "faire du SEO = avoir un bon GEO" simplifie excessivement. Si les LLM passent par Google pour leurs fanouts (sous-requêtes), le ranking Google compte, d'accord. Mais Jacky montre lui-même que les LLM tapent "site:" sur des domaines d'autorité précis, ce qui veut dire qu'un site absent des premières positions peut être cité dès lors qu'il figure dans la whitelist interne du LLM. Comment y entre-t-on ? La question reste entière.

Je nuancerais fortement sur Reddit. Le passage de 30% à 5% de citations en 3 mois est présenté comme une baisse générale. Pourtant il précise ensuite qu'"en pré-assurance auto, Reddit est à 3% depuis 5 mois". La chute globale masque donc de fortes disparités sectorielles, et Reddit surperforme peut-être encore sur des niches comme la tech ou le gaming, absentes de son million de prompts "commerciaux".

Mon expérience montre que le délai d'entrée dans le dataset ("1 an et demi") est une moyenne trompeuse. Les knowledge cutoffs de GPT-4 et de Claude diffèrent, quand Gemini rafraîchit certaines catégories, actualités et finance, plus souvent que le reste. Miser uniquement sur les citations pour "rentrer dans le futur dataset" revient à oublier que les LLM peuvent préférer le real-time search à l'inclusion dans le training. La stratégie n'est alors plus du tout la même.

Quelle méthodologie concrète pour analyser 5 millions de réponses ChatGPT ?

Méthode Jacky a converti 1 million de mots-clés SEO à fort volume en prompts utilisateurs via Gemini, avec une consigne de reformulation orientée "usage commercial". Ces prompts partent ensuite sur ChatGPT web (version non-connectée), tous les mois, depuis 5 mois. Soit 5 millions de réponses. Chaque prompt est classé selon la taxonomie IAB, qui compte 700 catégories thématiques (automobile > assurance auto > prêt auto, etc.).

Outil Le scraping passe par ChatGPT web non-connecté, pas par l'API : les résultats diffèrent entre les deux. Pendant plusieurs mois, ChatGPT masquait les fanouts (les sous-requêtes envoyées à Google) pour les comptes non-connectés ; ils sont revenus récemment. L'outil développé en interne s'appelle Semnne, proposé en essai 14 jours, avec accès gratuit pour les clients Link Garden.

Chiffre Sur le million de prompts mensuels, Semnne extrait toutes les entités nommées (marques, noms de rues, personnages, restaurants) par du NER (Named Entity Recognition). Une seconde IA analyse ensuite chaque entité et lui attribue un score de sentiment allant de -9 à +9. La moyenne générale tourne autour de +2. Un "bon score" est +3 ou +4, un mauvais score est -1. Très peu d'entités ressortent négatives : les LLM sont "très consensuels" selon Jacky, probablement pour des raisons juridiques.

Pourquoi Reddit a chuté de 30% à 5% de citations en 3 mois ?

Chiffre Fin 2024 / début 2025, Reddit apparaissait dans environ 80% des réponses ChatGPT selon Jacky ("quelque chose comme 80%", formulation approximative). Au mois de juillet 2025, le taux tombe à 9%, puis autour de 5% en août. Cette moyenne globale masque des disparités, précise-t-il : en assurance auto, Reddit est à 3% depuis 5 mois, donc stable bas.

Opinion Pour Jacky, la baisse traduit une réaction des LLM face au spam SEO : "Dès qu'il y a un truc particulièrement cheaté, particulièrement efficace, les SEO vont commencer à spammer". Les LLM ajusteraient leurs sources pour éviter la sur-représentation d'un site facilement manipulable. Il mentionne aussi un tweet vu au passage, émanant de "gens qui scrappent plusieurs millions de requêtes par jour sur Google", qui annonce la "disparition" de l'opérateur "site:". Ce qui affecterait la capacité des LLM à cibler des domaines d'autorité spécifiques.

À vérifier Ce tweet n'est accompagné d'aucune source ni méthodologie, et l'affirmation "site: va disparaître" semble spéculative. Google pourrait restreindre cet opérateur pour les scrapers automatisés, pas pour les utilisateurs humains.

Combien coûte une citation LLM et combien de temps dure-t-elle ?

Chiffre Jacky observe que "la tendance c'est qu'on nous demande beaucoup de citations qui peuvent coûter 1000, 1500€, 2000€". Il oppose ces citations premium à celles "à 10 balles, 20 balles", qui feraient "le même effet". Aucun fournisseur n'est nommé, ni aucune méthodologie pour obtenir ces citations low-cost.

Vécu Une citation ne dure "pas toujours". Elle peut rester active 1 mois, 2 mois, 3 mois, disparaître, puis revenir. "Dans le temps, c'est assez stable" : sur un même prompt, environ 50 sources tournent, mais chaque recherche n'en fait apparaître que 10 à 15. Les mises à jour des LLM font bouger les sources tous les mois.

Opinion "Les gros médias sont peut-être surcotés", estime Jacky : un site avec 5 referring domains peut être cité 200 fois, quand un site avec 200 RD n'est jamais cité. De quoi penser que l'autorité de domaine classique (DR, DA) n'est pas le facteur déterminant pour les citations LLM.

Qu'est-ce qu'un "fanout" et pourquoi est-ce critique pour le GEO ?

Méthode Le fanout, c'est la façon dont le LLM reformule le prompt utilisateur en sous-requêtes envoyées à Google (ou à son propre index). L'exemple de Jacky : "J'ai fait un cours de judo hier, je suis tombé, je me suis fait mal, je suis allé voir mon médecin, il m'a conseillé du repos, mais j'ai mal quand je dors." Le LLM comprend qu'il faut chercher un nouveau matelas, et le fanout devient : "meilleur matelas mal de dos 2026 France". Judo, escalade ou autre, peu importe : le fanout reste identique.

Chiffre Un prompt se divise en 2 à 5 fanouts en moyenne. Pendant longtemps ("environ un an"), Jacky a vu dominer un même pattern : "meilleur + année + pays", en français ET en anglais. Les LLM cherchent toujours en anglais, en complément de la langue de la requête.

Vécu Les fanouts ont changé récemment : ChatGPT tape désormais "site:domaine.gouv.fr" + mots-clés pour interroger directement des sites d'autorité gouvernementaux ou type Wikipédia. Jacky cite les énergies renouvelables, où le LLM dispose d'une "whitelist" de sites officiels sur lesquels il lance des site: en priorité. "Deux voire trois fanouts sur cinq vont être des site:" selon lui.

À vérifier Jacky dit avoir "remarqué ça depuis un petit moment", sans date précise ni volume de prompts analysés pour cette tendance. Il ajoute que "ça va changer" car Google pourrait retirer l'opérateur site: ; affirmation non sourcée.

Quel est le délai pour entrer dans le dataset d'un LLM et pourquoi ça compte ?

Chiffre Selon Jacky, le dataset des LLM met "entre 1 an et 2 ans" à intégrer de nouvelles données, avec une moyenne d'"1 an et demi de décalage entre l'entrée et la sortie". Il cite Gemini, dont le knowledge cutoff serait "janvier 2025" (à vérifier, il dit "je crois").

Opinion Pour une nouvelle marque créée le 1er janvier 2026, "crois-moi que tu es pas dans le dataset. C'est sûr." L'enjeu des citations est donc double : apparaître dans les résultats avec source, quand le LLM va chercher sur Google, et entrer dans le futur dataset pour les résultats sans source, ceux tirés de la mémoire entraînée du modèle.

Méthode Jacky distingue deux types de réponses ChatGPT : avec source (le LLM a cherché sur le web) et sans source (réponse issue du training). Sur une requête historique type "parle-moi de Louis XIV", ChatGPT ne va pas chercher sur internet ; la réponse est dans le dataset. Sur des requêtes commerciales récentes, il passe par Google. "Selon le mot-clé, selon le jour aussi, tu vas avoir plus de probabilité que ChatGPT aille chercher sur internet ou pas."

À vérifier Le délai de 1 an et demi ne s'appuie sur aucune source OpenAI ou Anthropic. Les cutoff dates varient selon les modèles (GPT-4 Turbo, Claude 3.5, Gemini 1.5) et sont régulièrement mis à jour ; cette moyenne pourrait ne plus être d'actualité.

Les sites "PBN" apparaissent-ils autant que les sites éditeurs dans les LLM ?

Chiffre Jacky montre à son équipe que "nos sites [Link Garden] apparaissent à 30% et les sites éditeurs apparaissent à 30%". Autrement dit : aucune différence de performance entre un réseau de sites propriétaires et des sites tiers dits "éditoriaux".

Opinion "Il y a pas de différence entre un PBN et, entre guillemets soi-disant un PBN... Finalement, quand tu as un site, tu peux en avoir 2000 aujourd'hui. C'est juste le nom qui fait peur." La distinction PBN / site éditeur est dépassée, selon lui : ce qui compte, c'est la présence dans les sources consultées par le LLM, pas le statut du site.

Vécu Link Garden possède "notre propre catalogue de sites, c'est un peu Netflix. On a nos productions et on a aussi les anciens films, on a tous les sites que les autres ont dans toutes les autres plateformes." L'équipe sait "quel site apparaît dans les LLM souvent et d'autres moins souvent", mais cette donnée n'est "pas mise en public" pour l'instant.

Paul Vengeon et les auto-classements : technique qui marchait, puis a cessé de marcher

Vécu Paul (co-animateur du podcast) raconte avoir créé des "auto-classements" sur son site paulvengeon.fr et d'autres. Le principe était simple : "Je faisais un classement, je me mettais moi-même premier" (ex : "Top 10 des agences SEO à Paris"). "À un moment, ça marchait très bien... même des gens me disaient que je ressortais, donc c'était cool. Et après, je voyais bien que ça marchait plus."

Opinion "Ce qu'ils font c'est qu'aujourd'hui, ils savent qu'on triche un peu plus. Donc le premier, ils vont pas forcément le mettre." Son hypothèse : les LLM appliqueraient un "malus" quand c'est "ton propre site qui parle de ta propre marque", car "tu vas utiliser des mots beaucoup plus sympas pour ta marque alors que les autres sont peut-être plus réalistes. Les avis sont peut-être plus intéressants."

À vérifier Où sont les tests quantitatifs qui viendraient confirmer ce "malus" ? Aucun n'est présenté. L'hypothèse se tient, mais elle reste spéculative.

Conor McGregor plus détesté qu'Hitler par les LLM : biais américain des IA

Chiffre Jacky a analysé les scores de sentiment sur "plusieurs millions d'entités nommées" pour isoler les personnages les moins bien notés. Résultat : Conor McGregor a un sentiment plus négatif qu'Hitler. "Celui qui a le score le plus bas c'est Conor McGregor, qui est derrière, enfin qui a un sentiment plus négatif que Hitler."

Opinion "Nous en tant qu'européens, on trouve ça quand même bizarre. Et finalement bah si, bah parce que les IA sont américaines et elles sont programmées d'une certaine façon." Pour lui, c'est un biais culturel : entraînés surtout sur du contenu anglophone américain, les LLM absorbent un volume de contenu négatif sur McGregor (controverses, condamnations) supérieur à celui qui entoure Hitler, traité dans un registre historique et encyclopédique, donc neutre.

À vérifier Ni le score exact, ni le volume de prompts ayant servi à calculer cette moyenne. La comparaison frappe, mais il faudrait une méthodologie détaillée pour la reproduire.

Faut-il se lancer soi-même dans le GEO ou confier à des experts ?

Opinion Jacky recommande de "confier ton GEO à des gens qui savent le faire et qui font de la veille, parce que ça change trop vite". Il insiste : "Il y a des nouveaux modèles tous les jours. Si tu pars un mois de vacances, c'est fini, tu es perdu." Et d'ajouter : "Quelque chose qui était vrai il y a 3 mois, ça l'est plus demain."

Méthode Pour ceux qui veulent quand même se lancer, il conseille de :

  1. Suivre des comptes qui font de la veille (il cite Olivier de Segonzag, actif sur LinkedIn, sans se souvenir du nom exact de son agence)
  2. Faire ses propres tests sur un "site poubelle" où on peut expérimenter sans risque : "J'ai des sites poubelles des années 2010 où tu regardes les backlinks, c'est n'importe quoi, tu regardes les ancres, c'est n'importe quoi... parce qu'on a fait tellement de trucs que le site est tout pété"
  3. Utiliser Twitter/X pour la veille anglophone, LinkedIn pour la veille francophone

À vérifier Aucun compte Twitter/X précis n'est cité, à part "des Anglais qui font pas mal de bon boulot". La recommandation reste générique.

Différence entre ChatGPT API et ChatGPT Web : résultats et sources divergent

Chiffre "Il y a une vraie différence entre ChatGPT API et ChatGPT web, c'est pas les mêmes résultats, c'est pas les mêmes sources." D'où son choix de scraper "directement ChatGPT web non connecté", puisque c'est ce que voient les utilisateurs gratuits. Pendant "quelques mois", les fanouts avaient disparu pour les comptes non-connectés. Ils sont depuis revenus.

À vérifier Pas de comparaison chiffrée API vs Web (% de divergence de sources, écart de ranking). L'affirmation est posée comme un fait d'expérience, sans jamais être quantifiée dans cette discussion.

Link Garden : de freelance solo à 20 personnes, quel parcours ?

Vécu Jacky évoque son passage de "solo, freelance" à une équipe de 20 personnes chez Link Garden, après des débuts comme "éditeur de site". Il travaille "beaucoup de nuit" et échange avec son équipe sur Discord, avec parfois une hésitation avant d'envoyer un message à 3h du matin. "Claude me dit 'Vas-y, c'est l'heure d'aller se coucher' quand il y a trop de monde aux États-Unis qui se réveille."

Opinion Gérer un gros réseau de sites ? "Aujourd'hui c'est facile", affirme-t-il, grâce à l'IA : "Avant l'IA, je pense qu'aujourd'hui c'est facile. On voit sur les éditeurs de site, des gens qui à la base avaient 30 sites, 20 sites, et là aujourd'hui ils sont passés à 300 parce que l'IA est arrivée."

À vérifier Le passage de 20-30 sites à 300 ne s'appuie sur aucun exemple précis, aucun chiffre de coût ou de temps. Derrière la facilité revendiquée se cachent peut-être des investissements techniques (serveurs, automation) dont il n'est jamais question.

Ce que la video ne dit pas

Restent plusieurs angles morts. Jacky ne nomme aucun fournisseur de "citations à 10-20 balles", alors que c'est tout l'argument opposé aux citations premium à 1500€ : impossible de vérifier, encore moins de reproduire. Aucun chiffre de conversion ou ROI n'est donné non plus. Combien de trafic ou de leads génère réellement une citation LLM ? Quelle durée de vie moyenne avant dilution ? La méthodologie de classification IAB en 700 catégories est mentionnée, jamais détaillée : qui classifie, avec quel taux d'erreur ? Quant à la différence API/Web, elle est affirmée mais jamais quantifiée, là où un tableau comparatif aurait aidé. Le discours reste orienté "démonstration de l'outil Semnne" sans entrer dans les limites méthodologiques.

  • Les citations LLM ne durent pas : 1 à 3 mois en moyenne avant disparition temporaire. Un site cité 200 fois en mars peut s'évanouir en avril, puis revenir en juin. Sur un même prompt, une cinquantaine de sources tournent ; 10 à 15 seulement ressortent à chaque recherche.
  • Reddit a chuté de 30% à 5% de citations ChatGPT entre juillet et août 2025. En assurance auto, pourtant, la plateforme reste stable à 3% depuis 5 mois. Les moyennes globales masquent donc de fortes disparités sectorielles.
  • Un site avec 5 referring domains peut être cité 200 fois, tandis qu'un site avec 200 RD n'est pas cité du tout. L'autorité de domaine classique (DR, DA) ne décide rien.
  • Le délai pour entrer dans le dataset d'un LLM est de 1 an à 1 an et demi en moyenne. Une marque créée le 1er janvier 2026 n'entrera pas dans le training de ChatGPT avant mi-2027, ce qui rend les citations indispensables pour apparaître entre-temps dans les résultats avec source.
  • Les fanouts (sous-requêtes) suivent le pattern "meilleur + année + pays" en français ET anglais. Depuis peu, ChatGPT tape aussi "site:domaine.gouv.fr" directement sur des sites d'autorité : 2 à 3 fanouts sur 5 recourent à cet opérateur.
  • Les sites PBN et les sites éditeurs apparaissent à 30% chacun dans les LLM analysés. Aucun écart de performance entre réseau propriétaire et sites tiers. La distinction classique perd son sens.
  • ChatGPT API et ChatGPT Web ne donnent pas les mêmes résultats ni les mêmes sources. Pour refléter l'expérience réelle des utilisateurs, le scraping doit porter sur la version web non-connectée.
  • Le score de sentiment moyen des entités nommées tourne autour de +2 sur une échelle de -9 à +9. Pour des raisons juridiques, les LLM restent "très consensuels", et les entités négatives sont rares. Un bon score se situe à +3 ou +4 ; un mauvais, à -1.
  • Conor McGregor a un sentiment plus négatif qu'Hitler dans les réponses ChatGPT analysées. Le biais culturel américain de l'entraînement apparaît ici en pleine lumière : le volume de contenu négatif récent pèse plus lourd que le contexte historique encyclopédique.
  • Faire du SEO classique reste la base du GEO : si le fanout tape Google, le ranking Google compte. Les LLM entretiennent cependant des whitelists internes de sites d'autorité, si bien qu'un site qui ne range pas peut être cité dès lors qu'il y figure.
  • Les citations à 1500€ et celles à 10-20€ auraient "le même effet" selon Jacky. Ni fournisseur ni méthodologie ne sont révélés pour obtenir ces citations low-cost. L'affirmation reste invérifiable.
  • 1 million de prompts mensuels classifiés en 700 catégories thématiques (taxonomie IAB). On peut alors analyser secteur par secteur quelles sources performent vraiment, au-delà de moyennes globales trompeuses.
  • Combien coûte réellement une citation LLM efficace ?
    Jacky mentionne des citations à 1000-2000€ demandées par les clients, mais affirme que des citations à 10-20€ auraient le même effet. Aucun fournisseur ni méthodologie n'est révélé pour ces citations low-cost. La durée de vie est de 1 à 3 mois avant disparition temporaire.
    Pourquoi Reddit a-t-il chuté dans les citations ChatGPT ?
    De 30% en juillet à 5% en août 2025 selon l'analyse. Jacky attribue cela à une réaction des LLM face au spam SEO : les SEO ont suroptimisé Reddit, les LLM ont ajusté pour éviter la sur-représentation. Mais en assurance auto, Reddit est stable à 3% depuis 5 mois, montrant des disparités sectorielles.
    Qu'est-ce qu'un fanout et pourquoi est-ce stratégique ?
    Le fanout est la reformulation du prompt utilisateur en sous-requêtes envoyées à Google par le LLM. Un prompt long et varié produit souvent le même fanout simple (ex : "meilleur matelas mal de dos 2026 France"). Les fanouts récents utilisent "site:domaine.gouv.fr" pour cibler des sites d'autorité spécifiques.
    L'autorité de domaine (DR, DA) compte-t-elle pour le GEO ?
    Pas nécessairement. Jacky montre qu'un site avec 5 RD peut être cité 200 fois, tandis qu'un site avec 200 RD n'apparaît jamais. Les LLM semblent avoir des whitelists internes de sites d'autorité qui prime sur les métriques SEO classiques.
    Combien de temps pour entrer dans le dataset d'un LLM ?
    Entre 1 an et 1 an et demi en moyenne selon Jacky. Une nouvelle marque créée début 2026 ne sera pas dans le training de ChatGPT avant mi-2027. D'où l'importance des citations pour apparaître dans les résultats avec source en attendant l'inclusion dans le dataset.