Référencement dans les IA : ce que 45 études établissent vraiment, et ce que le marché vous vend quand même
§ Performance & TechNouveau

Référencement dans les IA : ce que 45 études établissent vraiment, et ce que le marché vous vend quand même

Un marché entier s’est construit sur un chiffre : jusqu’à 40 % de visibilité en plus dans les IA. Le 15 juillet 2026, la première revue scientifique critique du domaine a passé 45 études au crible et rendu un verdict inconfortable : ce chiffre décrit une expérience de laboratoire, aucune technique ne démontre d’effet stable sur la découverte réelle, et les IA qui reconnaissent 99,4 % des marques n’en recommandent spontanément que 3,32 %. ELMARQ, qui vend de la mesure de visibilité IA, publie l’étude qui critique sa propre catégorie.

Marc Lugand-Sacy08.08.202610 min de lecture2 208 mots
§ À retenir4 points clés
  1. 01

    Un marché entier s’est construit sur un chiffre : jusqu’à 40 % de visibilité en plus dans les réponses des IA.

  2. 02

    Tout part d’un article présenté à la conférence KDD en 2024.

  3. 03

    Ses auteurs y inventent le terme Generative Engine Optimization et testent neuf stratégies de réécriture sur 10 000 requêtes.

  4. 04

    Le résultat passé à la postérité : jusqu’à 40 % de visibilité en plus. avéré

Salle d'analyse : chercheurs dépouillant 45 études de référencement dans les IA, tableaux des sources par moteur (ChatGPT, Perplexity, Gemini), affiches PEER REVIEWED, PREPRINT, 99,4 % marque nommée contre 3,32 % non nommée, +40 % de visibilité et preuve insuffisante
© ELMARQ · Illustration éditoriale

Un marché entier s’est construit sur un chiffre : jusqu’à 40 % de visibilité en plus dans les réponses des IA. Le 15 juillet 2026, la première revue scientifique critique du Generative Engine Optimization a passé 45 études au crible, de novembre 2023 à juillet 2026, et rendu un verdict que peu d’acteurs du secteur ont envie de traduire en français : le chiffre fondateur décrit une expérience de laboratoire, aucune technique recensée ne démontre d’effet stable et durable sur la découverte organique, et les moteurs d’IA qui reconnaissent la quasi-totalité des marques n’en recommandent spontanément qu’une infime fraction. Voici ce que la science établit, ce qu’elle infirme, et les dix questions à poser avant de dépenser un euro en visibilité IA.

Le document s’intitule Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization. Son auteur, Olivier Martinez, y recense 45 études, articles relus par les pairs, papiers acceptés en conférence, travaux d’ateliers et preprints, chacun pesé selon la solidité de sa méthode. avéré C’est le premier audit académique d’un domaine né en novembre 2023 et devenu, en trente mois, un marché mondial de prestations, d’outils et de promesses. La revue est elle-même un preprint non encore relu par les pairs : cet article applique donc à chaque chiffre le statut de son étude d’origine, exactement comme elle le recommande.

Le chiffre fondateur était vrai, sa lecture commerciale ne l’est pas

Tout part d’un article présenté à la conférence KDD en 2024. Ses auteurs y inventent le terme Generative Engine Optimization et testent neuf stratégies de réécriture sur 10 000 requêtes. Le résultat passé à la postérité : jusqu’à 40 % de visibilité en plus. avéré

Ce que la lecture commerciale du chiffre omet systématiquement, c’est le dispositif. Les cinq documents sources sont déjà fournis au modèle. Le gain mesuré, un score de part de réponse pondérée par la position qui passe de 19,3 à 27,2 avec l’ajout de citations, soit environ 41 % en relatif, décrit donc ce qui arrive à une page que le moteur a déjà retenue. Il ne dit rien de la probabilité d’être retenu, rien du trafic, rien des conversions. avéré La revue classe d’ailleurs l’affirmation selon laquelle le GEO augmente la visibilité de 40 % dans une catégorie explicite : rejetée comme affirmation générale. Le chiffre est un maximum relatif, sur une métrique, dans une configuration.

Détail plus dérangeant encore pour les vendeurs de recettes : dans ce même banc d’essai, la visibilité est une part de gâteau qui somme à 100. Quand la cinquième source gagne 115 % avec une stratégie de citation, la première en perd 30. avéré Le GEO tel que mesuré en laboratoire n’est pas une création de valeur : c’est une redistribution. Ce que l’un gagne, l’autre le perd.

La visibilité IA n’est pas un rang, c’est une météo

Deuxième démolition, plus structurelle : l’idée même d’un classement dans les IA. Un audit mené sur quatre moteurs pendant 45 jours mesure la stabilité des sources citées d’un jour à l’autre : le recouvrement se situe entre 0,34 et 0,42 sur une échelle de 1, y compris pour des mesures répétées à moins de 24 heures d’intervalle. Les auteurs recommandent sept à huit répétitions par requête pour obtenir une estimation exploitable. probable Plus frappant : dans leur configuration, 57,8 % des interrogations de ChatGPT n’ont tout simplement pas déclenché de recherche web. Une part de citations calculée sur les seules réponses qui citent est donc un indicateur truqué par construction. probable

Les travaux relus par les pairs confirment. Sur 4 706 requêtes testées aux États-Unis et en Allemagne, les pages citées par les AI Overviews de Google ne se recouvrent qu’à 18 % à deux mois d’écart, contre 45 % pour les résultats organiques classiques ; et même à température zéro, relancer la même requête change 9 à 28 % des décisions. avéré Quiconque vous présente un score de visibilité IA mesuré une fois, un jour donné, sur un moteur, vous vend une photographie de nuage.

Il n’existe pas de classement IA global

Troisième enseignement : les moteurs ne citent pas le même web. Un audit de 2024 relevait déjà que Bing Chat et Perplexity ne partageaient que 26 % de leurs domaines cités. avéré Les mesures de 2026 enfoncent le clou : 53 % des domaines cités par les AI Overviews n’apparaissent pas dans le top 10 organique de Google, 27 % sont absents du top 100 avéré, et la similarité entre les sources de Google organique, des AI Overviews et de Gemini se situe entre 0,11 et 0,18. probable

La conséquence pratique est immédiate : être visible dans ChatGPT ne dit rien de Perplexity, qui ne dit rien de Gemini. Toute stratégie et toute mesure doivent nommer le moteur, le mode de recherche et la période. Être bien référencé dans les IA, au singulier, est une phrase qui n’a pas de référent.

Être cité n’est pas être fiable, ni même être lu correctement

La revue rappelle une donnée fondatrice trop vite oubliée : dès 2023, sur quatre moteurs génératifs, seules 51,5 % des phrases vérifiables étaient entièrement soutenues par leurs sources, et 74,5 % des citations soutenaient réellement l’affirmation à laquelle elles étaient accrochées. avéré En 2026, un suivi longitudinal des AI Overviews classe environ 11 % de 98 020 affirmations atomiques comme insuffisamment soutenues probable, et un audit distinct estime qu’environ 16 % des pages textuelles récupérées et classées par un détecteur étaient elles-mêmes générées par IA. probable

Autrement dit : une marque peut être citée pour une affirmation que sa page ne soutient pas, citée négativement, ou citée aux côtés de sources synthétiques. Maximiser la citation sans contrôler la fidélité, c’est optimiser une décoration.

Le gouffre entre notoriété et découverte

La donnée la plus opérationnelle de tout le corpus tient en deux pourcentages. Sur 112 startups testées, ChatGPT reconnaît 99,4 % des produits quand on les nomme. Mais quand on lui pose la question en intention d’achat, sans nommer personne, il ne les fait remonter que dans 3,32 % des cas. Perplexity passe de 94,3 % à 8,29 %. probable L’étude est un preprint isolé, sur deux modèles : le chiffre exact bougera. La structure du phénomène, elle, est corroborée par le reste du corpus : encoder une marque dans un modèle, ou la retrouver quand on la nomme, n’implique en rien la recommander pour une intention générique.

C’est le gouffre entre notoriété et découverte. Et c’est lui, pas le mythe des 40 %, qui devrait structurer toute stratégie de visibilité IA : la question n’est pas de savoir si l’IA vous connaît, ce à quoi la réponse est presque toujours oui, mais si l’IA vous propose quand le client ne vous nomme pas, ce à quoi la réponse est presque toujours non.

Ce qui tient, ce qui ne tient pas

Le tableau des leviers dressé par la revue est d’une netteté rare. Deux facteurs dominent partout : la pertinence réelle du contenu par rapport à la question posée, et la position du document dans le contexte du moteur. avéré Une expérience factorielle de 252 000 essais sur six modèles confirme que ces deux variables déterminent la première citation davantage que toutes les réécritures. probable Viennent ensuite, avec un soutien modéré, les preuves extractibles : chiffres vérifiables, définitions, comparaisons, dates, références, à condition qu’elles soient vraies et pertinentes pour l’intention. Le bourrage de mots-clés est nul ou négatif. Le ton autoritaire, sans preuve, est instable. avéré

Quant aux recettes génériques, le benchmark le plus dur du corpus, présenté à NeurIPS 2025, a testé 54 combinaisons méthode-domaine sur environ 1 900 requêtes : trois seulement produisent un gain significatif, aucune en questions-réponses, et les gains s’érodent à mesure que les concurrents adoptent les mêmes techniques. avéré Pire : un environnement de test qui réintègre les étapes amont montre qu’optimiser le corps d’une page pour la citation peut réduire sa présence dans le top 20 de la recherche d’environ 9 %, sa présence après reclassement de 16 %, et sa citation finale de 6 %. probable Une réécriture qui plaît au générateur peut rendre la page moins trouvable. Le remède peut littéralement aggraver le mal.

Et le trafic, l’argument de vente ultime ? Une seule étude de logs existe : les référencements ChatGPT du site traité ont été multipliés par 5,7, mais les pages non traitées avaient déjà été multipliées par 3,5 par la simple croissance de la plateforme. L’effet net estimé, 1,82, ne survit pas au test placebo (p = 0,16). probable À ce jour, aucune étude académique ne démontre qu’une technique de GEO produit du trafic ou des conversions de façon causale et durable. Toute promesse de retour sur investissement chiffré excède l’état de la science.

La manipulation est réelle, et elle définit la frontière

Le même canal qui permet d’améliorer une page permet de subvertir un moteur. Des travaux présentés à ICLR 2025 montrent qu’une manipulation de préférence peut faire passer le taux de recommandation d’un produit fictif de 34 % à 59,4 %, et multiplier par 7,2 la sélection de certains plugins. avéré La revue propose quatre tests pour tracer la frontière entre optimisation légitime et manipulation : les faits restent-ils vrais, les preuves sont-elles vérifiables, le document informe-t-il le lecteur au lieu de donner des instructions cachées au modèle, l’intention commerciale est-elle divulguée. avéré Ces quatre tests devraient être annexés à tout contrat de prestation de visibilité IA. Ils sont la seule ligne qui sépare le conseil de la pollution informationnelle.

Les dix questions à poser avant d’acheter de la visibilité IA

Un prestataire sérieux répond aux dix sans se froisser. Un vendeur de recettes trébuche dès la troisième.

Ce que cette revue condamne, et ce qu’elle valide

Ce qu’elle condamne : les recettes universelles, les scores mesurés une fois, les promesses de trafic, les classements IA globaux, et le chiffre des 40 % brandi hors de son laboratoire. Ce qu’elle valide tient en une recommandation qu’elle qualifie elle-même de conservatrice : produire des pages réellement pertinentes, complètes, vérifiables, clairement structurées et techniquement accessibles, puis mesurer séparément la récupération, la citation et la fidélité, en répétant les mesures dans le temps. Elle note aussi qu’un écosystème de mentions tierces, la presse, les sources indépendantes, semble compter davantage qu’une page isolée, même si la causalité reste à établir. possible

Pour ELMARQ, cette revue est un juge de paix que nous accueillons volontiers, parce qu’elle décrit notre pratique : le Score SOM est publié avec ses prompts, ses modèles, son nombre de répétitions et ses limites, sans promesse de trafic ; et notre travail de fond, l’autorité par les sources primaires, la presse et les contenus vérifiables, est précisément ce que le corpus identifie comme les seuls leviers robustes. La science ne vient pas de tuer la visibilité IA. Elle vient de tuer les raccourcis. Il reste le travail, et la mesure honnête du travail. C’est une excellente nouvelle pour tous ceux qui n’ont jamais vendu autre chose.

ELMARQ mesure la présence des marques et des territoires dans les réponses des moteurs d’IA selon un protocole publié avec ses prompts, ses modèles, ses répétitions et ses limites, et construit leur autorité par les sources, jamais par les recettes. Voir aussi notre enquête sur la preuve dans les projets IA des collectivités et le SOM Checker.

Pour aller plus loin, ELMARQ est l'agence GEO qui mesure et fait progresser votre Generative Engine Optimization : Score SOM, dix facteurs, suivi mensuel.

§ Questions fréquentes

Ce qu'il faut comprendre

Qu'est-ce que le GEO (Generative Engine Optimization) ?

L'ensemble des techniques visant à augmenter la présence, la citation ou l'influence d'un contenu dans les réponses des moteurs d'IA comme ChatGPT, Perplexity, Gemini ou les AI Overviews de Google. Le terme a été créé par un article académique présenté à la conférence KDD en 2024.

Le GEO augmente-t-il vraiment la visibilité de 40 % ?

Non, pas au sens où le marché l'entend. Le chiffre provient d'une expérience où les cinq documents sources sont déjà fournis au modèle : il mesure un gain relatif maximal sur une métrique de part de réponse, pas un effet sur la découverte réelle, le trafic ou les ventes. La revue critique de 2026 classe cette affirmation généralisée comme rejetée.

Que démontre la revue scientifique de juillet 2026 sur le GEO ?

Sur 45 études analysées : un contenu déjà retenu par le moteur peut influencer la réponse, la pertinence et la position dominent tous les autres leviers, les recettes génériques se transfèrent mal (trois cas positifs sur 54 testés dans le benchmark le plus rigoureux), et aucune technique ne démontre d'effet causal stable sur la découverte organique ni sur le trafic.

Pourquoi la visibilité dans les IA est-elle instable ?

Parce que les moteurs ne citent pas le même web (recouvrements mesurés entre 11 et 26 % selon les paires), varient d'un jour à l'autre (18 % de recouvrement des pages AI Overviews à deux mois d'écart) et changent 9 à 28 % de leurs décisions même à température zéro. Une mesure sérieuse exige des répétitions, des reformulations, plusieurs dates et plusieurs moteurs.

Une IA qui connaît ma marque va-t-elle la recommander ?

Presque jamais spontanément. Une étude sur 112 startups mesure 99,4 % de reconnaissance quand la marque est nommée, mais 3,32 % de présence dans les requêtes de découverte sans nom de marque. La notoriété dans le modèle et la recommandation pour une intention générique sont deux phénomènes distincts.

Comment choisir un prestataire de visibilité IA ?

En posant dix questions : moteurs et dates mesurés, répétitions et reformulations, traitement des réponses sans citation, découverte organique ou citation conditionnelle, dénominateurs, vérification de la fidélité des citations, effet de l'adoption concurrente, préservation des faits et du référencement classique, lien démontré avec le trafic, publication du protocole. Un prestataire sérieux y répond sans se froisser.

§ Sources

Références citées

Références primaires de cette analyse. Les sources disposant d'une adresse publique sont liées directement, pour que chaque affirmation puisse être remontée à son émetteur.

  1. 01
    Olivier Martinez, Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026), arXiv 2607.14035, 15 juillet 2026 : source principale, revue de 45 études, lue intégralement, chaque chiffre porte le statut de son étude d'origine
  2. 02
    Aggarwal et al., GEO: Generative Engine Optimization, KDD 2024 : article fondateur, score pondéré de 19,3 à 27,2 (environ 41 % relatif) avec cinq documents déjà en contexte, redistribution entre sources (cinquième +115 %, première -30 %)
  3. 03
    Puerto et al., C-SEO Bench, NeurIPS 2025 : 54 combinaisons méthode-domaine sur environ 1 900 requêtes, trois seulement significativement positives, aucune en questions-réponses
  4. 04
    Liu et al., Evaluating Verifiability in Generative Search Engines, EMNLP 2023 : 51,5 % de phrases entièrement soutenues, 74,5 % de citations soutenant réellement l'affirmation, sur quatre moteurs génératifs
  5. 05
    Kirsten et al., Characterizing Web Search in the Age of Generative AI, ACL 2026 : 4 706 requêtes, recouvrement AI Overviews de 18 % à deux mois contre 45 % en organique, 9 à 28 % de décisions changées à température zéro, 53 % des domaines hors top 10 organique
  6. 06
    Nestaas et al., Adversarial Search Engine Optimization for LLMs, ICLR 2025 : manipulation de préférence portant la recommandation d'un produit fictif de 34 % à 59,4 %, sélection de plugins multipliée par 7,2
  7. 07
    Preprints 2026 cités avec leur statut : Schulte et al. (stabilité, Jaccard 0,34 à 0,42, 57,8 % sans recherche web, sept à huit répétitions), Sharma (99,4 % de reconnaissance contre 3,32 % de découverte sur 112 startups, ChatGPT), Watanabe et Nakayashiki (trafic multiplié par 1,82, placebo p = 0,16), Allaham et Diakopoulos (environ 16 % de pages générées par IA parmi les sources)
§ À lire ensuite
§ Citer cet article
Référence académique

Lugand-Sacy, Marc (2026). Référencement dans les IA : ce que 45 études établissent vraiment, et ce que le marché vous vend quand même. Journal ELMARQ. https://elmarq.fr/journal/geo-45-etudes-referencement-ia-preuves

PartagerLinkedInTwitter / XEmail
Passons à l'action

Cet article a résonné ?
Parlons de votre marque.

ELMARQ accompagne dirigeants et équipes marketing dans la construction d'une présence de marque durable. Chaque engagement commence par un échange stratégique confidentiel.

ELMARQ · RÉPONSE SOUS 24H · ÉCHANGE CONFIDENTIEL · SANS ENGAGEMENT · RCS PARIS 104 071 139