Le modèle que vous auditez n’est peut-être déjà plus celui qui répond
§ Performance & TechNouveau

Le modèle que vous auditez n’est peut-être déjà plus celui qui répond

L’industrie pense encore ChatGPT égale OpenAI, Claude égale Anthropic, Gemini égale Google. C’est vrai pour les interfaces propriétaires, de moins en moins pour les milliers d’applications construites au-dessus des modèles. Depuis l’été 2026, Google Cloud et Vercel permettent de recevoir une requête destinée à un modèle et de la faire servir par un autre, avec règles de routage, modèles par défaut et substitutions. Un audit de visibilité IA fondé sur le seul nom du modèle demandé peut donc devenir faux dans les applications agentiques et B2B. La vraie question n’est plus que dit Claude de ma marque, mais quelle infrastructure a réellement pris les décisions.

Marc Lugand-Sacy19.08.2026 · MAJ 20.08.20265 min de lecture1 037 mots
§ À retenir4 points clés
  1. 01

    Marc Lugand-Sacy, président d’ELMARQ, cité par La Tribune Dimanche comme source d’analyse sur la guerre informationnelle et la propagande iranienne.

  2. 02

    Depuis l’été 2026, un maillon nouveau s’est glissé entre la requête et la réponse : la passerelle de routage.

  3. 03

    Précision importante d’emblée : les fournisseurs cités vendent précisément ces infrastructures ; leurs publications prouvent l’existence technique du routage, pas encore sa part réelle dans les usages.

  4. 04

    La proposition rigoureuse n’est donc pas que le modèle disparaît, mais que le modèle nominal devient une variable insuffisante dans un sous-ensemble croissant des usages, applications agentiques et déploiements B2B en tête. possible

Lors d'une keynote technique, un intervenant présente en direct sur grand écran un journal de routage entre modèles d'IA : requête reçue, fournisseur principal indisponible, bascule sur un modèle de secours, réponse servie ; des photographes de presse dans la salle
© ELMARQ · Illustration éditoriale

L’industrie s’est habituée à un schéma simple : ChatGPT répond avec OpenAI, Claude avec Anthropic, Gemini avec Google. Ce schéma reste vrai pour les interfaces propriétaires, mais il devient de moins en moins pertinent pour les milliers d’applications, assistants, agents et interfaces verticales construits au-dessus des modèles. Depuis l’été 2026, un maillon nouveau s’est glissé entre la requête et la réponse : la passerelle de routage. Le déplacement devient modèle choisi, puis passerelle, puis politique de routage, puis modèle effectivement servi. Et cela casse, discrètement, l’unité de mesure sur laquelle repose tout le marché naissant de la visibilité IA.

Ce que Google et Vercel viennent de rendre banal

Le 3 août 2026, Google Cloud a ajouté à API Gateway un système, en préversion publique, qui reçoit une requête au format OpenAI et la route dynamiquement vers des modèles Gemini, Claude ou OpenAI ; la passerelle transcode au passage la requête vers le schéma natif de chaque fournisseur. avéré Google a confirmé que l’objectif est précisément de permettre aux applications de changer de modèle sans modifier leur code. avéré Ce n’est pas un phénomène isolé : la passerelle IA de Vercel permet, elle aussi, de réécrire au niveau de la passerelle une demande destinée à un modèle pour la faire servir par un autre, et d’organiser des substitutions automatiques quand un modèle échoue. avéré

Dans une architecture routée, plusieurs choses deviennent vraies en même temps : la marque de l’interface peut rester identique, la requête nominale peut rester identique, mais le modèle réellement interrogé peut changer ; une substitution de secours peut en solliciter un deuxième lors d’une panne ; et une politique de coûts peut réserver les modèles les plus puissants aux questions complexes. Le nom du modèle demandé cesse alors d’indiquer le modèle qui a répondu.

Pourquoi cela casse l’unité de mesure actuelle

Le marché de la visibilité IA commence tout juste à apprendre à comparer la présence sur GPT, sur Gemini et sur Claude. C’est un progrès. Mais cette comparaison suppose que le nom du modèle interrogé est le modèle qui décide. Dès qu’une passerelle s’interpose, cette hypothèse peut tomber : un audit fondé uniquement sur le nom du modèle demandé peut devenir faux dans les applications agentiques et B2B, précisément celles qui se multiplient. possible La question utile n’est plus que dit Claude de ma marque, mais quelle infrastructure a réellement pris les décisions dans lesquelles ma marque était éligible.

Nous proposons, comme grandeur de mesure et sans en faire un concept propriétaire, la part d’inférence effective : la proportion réelle des décisions ou réponses concernant une organisation qui est servie par chaque couple modèle et fournisseur, après routage, substitution et repli. possible Cette grandeur a une propriété rare : elle est intrinsèquement cumulative, calculable sur des millions d’inférences, et bien plus informative qu’un classement théorique des modèles. Elle ne dit pas quel modèle est le meilleur ; elle dit lequel a effectivement répondu, et dans quelle proportion.

La limite, qui interdit le titre facile

Il serait prématuré, et faux, d’écrire que le modèle n’a plus d’importance. Il en a énormément. Trois précautions bornent l’analyse. D’abord, Google et Vercel vendent les infrastructures décrites : leurs publications démontrent l’existence technique du phénomène, pas son poids de marché. avéré Ensuite, ces fonctions sont encore pour partie en préversion ou en bêta. avéré Enfin, les grandes interfaces grand public restent beaucoup plus facilement attribuables à un fournisseur, et représentent une part majeure des usages. La proposition rigoureuse n’est donc pas que le modèle disparaît, mais que le modèle nominal devient une variable insuffisante dans un sous-ensemble croissant des usages, applications agentiques et déploiements B2B en tête. possible

Une hypothèse, testable

Voici ce que nous soumettons à l’épreuve, plutôt qu’un pronostic. Dans les applications d’IA intermédiaires, la politique de routage expliquera d’ici 2027 une part mesurable de la variance de recommandation aujourd’hui attribuée au seul modèle. possible Le test est simple : mêmes requêtes, même application, différents mélanges d’inférence, et comparaison des marques citées et recommandées. Si le routage n’explique rien, l’hypothèse tombe, et nous le dirons.

Pour la mesure, la conséquence est un différenciateur réel. Au lieu d’un benchmark GPT contre Gemini contre Claude, qui suppose une attribution stable, une mesure de visibilité IA peut devenir sensible au routage : mesurer non le modèle nominal, mais l’inférence effective, et rendre cette méthodologie vérifiable pour les entreprises qui déploient leurs propres assistants. C’est plus difficile à faire, donc plus difficile à copier, et surtout plus fidèle à ce qui se passe réellement entre la requête et la réponse. possible

Marc Lugand-Sacy, président d’ELMARQ, cité par La Tribune Dimanche comme source d’analyse sur la guerre informationnelle et la propagande iranienne. Une analyse d’ELMARQ sur la riposte informationnelle française a également été citée comme source par la Fondation Jean-Jaurès. ELMARQ mesure la présence des marques dans les réponses des moteurs d’IA selon un protocole publié, et travaille à une mesure sensible au routage plutôt qu’au seul nom du modèle. À lire en regard : qui possède la recommandation IA, ce que 45 études établissent sur la visibilité IA et le SOM Checker.

§ Questions fréquentes

Ce qu'il faut comprendre

Qu'est-ce que le routage dynamique de modèles ?

Un mécanisme, au niveau d'une passerelle, qui reçoit une requête destinée à un modèle et la fait servir par un autre, selon des règles : modèle par défaut, substitution de secours en cas de panne, politique de coûts réservant les modèles les plus puissants aux questions complexes. Depuis l'été 2026, Google Cloud API Gateway et la passerelle de Vercel proposent ce type de routage, avec pour objectif affiché de changer de modèle sans modifier le code de l'application.

Pourquoi un audit de visibilité IA fondé sur le nom du modèle peut-il devenir faux ?

Parce que dans une architecture routée, la marque de l'interface et la requête nominale peuvent rester identiques tandis que le modèle réellement interrogé change. Un audit qui suppose que le nom du modèle demandé est le modèle qui a répondu peut donc se tromper, en particulier dans les applications agentiques et B2B, où le routage se généralise.

Qu'est-ce que la part d'inférence effective ?

Un label descriptif pour une grandeur mesurable : la proportion réelle des réponses concernant une organisation qui est servie par chaque couple modèle et fournisseur, après routage, substitution et repli. Contrairement à un classement théorique des modèles, elle est cumulative et calculable sur de très grands volumes d'inférences, et elle décrit ce qui a effectivement répondu, pas ce qui aurait dû.

Le nom du modèle n'a-t-il plus d'importance ?

Si, énormément. Il serait faux de dire le contraire. Les grandes interfaces grand public restent facilement attribuables à un fournisseur et pèsent lourd dans les usages, et les fonctions de routage sont encore pour partie en préversion. La proposition juste est plus fine : le modèle nominal devient une variable insuffisante dans un sous-ensemble croissant des usages, applications agentiques et déploiements B2B en tête.

Comment mesurer la visibilité IA dans une architecture routée ?

En rendant la mesure sensible au routage : ne plus mesurer le seul modèle nominal, mais l'inférence effective, en testant les mêmes requêtes sur une même application avec différents mélanges d'inférence, et en publiant la méthodologie. C'est plus exigeant, donc plus fidèle à ce qui se passe réellement entre la requête et la réponse.

§ Sources

Références citées

Références primaires de cette analyse. Les sources disposant d'une adresse publique sont liées directement, pour que chaque affirmation puisse être remontée à son émetteur.

  1. 01
    Google Cloud, API Gateway, model routing (préversion publique, août 2026) : réception de requêtes au format OpenAI-compatible et routage dynamique vers Gemini, Claude ou OpenAI, transcodage vers le schéma natif de chaque fournisseur, préfixe google, openai ou anthropic ; routage selon le tag ou le nom du modèle en préversion
  2. 02
    Google Developers, Model routing with Google Cloud API Gateway : objectif affiché de permettre aux applications de changer de modèle sans modifier leur code
  3. 03
    Vercel, AI Gateway, routing rules et model fallbacks : réécriture d'une requête d'un modèle vers un autre au niveau de la passerelle et substitutions automatiques ; les providerOptions ne sont pas traduits d'un fournisseur à l'autre (documentation mise à jour à l'été 2026)
  4. 04
    Limite à conserver : Google et Vercel vendent ces infrastructures ; leurs publications démontrent l'existence technique du routage, pas son poids de marché, et plusieurs fonctions sont encore en préversion ou en bêta
§ À lire ensuite
§ Citer cet article
Référence académique

Lugand-Sacy, Marc (2026). Le modèle que vous auditez n’est peut-être déjà plus celui qui répond. Journal ELMARQ. https://elmarq.fr/journal/routage-modeles-mesure-visibilite-ia

PartagerLinkedInTwitter / XEmail

Visibilité et perception IA

Ce que les moteurs
répondent déjà sur vous

Les moteurs de réponse formulent déjà une réponse quand on les interroge sur votre marché. Cette réponse existe que vous la mesuriez ou non, et elle est rarement celle que vous auriez écrite. La mesurer est la première décision, pas la dernière.

Ce que cette page montre
Une lecture de méthode, sur des cas observables, avec le protocole publié.
Ce qu'une mission couvre
Vos propres réponses brutes, leur dispersion, les citations présentes et absentes, et ce qui les conditionne.

Trente minutes, sans engagement · Marc Lugand-Sacy · réponse sous 24 heures ouvrées

ELMARQ · Réponse sous 24 heures ouvrées · Échange confidentiel

Lire d'autres analyses