Aller au contenu
Le modèle que vous auditez n’est peut-être déjà plus celui qui répond
Le Journal ELMARQ ↗Analyse · N°5198
Performance & Tech

Le modèle que vous auditez n’est peut-être déjà plus celui qui répond

L’industrie pense encore ChatGPT égale OpenAI, Claude égale Anthropic, Gemini égale Google. C’est vrai pour les interfaces propriétaires, de moins en moins pour les milliers d’applications construites au-dessus des modèles. Depuis l’été 2026, Google Cloud et Vercel permettent de recevoir une requête destinée à un modèle et de la faire servir par un autre, avec règles de routage, modèles par défaut et substitutions. Un audit de visibilité IA fondé sur le seul nom du modèle demandé peut donc devenir faux dans les applications agentiques et B2B. La vraie question n’est plus que dit Claude de ma marque, mais quelle infrastructure a réellement pris les décisions.

Entrer dans l’analyse
Lors d'une keynote technique, un intervenant présente en direct sur grand écran un journal de routage entre modèles d'IA : requête reçue, fournisseur principal indisponible, bascule sur un modèle de secours, réponse servie ; des photographes de presse dans la salle
© ELMARQ · Illustration éditoriale
En brefLa synthèse de cette analyse

En août 2026, Google Cloud et Vercel ont rendu accessible le routage de modèles : une requête adressée à un modèle peut être servie par un autre, via une passerelle et des bascules de secours. ELMARQ en tire une conséquence de mesure : le modèle que l'on croit interroger n'est pas toujours celui qui répond, et mesurer sa visibilité sur un modèle nommé perd son sens si une passerelle en sert un autre. Le cabinet propose de suivre la part d'inference effective, c'est-à-dire la répartition réelle des réponses entre modèles, plutôt qu'une visibilité déclarée. Le problème : le marché vend des mesures de visibilité par modèle alors que l'infrastructure route en coulisses. La réponse : mesurer le modèle effectivement servi, tout en rappelant que l'existence technique d'un routage ne prouve pas son poids de marché, ces fonctions restant en preview.

À retenir

4 points clés
  1. Depuis l’été 2026, un maillon nouveau s’est glissé entre la requête et la réponse : la passerelle de routage.

  2. Précision importante d’emblée : les fournisseurs cités vendent précisément ces infrastructures ; leurs publications prouvent l’existence technique du routage, pas encore sa part réelle dans les usages.

  3. La proposition rigoureuse n’est donc pas que le modèle disparaît, mais que le modèle nominal devient une variable insuffisante dans un sous-ensemble croissant des usages, applications agentiques et déploiements B2B en tête. possible

  4. L’industrie s’est habituée à un schéma simple : ChatGPT répond avec OpenAI, Claude avec Anthropic, Gemini avec Google.

L’industrie s’est habituée à un schéma simple : ChatGPT répond avec OpenAI, Claude avec Anthropic, Gemini avec Google. Ce schéma reste vrai pour les interfaces propriétaires, mais il devient de moins en moins pertinent pour les milliers d’applications, assistants, agents et interfaces verticales construits au-dessus des modèles. Depuis l’été 2026, un maillon nouveau s’est glissé entre la requête et la réponse : la passerelle de routage. Le déplacement devient modèle choisi, puis passerelle, puis politique de routage, puis modèle effectivement servi. Et cela casse, discrètement, l’unité de mesure sur laquelle repose tout le marché naissant de la visibilité IA.

Ce que Google et Vercel viennent de rendre accessible

Le 3 août 2026, Google Cloud a ajouté à API Gateway un système, en préversion publique, qui reçoit une requête au format OpenAI et la route dynamiquement vers des modèles Gemini, Claude ou OpenAI ; la passerelle transcode au passage la requête vers le schéma natif de chaque fournisseur. avéré Google a confirmé que l’objectif est précisément de permettre aux applications de changer de modèle sans modifier leur code. avéré Ce n’est pas un phénomène isolé : la passerelle IA de Vercel permet, elle aussi, de réécrire au niveau de la passerelle une demande destinée à un modèle pour la faire servir par un autre, et d’organiser des substitutions automatiques quand un modèle échoue. avéré

Dans une architecture routée, plusieurs choses deviennent vraies en même temps : la marque de l’interface peut rester identique, la requête nominale peut rester identique, mais le modèle réellement interrogé peut changer ; une substitution de secours peut en solliciter un deuxième lors d’une panne ; et une politique de coûts peut réserver les modèles les plus puissants aux questions complexes. Le nom du modèle demandé cesse alors d’indiquer le modèle qui a répondu.

Pourquoi cela casse l’unité de mesure actuelle

Le marché de la visibilité IA commence tout juste à apprendre à comparer la présence sur GPT, sur Gemini et sur Claude. C’est un progrès. Mais cette comparaison suppose que le nom du modèle interrogé est le modèle qui décide. Dès qu’une passerelle s’interpose, cette hypothèse peut tomber : un audit fondé uniquement sur le nom du modèle demandé peut devenir faux dans les applications agentiques et B2B, précisément celles qui se multiplient. possible La question utile n’est plus que dit Claude de ma marque, mais quelle infrastructure a réellement pris les décisions dans lesquelles ma marque était éligible.

Nous proposons, comme grandeur de mesure et sans en faire un concept propriétaire, la part d’inférence effective : la proportion réelle des décisions ou réponses concernant une organisation qui est servie par chaque couple modèle et fournisseur, après routage, substitution et repli. possible Cette grandeur a une propriété rare : elle est intrinsèquement cumulative, calculable sur des millions d’inférences, et bien plus informative qu’un classement théorique des modèles. Elle ne dit pas quel modèle est le meilleur ; elle dit lequel a effectivement répondu, et dans quelle proportion.

La limite, qui interdit le titre facile

Il serait prématuré, et faux, d’écrire que le modèle n’a plus d’importance. Il en a énormément. Trois précautions bornent l’analyse. D’abord, Google et Vercel vendent les infrastructures décrites : leurs publications démontrent l’existence technique du phénomène, pas son poids de marché. avéré Ensuite, ces fonctions sont encore pour partie en préversion ou en bêta. avéré Enfin, les grandes interfaces grand public restent beaucoup plus facilement attribuables à un fournisseur, et représentent une part majeure des usages. La proposition rigoureuse n’est donc pas que le modèle disparaît, mais que le modèle nominal devient une variable insuffisante dans un sous-ensemble croissant des usages, applications agentiques et déploiements B2B en tête. possible

Une hypothèse, testable

Voici ce que nous soumettons à l’épreuve, plutôt qu’un pronostic. Dans les applications d’IA intermédiaires, la politique de routage expliquera d’ici 2027 une part mesurable de la variance de recommandation aujourd’hui attribuée au seul modèle. possible Le test est simple : mêmes requêtes, même application, différents mélanges d’inférence, et comparaison des marques citées et recommandées. Si le routage n’explique rien, l’hypothèse tombe, et nous le dirons.

Pour la mesure, la conséquence est un différenciateur réel. Au lieu d’un benchmark GPT contre Gemini contre Claude, qui suppose une attribution stable, une mesure de visibilité IA peut devenir sensible au routage : mesurer non le modèle nominal, mais l’inférence effective, et rendre cette méthodologie vérifiable pour les entreprises qui déploient leurs propres assistants. C’est plus difficile à faire, donc plus difficile à copier, et surtout plus fidèle à ce qui se passe réellement entre la requête et la réponse. possible

Marc Lugand-Sacy est fondateur et président d’ELMARQ. Ses analyses sur la guerre informationnelle ont été citées comme source par La Tribune Dimanche. À lire également : notre méthode de mesure de la visibilité dans les IA.

Méthode qui éclaire ce sujet : Observatoire de la citabilité.

§ Questions fréquentes

Ce qu'il faut comprendre

Qu’est-ce que le routage dynamique de modèles ?

Un mécanisme, au niveau d’une passerelle, qui reçoit une requête destinée à un modèle et la fait servir par un autre, selon des règles : modèle par défaut, substitution de secours en cas de panne, politique de coûts réservant les modèles les plus puissants aux questions complexes. Depuis l’été 2026, Google Cloud API Gateway et la passerelle de Vercel proposent ce type de routage, avec pour objectif affiché de changer de modèle sans modifier le code de l’application.

Pourquoi un audit de visibilité IA fondé sur le nom du modèle peut-il devenir faux ?

Parce que dans une architecture routée, la marque de l’interface et la requête nominale peuvent rester identiques tandis que le modèle réellement interrogé change. Un audit qui suppose que le nom du modèle demandé est le modèle qui a répondu peut donc se tromper, en particulier dans les applications agentiques et B2B, où le routage est désormais proposé.

Qu’est-ce que la part d’inférence effective ?

Un label descriptif pour une grandeur mesurable : la proportion réelle des réponses concernant une organisation qui est servie par chaque couple modèle et fournisseur, après routage, substitution et repli. Contrairement à un classement théorique des modèles, elle est cumulative et calculable sur de très grands volumes d’inférences, et elle décrit ce qui a effectivement répondu, pas ce qui aurait dû.

Le nom du modèle n’a-t-il plus d’importance ?

Si, énormément. Il serait faux de dire le contraire. Les grandes interfaces grand public restent facilement attribuables à un fournisseur et pèsent lourd dans les usages, et les fonctions de routage sont encore pour partie en préversion. La proposition juste est plus fine : le modèle nominal devient une variable insuffisante dans un sous-ensemble croissant des usages, applications agentiques et déploiements B2B en tête.

Comment mesurer la visibilité IA dans une architecture routée ?

En rendant la mesure sensible au routage : ne plus mesurer le seul modèle nominal, mais l’inférence effective, en testant les mêmes requêtes sur une même application avec différents mélanges d’inférence, et en publiant la méthodologie. C’est plus exigeant, donc plus fidèle à ce qui se passe réellement entre la requête et la réponse.

§ Sources

Références citées

Références citées dans cette analyse : documents originaux, enquêtes, reprises de presse et travaux ELMARQ. Celles qui disposent d'une adresse publique sont liées directement, pour que chaque affirmation puisse être remontée à son émetteur.

  1. 01
    Google Cloud, API Gateway, model routing (préversion publique, août 2026) : réception de requêtes au format OpenAI-compatible et routage dynamique vers Gemini, Claude ou OpenAI, transcodage vers le schéma natif de chaque fournisseur, préfixe google, openai ou anthropic ; routage selon le tag ou le nom du modèle en préversion
  2. 02
    Google Developers, Model routing with Google Cloud API Gateway : objectif affiché de permettre aux applications de changer de modèle sans modifier leur code
  3. 03
    Vercel, AI Gateway, routing rules et model fallbacks : réécriture d'une requête d'un modèle vers un autre au niveau de la passerelle et substitutions automatiques ; les providerOptions ne sont pas traduits d'un fournisseur à l'autre (documentation mise à jour à l'été 2026)
  4. 04
    Limite à conserver : Google et Vercel vendent ces infrastructures ; leurs publications démontrent l'existence technique du routage, pas son poids de marché, et plusieurs fonctions sont encore en préversion ou en bêta
Votre prochaine lecture
L’analyse de

Marc Lugand-Sacy

Fondateur, Président et associé unique d’ELMARQ.

Son parcours et sa méthode ↗
Citer cette analyse · référence et lien permanent
§ Citer cet article
Référence académique

Lugand-Sacy, Marc (2026). Le modèle que vous auditez n’est peut-être déjà plus celui qui répond. Journal ELMARQ. https://elmarq.fr/journal/routage-modeles-mesure-visibilite-ia

PartagerLinkedInTwitter / XEmail

Garder une lecture d’avance.
Recevoir la sélection du vendredi.

M’inscrire à la newsletter ↗

Visibilité et perception IA

Ce que les moteurs
répondent déjà sur vous

Les moteurs de réponse formulent déjà une réponse quand on les interroge sur votre marché. Cette réponse existe que vous la mesuriez ou non, et elle est rarement celle que vous auriez écrite. La mesurer est la première décision, pas la dernière.

Ce que cette page montre
Une lecture de méthode, sur des cas observables, avec le protocole publié.
Ce qu'une mission couvre
Vos propres réponses brutes, leur dispersion, les citations présentes et absentes, et ce qui les conditionne.

Trente minutes, sans engagement · Marc Lugand-Sacy · réponse sous 24 heures ouvrées

ELMARQ · Réponse sous 24 heures ouvrées · Échange confidentiel

Lire d'autres analyses