L’industrie s’est habituée à un schéma simple : ChatGPT répond avec OpenAI, Claude avec Anthropic, Gemini avec Google. Ce schéma reste vrai pour les interfaces propriétaires, mais il devient de moins en moins pertinent pour les milliers d’applications, assistants, agents et interfaces verticales construits au-dessus des modèles. Depuis l’été 2026, un maillon nouveau s’est glissé entre la requête et la réponse : la passerelle de routage. Le déplacement devient modèle choisi, puis passerelle, puis politique de routage, puis modèle effectivement servi. Et cela casse, discrètement, l’unité de mesure sur laquelle repose tout le marché naissant de la visibilité IA.
Ce que Google et Vercel viennent de rendre banal
Le 3 août 2026, Google Cloud a ajouté à API Gateway un système, en préversion publique, qui reçoit une requête au format OpenAI et la route dynamiquement vers des modèles Gemini, Claude ou OpenAI ; la passerelle transcode au passage la requête vers le schéma natif de chaque fournisseur. avéré Google a confirmé que l’objectif est précisément de permettre aux applications de changer de modèle sans modifier leur code. avéré Ce n’est pas un phénomène isolé : la passerelle IA de Vercel permet, elle aussi, de réécrire au niveau de la passerelle une demande destinée à un modèle pour la faire servir par un autre, et d’organiser des substitutions automatiques quand un modèle échoue. avéré
Dans une architecture routée, plusieurs choses deviennent vraies en même temps : la marque de l’interface peut rester identique, la requête nominale peut rester identique, mais le modèle réellement interrogé peut changer ; une substitution de secours peut en solliciter un deuxième lors d’une panne ; et une politique de coûts peut réserver les modèles les plus puissants aux questions complexes. Le nom du modèle demandé cesse alors d’indiquer le modèle qui a répondu.
Pourquoi cela casse l’unité de mesure actuelle
Le marché de la visibilité IA commence tout juste à apprendre à comparer la présence sur GPT, sur Gemini et sur Claude. C’est un progrès. Mais cette comparaison suppose que le nom du modèle interrogé est le modèle qui décide. Dès qu’une passerelle s’interpose, cette hypothèse peut tomber : un audit fondé uniquement sur le nom du modèle demandé peut devenir faux dans les applications agentiques et B2B, précisément celles qui se multiplient. possible La question utile n’est plus que dit Claude de ma marque, mais quelle infrastructure a réellement pris les décisions dans lesquelles ma marque était éligible.
Nous proposons, comme grandeur de mesure et sans en faire un concept propriétaire, la part d’inférence effective : la proportion réelle des décisions ou réponses concernant une organisation qui est servie par chaque couple modèle et fournisseur, après routage, substitution et repli. possible Cette grandeur a une propriété rare : elle est intrinsèquement cumulative, calculable sur des millions d’inférences, et bien plus informative qu’un classement théorique des modèles. Elle ne dit pas quel modèle est le meilleur ; elle dit lequel a effectivement répondu, et dans quelle proportion.
La limite, qui interdit le titre facile
Il serait prématuré, et faux, d’écrire que le modèle n’a plus d’importance. Il en a énormément. Trois précautions bornent l’analyse. D’abord, Google et Vercel vendent les infrastructures décrites : leurs publications démontrent l’existence technique du phénomène, pas son poids de marché. avéré Ensuite, ces fonctions sont encore pour partie en préversion ou en bêta. avéré Enfin, les grandes interfaces grand public restent beaucoup plus facilement attribuables à un fournisseur, et représentent une part majeure des usages. La proposition rigoureuse n’est donc pas que le modèle disparaît, mais que le modèle nominal devient une variable insuffisante dans un sous-ensemble croissant des usages, applications agentiques et déploiements B2B en tête. possible
Une hypothèse, testable
Voici ce que nous soumettons à l’épreuve, plutôt qu’un pronostic. Dans les applications d’IA intermédiaires, la politique de routage expliquera d’ici 2027 une part mesurable de la variance de recommandation aujourd’hui attribuée au seul modèle. possible Le test est simple : mêmes requêtes, même application, différents mélanges d’inférence, et comparaison des marques citées et recommandées. Si le routage n’explique rien, l’hypothèse tombe, et nous le dirons.
Pour la mesure, la conséquence est un différenciateur réel. Au lieu d’un benchmark GPT contre Gemini contre Claude, qui suppose une attribution stable, une mesure de visibilité IA peut devenir sensible au routage : mesurer non le modèle nominal, mais l’inférence effective, et rendre cette méthodologie vérifiable pour les entreprises qui déploient leurs propres assistants. C’est plus difficile à faire, donc plus difficile à copier, et surtout plus fidèle à ce qui se passe réellement entre la requête et la réponse. possible
Marc Lugand-Sacy, président d’ELMARQ, cité par La Tribune Dimanche comme source d’analyse sur la guerre informationnelle et la propagande iranienne. Une analyse d’ELMARQ sur la riposte informationnelle française a également été citée comme source par la Fondation Jean-Jaurès. ELMARQ mesure la présence des marques dans les réponses des moteurs d’IA selon un protocole publié, et travaille à une mesure sensible au routage plutôt qu’au seul nom du modèle. À lire en regard : qui possède la recommandation IA, ce que 45 études établissent sur la visibilité IA et le SOM Checker.


