Souveraineté sémantique des LLM : un français bien noté, un cadrage qui penche vers le monde anglophone, un avantage de Mistral non mesuré
§ Veille & Intelligence

Souveraineté sémantique des LLM : un français bien noté, un cadrage qui penche vers le monde anglophone, un avantage de Mistral non mesuré

Au 15 mai 2026, la recherche publiée montre des modèles très bons en français, mais dont le cadrage par défaut penche vers les pays anglophones, même quand on les interroge en français. Mistral revendique une compréhension du contexte culturel, sans mesure publique comparative ni composition de corpus publiée.

Marc Lugand-Sacy15.05.2026 · MAJ 25.09.20268 min de lecture1 762 mots
§ En brefRéponse directe

Au 15 mai 2026, la recherche publiée distingue 2 choses que le débat confond. Sur la langue, les grands modèles sont très bons en français : o1 obtient 89,3 % sur l'examen MMLU traduit par des professionnels (OpenAI). Mais Global-MMLU a montré que 28 % des questions de cet examen exigent une connaissance culturellement située. Sur le cadrage, une étude publiée dans PNAS Nexus en 2024 montre que les valeurs exprimées par GPT sont proches de celles des pays anglophones, et une équipe d'Anthropic a observé qu'interroger un modèle dans la langue d'un pays ne rapproche pas nécessairement ses réponses des opinions de ce pays. Mistral AI revendique une compréhension du contexte culturel, sans publier la composition de son corpus ni de mesure comparative. ELMARQ propose une grille de Souveraineté Sémantique, jamais appliquée, et recommande de tester un modèle sur les institutions de son secteur avant de lui confier des notes. Le résumé des données d'entraînement exigé par l'AI Act permettra de vérifier la part du français.

§ À retenir4 points clés
  1. 01

    Interrogé en français, un assistant répond en 2026 dans un français correct.

  2. 02

    Sur l’examen MMLU traduit par des professionnels dans 14 langues, o1 obtient 89,3 % de bonnes réponses en français, GPT-4o 84,6 % (OpenAI, dépôt simple-evals).

  3. 03

    En octobre 2025, le banc d’essai COLE, appliqué à 94 modèles, relevait notamment des faiblesses sur les variations régionales du français (arXiv 2510.05046).

  4. 04

    Le 3 novembre 2025, compar:IA, le comparateur public porté par le ministère de la Culture et la DINUM, qui fait voter des internautes à l’aveugle entre 2 réponses en français, a publié son premier classement.

Souveraineté Sémantique LLM : 26 points d'écart entre Mistral et les modèles américains sur la France
© ELMARQ · Illustration éditoriale

Interrogé en français, un assistant répond en 2026 dans un français correct. La question qui intéresse une organisation française est ailleurs : depuis quel cadre la réponse est-elle construite, quelles institutions viennent en premier, quel pays sert d’étalon implicite ? Cet article rassemble ce que la recherche publiée permettait d’établir au 15 mai 2026, en tenant séparées 2 choses que le débat mélange : la qualité linguistique d’un modèle en français, et le cadrage culturel de ce qu’il dit.

Un français mesuré, et bien noté

Sur la langue, les mesures publiques sont favorables aux grands modèles. Sur l’examen MMLU traduit par des professionnels dans 14 langues, o1 obtient 89,3 % de bonnes réponses en français, GPT-4o 84,6 % (OpenAI, dépôt simple-evals). En octobre 2025, le banc d’essai COLE, appliqué à 94 modèles, relevait notamment des faiblesses sur les variations régionales du français (arXiv 2510.05046).

Le 3 novembre 2025, compar:IA, le comparateur public porté par le ministère de la Culture et la DINUM, qui fait voter des internautes à l’aveugle entre 2 réponses en français, a publié son premier classement. Selon la presse, Mistral Medium 3.1 arrive en tête, devant 2 modèles Gemini (Agentland, 7 novembre 2025). L’équipe de compar:IA en borne elle-même la portée : une photographie collective des préférences, sans données sur les votants, qui ne mesure pas l’exactitude factuelle (compar:IA, 3 novembre 2025).

Or ces scores cachent un biais de construction. Global-MMLU a montré en décembre 2024 que 28 % des questions de MMLU exigent une connaissance culturellement située, et que 84,9 % des questions à dimension géographique portent sur l’Amérique du Nord ou l’Europe (Singh et al., arXiv 2412.03304). Traduit, l’examen mesure si un modèle comprend en français des questions pensées depuis les États-Unis : la note renseigne sur la langue, très peu sur la France.

Le cadrage culturel, mesuré sur les valeurs et les opinions

Le second volet est documenté, sur un terrain étroit. En septembre 2024, Yan Tao, René Kizilcec et leurs coauteurs ont comparé les réponses de 5 versions de GPT aux enquêtes de valeurs représentatives de 107 pays et territoires. Tous les modèles expriment des valeurs proches de celles des pays anglophones et de l’Europe protestante ; celles de GPT-4o sont les plus proches de la Finlande, d’Andorre et des Pays-Bas. Préciser au modèle le pays visé améliore l’alignement pour 71 % des pays avec GPT-4o (PNAS Nexus, 17 septembre 2024). L’article ne traite pas la France à part.

En 2023, une équipe d’Anthropic conduite par Esin Durmus observait que, par défaut, les réponses ressemblent davantage aux opinions mesurées aux États-Unis et dans quelques pays d’Europe et d’Amérique du Sud, et surtout que traduire la question dans la langue d’un pays ne rapproche pas nécessairement la réponse des opinions de ce pays (Durmus et al., arXiv 2306.16388).

Michael Ryan, William Held et Diyi Yang ont montré à ACL 2024 que l’alignement par préférences humaines crée lui-même des écarts entre opinions de différents pays (arXiv 2402.15018). En 2022, l’équipe d’Aurélie Névéol et Karën Fort, adaptant au français un jeu de mesure des stéréotypes conçu aux États-Unis, a dû y repérer des traits propres à la culture américaine et collecter 212 paires propres au contexte français (ACL 2022). En mars 2026, une prépublication non relue observait que Gemini et GPT favorisent les entités américaines sur plus de 2 000 questions de commerce et de culture (Rienecker et al., arXiv 2603.18300), résultat probable au sens de notre doctrine d’attribution, à confirmer.

Mathieu Valette a pointé la limite de ce corpus à la conférence TALN de juin 2025 : la recherche réduit la culture des modèles, pour l’essentiel, à des valeurs morales (Valette, TALN 2025). L’ordre dans lequel un modèle cite l’ANSM et la FDA, ou l’ANSSI et le NIST, ce qui intéresse un décideur, n’avait fait l’objet au 15 mai 2026, dans les sources que nous avons consultées, d’aucune mesure publique comparative.

D’où vient le cadrage : la matière première et la façon de raisonner

La composition des corpus est rarement publiée. Celui de GPT-3 comptait 92,65 % de mots en anglais et 1,82 % en français (statistiques publiées par OpenAI avec le modèle). Pour Llama 3, Meta indiquait en avril 2024 plus de 5 % de données non anglaises, réparties sur plus de 30 langues (Meta). Sur le web, W3Techs estimait au 1er janvier 2026 que 49,4 % des sites les plus visités étaient en anglais et 4,5 % en français (W3Techs) (une part de sites, pas un volume de texte).

L’équipe de Chris Wendler, à l’EPFL, a montré sur Llama 2 que l’espace de concepts interne des modèles se situe plus près de l’anglais, même quand la question est posée dans une autre langue (ACL 2024). On peut en tirer une hypothèse, sans plus : un modèle qui raisonne près de l’anglais y puiserait ses références par défaut.

L’inverse ne suit pas mécaniquement. Lucie-7B, entraîné par OpenLLM France sur 3 000 milliards de jetons dont 32,4 % de français et 33,2 % d’anglais (fiche du modèle), a vu son démonstrateur suspendu en janvier 2025 après des réponses erronées, Linagora le décrivant comme un modèle de recherche brut, non aligné (The Register, 29 janvier 2025). Une forte part de français ne suffit pas à produire des réponses justes.

Mistral : un positionnement déclaré, sans mesure publiée

Mistral AI revendique une compétence culturelle. L’annonce de Mistral Large, le 26 février 2024, le dit nativement fluide en 5 langues européennes, avec une compréhension nuancée de la grammaire et du contexte culturel (Mistral AI). En février 2025, l’annonce de Mistral Saba écrit que les grands modèles généralistes manquent souvent d’arrière-plan culturel et de connaissance régionale approfondie (Mistral AI, 17 février 2025). En décembre 2025, Mistral Large 3 est présenté comme le meilleur de sa catégorie sur les conversations multilingues hors anglais et chinois (Mistral AI, 2 décembre 2025).

Ces énoncés relèvent de la déclaration, et l’hypothèse d’un avantage de Mistral sur le cadrage français, plausible, n’était pas mesurée publiquement à cette date. Aucune annonce ne publie la composition linguistique du corpus, et nous n’avons trouvé aucune étude relue par les pairs, antérieure au 15 mai 2026, comparant Mistral aux modèles américains sur la restitution des institutions ou du droit français. L’accord avec l’AFP de janvier 2025 donne à Le Chat accès aux dépêches pour enrichir ses réponses (Mistral AI, 16 janvier 2025), levier de sources au moment de la réponse et non, selon l’annonce, d’entraînement.

Une grille proposée, et ce qu’elle déplace

Pour rendre la question testable, nous proposons une grille de Souveraineté Sémantique, capacité d’un modèle à décrire un pays dans les termes que ce pays emploie. Elle n’a été appliquée à aucun modèle et ne produit aucun résultat.

Critère Question de test Signal d’alerte
Justesse référentielle « Citez les 3 principales autorités de régulation de [secteur] en France. » Institutions étrangères mêlées aux françaises, noms français traduits en anglais
Hiérarchie d’importance « Quels sont les acteurs prioritaires de [sujet propre à la France] ? » Une institution étrangère citée avant la première institution française
Profondeur idiomatique « Expliquez [notion française, par exemple l’exception culturelle]. » Calques de l’anglais à la place des formulations consacrées
Contre-instruction « Cette question relève-t-elle d’un cadre français ou étranger ? » Incapacité à signaler qu’un cadre étranger ne s’applique pas

Si le cadrage par défaut est bien américain, la charge de la vérification quitte l’outil pour retomber sur les directions juridiques, réglementaires et d’affaires publiques qui font préparer des premières versions de notes par un assistant : le risque tient moins à l’erreur visible qu’à une référence étrangère qui passe pour neutre. Avant de généraliser un assistant dans ces fonctions, le directeur concerné peut soumettre à 2 modèles une vingtaine de questions de son secteur dont la bonne réponse est connue, en notant l’ordre d’apparition des institutions. Le coût se compte en quelques jours d’expert interne, le renoncement en notes non déléguées tant que le test n’est pas concluant. Une étude publiée montrant que les modèles américains citent les institutions françaises aussi bien que Mistral rendrait cette précaution inutile.

Un fait daté permettra de trancher en partie. Le règlement européen sur l’IA impose aux fournisseurs de modèles d’usage général un résumé public de leurs contenus d’entraînement, selon un modèle de la Commission du 24 juillet 2025, dû pour les modèles mis sur le marché depuis le 2 août 2025, et au plus tard le 2 août 2027 pour les autres (Commission européenne). Selon l’analyse du cabinet WilmerHale, ce modèle demande la couverture linguistique des données. Si les résumés de Mistral et de ses concurrents américains indiquent la part de français, l’hypothèse d’un écart de matière première se vérifiera sur pièces.

Mise à jour du 25 septembre 2026

Depuis la publication, 2 travaux ont précisé le tableau. Le 1er juin 2026, une équipe de l’École polytechnique a publié CARTE, 2 431 questions sur les 13 régions métropolitaines : les modèles généralistes y dépassent nettement les modèles spécialisés en français (91,9 % pour Gemini 3 Flash, 58,6 % pour Gaperon 8B), et certaines régions sont moins bien couvertes que l’Île-de-France (arXiv 2606.01995). En juin 2026, une étude présentée à la conférence FAccT a observé que Mistral favorise les marques européennes dans des classements de produits en anglais (ACM, FAccT 2026), portée détaillée dans notre analyse des biais géographiques des IA. Aucun des 2 ne mesure la restitution des institutions françaises.

Réécriture du 25 septembre 2026. La version du 15 mai reposait sur une étude AI COMMAND présentée comme conduite en avril et mai 2026 sur 7 modèles et 56 questions, avec des scores de 47 sur 100 pour les modèles non français et 73 pour Mistral. Cette étude n’existe pas : ni données, ni jurés, ni protocole appliqué. Ces chiffres, les observations sectorielles qui en découlaient (NIST, FDA, CRE) et le titre annonçant 26 points d’écart sont retirés ; l’article repose sur la recherche publiée au 15 mai 2026 et distingue qualité linguistique et cadrage culturel. Rectifié aussi : rien de public n’établit que Mistral soit entraîné majoritairement en français ; W3Techs donne 4,5 % de sites en français, pas 2,6 % du texte ; la mesure « depuis avril 2026 » et le diagnostic qui s’y adossait sont retirés, ELMARQ étant immatriculée le 23 avril 2026. La grille reste un protocole proposé, sans score.

Pour aller plus loin, ELMARQ est l'agence GEO qui mesure et fait progresser votre Generative Engine Optimization : Score SOM, dix facteurs, suivi mensuel.

§ Questions fréquentes

Ce qu'il faut comprendre

Les grands modèles de langage parlent-ils bien français ?

Oui, selon les mesures publiques. Sur l'examen MMLU traduit par des professionnels, o1 obtient 89,3 % en français et GPT-4o 84,6 % (OpenAI). Mais 28 % des questions de MMLU exigent une connaissance culturellement située et 84,9 % des questions géographiques portent sur l'Amérique du Nord ou l'Europe (Global-MMLU, 2024) : ces notes mesurent la langue, très peu la connaissance de la France.

Poser sa question en français suffit-il à obtenir une réponse cadrée depuis la France ?

Rien ne le garantit. Une équipe d'Anthropic a observé en 2023 que traduire une question dans la langue d'un pays ne rapproche pas nécessairement la réponse des opinions de ce pays. Une étude publiée dans PNAS Nexus en 2024 montre que les valeurs exprimées par GPT sont proches de celles des pays anglophones et de l'Europe protestante, et que préciser le pays visé améliore l'alignement pour 71 % des pays avec GPT-4o.

Mistral décrit-il mieux la France que les modèles américains ?

C'est plausible mais non mesuré publiquement au 15 mai 2026. Mistral déclare depuis 2024 une compréhension nuancée du contexte culturel, sans publier la composition linguistique de son corpus, et nous n'avons trouvé aucune étude relue par les pairs comparant Mistral aux modèles américains sur la restitution des institutions françaises. Le classement compar:IA de novembre 2025, où Mistral Medium 3.1 arrive en tête selon la presse, mesure des préférences de votants, pas l'exactitude.

Qu'est-ce que la grille de Souveraineté Sémantique ?

Un protocole proposé pour tester la capacité d'un modèle à décrire un pays dans les termes que ce pays emploie, sur 4 critères : justesse référentielle, hiérarchie d'importance, profondeur idiomatique, contre-instruction. Il n'a été appliqué à aucun modèle et ne produit aucun résultat. L'étude AI COMMAND et les scores de 47 et 73 sur 100 cités dans la version initiale n'existent pas.

Quel fait permettra de vérifier l'hypothèse d'un écart de matière première ?

Le règlement européen sur l'IA impose aux fournisseurs de modèles d'usage général un résumé public de leurs contenus d'entraînement, selon un modèle de la Commission du 24 juillet 2025, dû depuis le 2 août 2025 pour les nouveaux modèles et au plus tard le 2 août 2027 pour les autres. Selon le cabinet WilmerHale, ce modèle demande la couverture linguistique des données.

§ Sources

Références citées

Références citées dans cette analyse : documents originaux, enquêtes, reprises de presse et travaux ELMARQ. Celles qui disposent d'une adresse publique sont liées directement, pour que chaque affirmation puisse être remontée à son émetteur.

  1. 01
  2. 02
  3. 03
  4. 04
  5. 05
  6. 06
  7. 07
  8. 08
  9. 09
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23
  24. 24
  25. 25
  26. 26
§ À lire ensuite
§ Citer cet article
Référence académique

Lugand-Sacy, Marc (2026). Souveraineté sémantique des LLM : un français bien noté, un cadrage qui penche vers le monde anglophone, un avantage de Mistral non mesuré. Journal ELMARQ. https://elmarq.fr/journal/souverainete-semantique-llm-mistral-france-2026

PartagerLinkedInTwitter / XEmail

Visibilité et perception IA

Ce que les moteurs
répondent déjà sur vous

Les moteurs de réponse formulent déjà une réponse quand on les interroge sur votre marché. Cette réponse existe que vous la mesuriez ou non, et elle est rarement celle que vous auriez écrite. La mesurer est la première décision, pas la dernière.

Ce que cette page montre
Une lecture de méthode, sur des cas observables, avec le protocole publié.
Ce qu'une mission couvre
Vos propres réponses brutes, leur dispersion, les citations présentes et absentes, et ce qui les conditionne.

Trente minutes, sans engagement · Marc Lugand-Sacy · réponse sous 24 heures ouvrées

ELMARQ · Réponse sous 24 heures ouvrées · Échange confidentiel

Lire d'autres analyses