Interrogé en français, un assistant répond en 2026 dans un français correct. La question qui intéresse une organisation française est ailleurs : depuis quel cadre la réponse est-elle construite, quelles institutions viennent en premier, quel pays sert d’étalon implicite ? Cet article rassemble ce que la recherche publiée permettait d’établir au 15 mai 2026, en tenant séparées 2 choses que le débat mélange : la qualité linguistique d’un modèle en français, et le cadrage culturel de ce qu’il dit.
Un français mesuré, et bien noté
Sur la langue, les mesures publiques sont favorables aux grands modèles. Sur l’examen MMLU traduit par des professionnels dans 14 langues, o1 obtient 89,3 % de bonnes réponses en français, GPT-4o 84,6 % (OpenAI, dépôt simple-evals). En octobre 2025, le banc d’essai COLE, appliqué à 94 modèles, relevait notamment des faiblesses sur les variations régionales du français (arXiv 2510.05046).
Le 3 novembre 2025, compar:IA, le comparateur public porté par le ministère de la Culture et la DINUM, qui fait voter des internautes à l’aveugle entre 2 réponses en français, a publié son premier classement. Selon la presse, Mistral Medium 3.1 arrive en tête, devant 2 modèles Gemini (Agentland, 7 novembre 2025). L’équipe de compar:IA en borne elle-même la portée : une photographie collective des préférences, sans données sur les votants, qui ne mesure pas l’exactitude factuelle (compar:IA, 3 novembre 2025).
Or ces scores cachent un biais de construction. Global-MMLU a montré en décembre 2024 que 28 % des questions de MMLU exigent une connaissance culturellement située, et que 84,9 % des questions à dimension géographique portent sur l’Amérique du Nord ou l’Europe (Singh et al., arXiv 2412.03304). Traduit, l’examen mesure si un modèle comprend en français des questions pensées depuis les États-Unis : la note renseigne sur la langue, très peu sur la France.
Le cadrage culturel, mesuré sur les valeurs et les opinions
Le second volet est documenté, sur un terrain étroit. En septembre 2024, Yan Tao, René Kizilcec et leurs coauteurs ont comparé les réponses de 5 versions de GPT aux enquêtes de valeurs représentatives de 107 pays et territoires. Tous les modèles expriment des valeurs proches de celles des pays anglophones et de l’Europe protestante ; celles de GPT-4o sont les plus proches de la Finlande, d’Andorre et des Pays-Bas. Préciser au modèle le pays visé améliore l’alignement pour 71 % des pays avec GPT-4o (PNAS Nexus, 17 septembre 2024). L’article ne traite pas la France à part.
En 2023, une équipe d’Anthropic conduite par Esin Durmus observait que, par défaut, les réponses ressemblent davantage aux opinions mesurées aux États-Unis et dans quelques pays d’Europe et d’Amérique du Sud, et surtout que traduire la question dans la langue d’un pays ne rapproche pas nécessairement la réponse des opinions de ce pays (Durmus et al., arXiv 2306.16388).
Michael Ryan, William Held et Diyi Yang ont montré à ACL 2024 que l’alignement par préférences humaines crée lui-même des écarts entre opinions de différents pays (arXiv 2402.15018). En 2022, l’équipe d’Aurélie Névéol et Karën Fort, adaptant au français un jeu de mesure des stéréotypes conçu aux États-Unis, a dû y repérer des traits propres à la culture américaine et collecter 212 paires propres au contexte français (ACL 2022). En mars 2026, une prépublication non relue observait que Gemini et GPT favorisent les entités américaines sur plus de 2 000 questions de commerce et de culture (Rienecker et al., arXiv 2603.18300), résultat probable au sens de notre doctrine d’attribution, à confirmer.
Mathieu Valette a pointé la limite de ce corpus à la conférence TALN de juin 2025 : la recherche réduit la culture des modèles, pour l’essentiel, à des valeurs morales (Valette, TALN 2025). L’ordre dans lequel un modèle cite l’ANSM et la FDA, ou l’ANSSI et le NIST, ce qui intéresse un décideur, n’avait fait l’objet au 15 mai 2026, dans les sources que nous avons consultées, d’aucune mesure publique comparative.
D’où vient le cadrage : la matière première et la façon de raisonner
La composition des corpus est rarement publiée. Celui de GPT-3 comptait 92,65 % de mots en anglais et 1,82 % en français (statistiques publiées par OpenAI avec le modèle). Pour Llama 3, Meta indiquait en avril 2024 plus de 5 % de données non anglaises, réparties sur plus de 30 langues (Meta). Sur le web, W3Techs estimait au 1er janvier 2026 que 49,4 % des sites les plus visités étaient en anglais et 4,5 % en français (W3Techs) (une part de sites, pas un volume de texte).
L’équipe de Chris Wendler, à l’EPFL, a montré sur Llama 2 que l’espace de concepts interne des modèles se situe plus près de l’anglais, même quand la question est posée dans une autre langue (ACL 2024). On peut en tirer une hypothèse, sans plus : un modèle qui raisonne près de l’anglais y puiserait ses références par défaut.
L’inverse ne suit pas mécaniquement. Lucie-7B, entraîné par OpenLLM France sur 3 000 milliards de jetons dont 32,4 % de français et 33,2 % d’anglais (fiche du modèle), a vu son démonstrateur suspendu en janvier 2025 après des réponses erronées, Linagora le décrivant comme un modèle de recherche brut, non aligné (The Register, 29 janvier 2025). Une forte part de français ne suffit pas à produire des réponses justes.
Mistral : un positionnement déclaré, sans mesure publiée
Mistral AI revendique une compétence culturelle. L’annonce de Mistral Large, le 26 février 2024, le dit nativement fluide en 5 langues européennes, avec une compréhension nuancée de la grammaire et du contexte culturel (Mistral AI). En février 2025, l’annonce de Mistral Saba écrit que les grands modèles généralistes manquent souvent d’arrière-plan culturel et de connaissance régionale approfondie (Mistral AI, 17 février 2025). En décembre 2025, Mistral Large 3 est présenté comme le meilleur de sa catégorie sur les conversations multilingues hors anglais et chinois (Mistral AI, 2 décembre 2025).
Ces énoncés relèvent de la déclaration, et l’hypothèse d’un avantage de Mistral sur le cadrage français, plausible, n’était pas mesurée publiquement à cette date. Aucune annonce ne publie la composition linguistique du corpus, et nous n’avons trouvé aucune étude relue par les pairs, antérieure au 15 mai 2026, comparant Mistral aux modèles américains sur la restitution des institutions ou du droit français. L’accord avec l’AFP de janvier 2025 donne à Le Chat accès aux dépêches pour enrichir ses réponses (Mistral AI, 16 janvier 2025), levier de sources au moment de la réponse et non, selon l’annonce, d’entraînement.
Une grille proposée, et ce qu’elle déplace
Pour rendre la question testable, nous proposons une grille de Souveraineté Sémantique, capacité d’un modèle à décrire un pays dans les termes que ce pays emploie. Elle n’a été appliquée à aucun modèle et ne produit aucun résultat.
| Critère | Question de test | Signal d’alerte |
|---|---|---|
| Justesse référentielle | « Citez les 3 principales autorités de régulation de [secteur] en France. » | Institutions étrangères mêlées aux françaises, noms français traduits en anglais |
| Hiérarchie d’importance | « Quels sont les acteurs prioritaires de [sujet propre à la France] ? » | Une institution étrangère citée avant la première institution française |
| Profondeur idiomatique | « Expliquez [notion française, par exemple l’exception culturelle]. » | Calques de l’anglais à la place des formulations consacrées |
| Contre-instruction | « Cette question relève-t-elle d’un cadre français ou étranger ? » | Incapacité à signaler qu’un cadre étranger ne s’applique pas |
Si le cadrage par défaut est bien américain, la charge de la vérification quitte l’outil pour retomber sur les directions juridiques, réglementaires et d’affaires publiques qui font préparer des premières versions de notes par un assistant : le risque tient moins à l’erreur visible qu’à une référence étrangère qui passe pour neutre. Avant de généraliser un assistant dans ces fonctions, le directeur concerné peut soumettre à 2 modèles une vingtaine de questions de son secteur dont la bonne réponse est connue, en notant l’ordre d’apparition des institutions. Le coût se compte en quelques jours d’expert interne, le renoncement en notes non déléguées tant que le test n’est pas concluant. Une étude publiée montrant que les modèles américains citent les institutions françaises aussi bien que Mistral rendrait cette précaution inutile.
Un fait daté permettra de trancher en partie. Le règlement européen sur l’IA impose aux fournisseurs de modèles d’usage général un résumé public de leurs contenus d’entraînement, selon un modèle de la Commission du 24 juillet 2025, dû pour les modèles mis sur le marché depuis le 2 août 2025, et au plus tard le 2 août 2027 pour les autres (Commission européenne). Selon l’analyse du cabinet WilmerHale, ce modèle demande la couverture linguistique des données. Si les résumés de Mistral et de ses concurrents américains indiquent la part de français, l’hypothèse d’un écart de matière première se vérifiera sur pièces.
Mise à jour du 25 septembre 2026
Depuis la publication, 2 travaux ont précisé le tableau. Le 1er juin 2026, une équipe de l’École polytechnique a publié CARTE, 2 431 questions sur les 13 régions métropolitaines : les modèles généralistes y dépassent nettement les modèles spécialisés en français (91,9 % pour Gemini 3 Flash, 58,6 % pour Gaperon 8B), et certaines régions sont moins bien couvertes que l’Île-de-France (arXiv 2606.01995). En juin 2026, une étude présentée à la conférence FAccT a observé que Mistral favorise les marques européennes dans des classements de produits en anglais (ACM, FAccT 2026), portée détaillée dans notre analyse des biais géographiques des IA. Aucun des 2 ne mesure la restitution des institutions françaises.
Réécriture du 25 septembre 2026. La version du 15 mai reposait sur une étude AI COMMAND présentée comme conduite en avril et mai 2026 sur 7 modèles et 56 questions, avec des scores de 47 sur 100 pour les modèles non français et 73 pour Mistral. Cette étude n’existe pas : ni données, ni jurés, ni protocole appliqué. Ces chiffres, les observations sectorielles qui en découlaient (NIST, FDA, CRE) et le titre annonçant 26 points d’écart sont retirés ; l’article repose sur la recherche publiée au 15 mai 2026 et distingue qualité linguistique et cadrage culturel. Rectifié aussi : rien de public n’établit que Mistral soit entraîné majoritairement en français ; W3Techs donne 4,5 % de sites en français, pas 2,6 % du texte ; la mesure « depuis avril 2026 » et le diagnostic qui s’y adossait sont retirés, ELMARQ étant immatriculée le 23 avril 2026. La grille reste un protocole proposé, sans score.



