Le surnom prête à sourire : « Le Chonk ». Derrière, Mistral Large 4 est le modèle le plus ambitieux présenté à ce jour par la start-up parisienne, et son résultat est à la fois flatteur et modeste.
À retenir
- Mistral Large 4 obtient 38 sur l’indice d’Artificial Analysis, contre 58 pour Claude Opus 5.5.
- Il est le mieux noté hors de Chine parmi les modèles à poids ouverts, mais ses poids ne sont pas encore publiés.
- Mistral ne cherche pas à égaler OpenAI et Anthropic, qui ont levé 122 et 65 milliards de dollars en 2026. Il vend le contrôle.
- Bercy a arrêté en juin un test de Qwen après des réponses jugées orientées sur la Chine.
- La question pour les entreprises : que se passe-t-il si un fournisseur américain coupe l’accès ?
Le 6 octobre, Artificial Analysis, un organisme indépendant qui compare les modèles d’intelligence artificielle, lui a attribué 38 points sur son indice d’intelligence, dans sa version 4.3.2. Cela en fait le modèle le mieux noté hors de Chine parmi ceux que Mistral présente comme à « poids ouverts », c’est-à-dire dont les paramètres peuvent être téléchargés et exécutés par le client.
Cette réussite reste relative. Sur le même graphique, Large 4 pointe au 18e rang sur 25 modèles, à égalité avec GPT-6 Luna d’OpenAI. Claude Opus 5.5, d’Anthropic, est crédité de 58. Faut-il y voir un échec ? Je crois plutôt que la question est mal posée, et que la réponse éclaire une stratégie qui concerne bien au-delà des laboratoires.
Un classement qui exige quelques précautions
Précisons d’abord ce que mesure ce chiffre. L’indice d’Artificial Analysis agrège dix évaluations : tâches de bureautique, programmation, raisonnement scientifique, restitution de connaissances. Il est révisé fréquemment, et l’organisme prévient que les scores de versions différentes ne sont pas comparables entre eux. Un 38 d’aujourd’hui ne se compare donc pas à un 38 de l’an dernier.
Deuxième précaution : Large 4 est, à ce stade, une préversion. Mistral le décrit comme un modèle à poids ouverts, mais ces poids n’étaient pas publiés à la date de rédaction. Artificial Analysis le classe donc, provisoirement, parmi les modèles propriétaires. L’organisme estime qu’il figurera dans le trio de tête des modèles ouverts sur son indice de cybersécurité une fois les poids diffusés. Le classement pourrait aussi bouger si Mistral poursuit son entraînement et si le modèle final est réévalué.
Enfin, le coût. Selon Artificial Analysis, exécuter une tâche de l’indice revient en moyenne à 1,13 dollar avec Large 4, contre 0,03 dollar pour Large 3. L’organisme juge ce coût plus de quatre fois supérieur à celui de modèles ouverts d’intelligence comparable. Le gain de 18 points sur Large 3 a donc un prix.
Deux courses qui ne se jouent plus à la même échelle
Ces deux faits, un modèle en tête de sa catégorie et un rang médiocre au classement mondial, coexistent parce que Mistral ne participe plus tout à fait à la même compétition que ses deux grands concurrents américains.
En 2026, OpenAI a bouclé en mars un tour de table d’environ 122 milliards de dollars, pour une valorisation de 852 milliards. Anthropic a clos en mai une série H de 65 milliards, valorisant l’entreprise à 965 milliards. Ces sommes financent des puissances de calcul et des campagnes d’entraînement hors de portée d’un acteur européen de cette taille. Tenter de rattraper les modèles de pointe sur leur terrain relèverait, à budget comparable, du pari perdu d’avance.
Mistral semble en avoir tiré la conclusion. Son offre ne se résume plus à « le meilleur modèle », mais à « le meilleur modèle que l’on peut contrôler » : savoir où il tourne, sous quel droit, avec quelles garanties de service, et pouvoir le faire fonctionner sans dépendre du bon vouloir d’un tiers. L’argument parle surtout aux acteurs pour qui une interruption coûterait cher : administrations, banques, industriels, opérateurs d’infrastructures.
Héberger chez soi ne suffit pas
L’épisode de Bercy, en juin, illustre la limite d’une approche purement technique de la souveraineté. La direction générale du Trésor avait déployé début juin, auprès d’une centaine d’agents, un assistant baptisé HéphAIstos, fondé sur Qwen, le modèle d’Alibaba. Plusieurs utilisateurs ont signalé des réponses jugées orientées sur des sujets liés à la Chine. L’expérimentation a été arrêtée le 23 juin, et un modèle de Mistral a été installé dès le mercredi suivant, selon les informations rapportées par l’AFP et Le Monde.
Bercy a insisté sur deux points : l’assistant fonctionnait hors ligne, sans accès à Internet ni porte dérobée identifiée, et ce test n’avait pas vocation à durer. Le ministère a ainsi écarté tout risque de fuite de données. Mais l’essentiel est ailleurs. Un modèle exécuté sur ses propres serveurs ne transmet rien à l’extérieur, et peut pourtant porter dans ses paramètres les inflexions de son entraînement. Une spécialiste de l’IA responsable interrogée par l’AFP rappelait que les biais sont inhérents à tout modèle, mais que certains peuvent être introduits volontairement.
Une étude du laboratoire allemand Aleph Alpha, portant sur 967 sujets sensibles, va dans ce sens : les modèles chinois testés (Qwen, DeepSeek, Kimi) n’y produisent des réponses équilibrées que dans 17 à 41 % des cas. Claude Sonnet 5 atteint 70 % et Mistral Small 92 %. Il faut toutefois lire ces résultats avec prudence, puisque Aleph Alpha est lui-même un concurrent européen et qu’il a noté les réponses avec son propre système d’évaluation automatisé.
Le pari du harnais, de l’infrastructure et du droit
Cette même logique explique un choix qui a surpris. Depuis août, Mistral propose à ses clients GLM-5.3, un modèle à poids ouverts du laboratoire chinois Z.ai, hébergé sur ses propres serveurs. Il en a fait, le 21 septembre, l’option par défaut dans l’interface web de son assistant de programmation, Vibe Code. Selon Reuters, ce modèle est proposé sans modification. Des ingénieurs ont toutefois relevé sur les réseaux sociaux que GLM-5.3 reste très proche de la version précédente, GLM-5.2, déjà disponible chez Mistral.
À première vue, l’incohérence est flagrante : comment défendre une IA européenne et distribuer un modèle chinois ? Mistral répond que ce modèle ouvert, comme les suivants, fonctionnera sur la même infrastructure, avec les mêmes contrôles régionaux et les mêmes engagements de service que ses propres modèles. Autrement dit, ce que l’entreprise vend n’est pas seulement un modèle, mais ce qui l’entoure : le « harnais », c’est-à-dire l’ensemble des outils, des garde-fous et de l’orchestration qui permettent de l’utiliser en entreprise, ainsi que l’hébergement et la conformité au droit européen.
Cette position a ses détracteurs. Les critiques y voient un renoncement : si le modèle phare de la start-up n’est plus l’argument central, que reste-t-il de la promesse initiale ? L’enjeu n’est pas mince, car la crédibilité de Mistral repose sur sa capacité à entraîner ses propres modèles. Les défenseurs de la stratégie répondent qu’elle est pragmatique : aucun client ne choisit un fournisseur pour la nationalité de ses paramètres, mais pour la garantie de ne pas être pris en défaut le jour où un contrat, une loi ou un contrôle à l’export change.
Les chiffres à garder en tête :
- 38 : score de Mistral Large 4 Preview sur l’indice d’Artificial Analysis (v4.3.2), contre 58 pour Claude Opus 5.5.
- 18e sur 25 : son rang sur le graphique publié, à égalité avec GPT-6 Luna.
- 1,13 dollar : coût moyen par tâche de l’indice, contre 0,03 dollar pour Large 3.
- 122 et 65 milliards de dollars : tours de table 2026 d’OpenAI et d’Anthropic.
- 23 juin : date de l’arrêt du test de Qwen à la direction générale du Trésor.
- Plus d’un million d’agents publics : cible du plan « Notre IA », avec un assistant alimenté par Mistral, pour un budget initial de 700 000 euros.
La question qui concerne dirigeants, DSI et acheteurs publics
Reste la question que ce raisonnement pose à chaque organisation : si votre fournisseur américain coupe demain, qu’est-ce qui s’arrête chez vous ?
L’hypothèse n’a rien d’abstrait. En juin, Anthropic a suspendu l’accès à deux de ses modèles les plus avancés pour se conformer à des contrôles à l’exportation décidés par le département du Commerce américain, avant de le rétablir le 1er juillet, une fois ces contrôles levés. Cet épisode, qui n’a duré que quelques semaines, rappelle qu’un modèle consommé par API reste soumis à des décisions prises hors de l’entreprise cliente. Ce constat vaut aussi pour les organisations marocaines et africaines qui bâtissent aujourd’hui leurs outils sur des modèles américains.
Pour y répondre, trois pistes se dégagent. Cartographier les processus qui reposent sur un modèle externe, car tous ne sont pas critiques. Prévoir un modèle de repli, éventuellement moins performant, capable d’assurer un service minimal. Enfin, exiger des fournisseurs de la transparence sur l’hébergement, la juridiction applicable et le comportement du modèle sur les sujets sensibles.
Une souveraineté encore à démontrer
Il serait imprudent de conclure que la stratégie de Mistral a fait ses preuves. Le modèle phare reste en milieu de tableau et cher à exécuter. Sa version finale, et sa licence, ne sont pas encore connues. Le contrat avec la fonction publique, lui, atteste d’une confiance de l’État, mais reste à l’épreuve de l’usage à grande échelle.
La vraie interrogation est de savoir si le contrôle est un argument commercial durable, ou un atout qui s’effacera si les modèles américains offrent un jour des garanties comparables. Les entreprises ont, d’ici là, une décision à prendre, qui ne dépend ni d’un classement ni d’un surnom : choisir ce qu’elles acceptent de déléguer, et à qui.
FAQ
Mistral Large 4 est-il vraiment un modèle ouvert ?
Mistral le présente comme tel, mais ses poids n’étaient pas encore publiés à la date de rédaction. Artificial Analysis le classe donc provisoirement comme propriétaire.
Pourquoi Mistral propose-t-il un modèle chinois ?
Parce que son argument commercial porte sur l’infrastructure, les contrôles régionaux et le cadre juridique européen, plus que sur l’origine du modèle. L’entreprise affirme appliquer les mêmes engagements de service à GLM-5.3 qu’à ses propres modèles.
Que s’est-il passé à Bercy avec Qwen ?
La direction générale du Trésor a arrêté le 23 juin un test de l’assistant HéphAIstos, fondé sur Qwen, après des signalements de réponses jugées orientées sur des sujets liés à la Chine. Bercy souligne que l’outil fonctionnait hors ligne.
Qu’est-ce que cela change pour une entreprise ?
Cela invite à cartographier sa dépendance aux fournisseurs d’IA, à prévoir un modèle de repli et à exiger de la transparence sur l’hébergement et le comportement des modèles.