Mistral AI a mis en ligne ce mardi 6 octobre l'aperçu public de Mistral Large 4, que l'entreprise surnomme elle-même « le Chonk ». Le modèle compte 1 050 milliards de paramètres, dont 49 milliards activés par token, et accepte le texte comme l'image en entrée. Il est servi depuis les centres de données européens de Mistral, par l'API de Mistral Studio, à 1,36 dollar le million de tokens en entrée et 4,18 dollars en sortie. Les poids suivront « d'ici la fin du mois » selon le billet d'annonce, le 27 octobre selon The Next Web.

Mistral situe lui-même le modèle en une phrase. Large 4 serait « compétitif avec les modèles open source les plus forts au niveau mondial » et dépasserait « nettement tout modèle à poids ouverts développé aux États-Unis ou en Europe ». Auprès de CNBC, l'entreprise parle du modèle ouvert le plus capable hors de Chine, « avec une marge substantielle ». Les deux formules ne disent pas la même chose, et les mesures indépendantes ne les valident pas au même degré.

3 800 GPU Grace Blackwell et un saut de génération depuis Mistral Large 3

Large 4 a été entraîné à partir de zéro sur 3 800 GPU Nvidia Grace Blackwell installés dans les centres de données que Mistral possède en Europe, sur environ deux mois selon la déclaration de l'entreprise rapportée par CNBC et The Next Web. La fiche technique décrit un mélange d'experts dit granulaire, un encodeur de vision de 1,6 milliard de paramètres et une fenêtre de contexte d'un million de tokens, qu'Artificial Analysis mesure pour sa part à 524 000. Les données d'entraînement couvrent plus de 160 langues, parmi lesquelles toutes les langues officielles de l'Union européenne.

Le précédent modèle de pointe, Mistral Large 3, sorti le 2 décembre 2025, comptait 675 milliards de paramètres dont 41 milliards actifs. Il avait été entraîné sur 3 000 GPU H200 et publié le jour même sous licence Apache 2.0, sa version « raisonnement » étant alors annoncée pour plus tard. En dix mois, Mistral a changé de génération de puces, augmenté la taille totale de 56 % et fusionné instruction et raisonnement dans un seul modèle hybride.

Au 6 octobre, la même fiche technique affiche les tarifs de lancement barrés, remplacés par 0,68 dollar en entrée et 2,09 dollars en sortie, soit la moitié des prix de l'annonce, sans indication sur la durée de cette remise. La licence des poids, elle, n'y figure pas. La fiche porte la mention « Open » sans nommer de licence, là où la même documentation affiche Apache 2.0 pour Large 3 et une licence MIT modifiée pour Medium 3.5.

Un indice indépendant à 38 points, huit sous le meilleur modèle ouvert

Les résultats publiés par Mistral n'ont pas encore été répliqués. Sur DeepSWE v1.1, un test de programmation agentique, Large 4 obtient 61,7 %, devant GLM-5.3 et DeepSeek V4 Pro dans les graphiques de l'annonce. Le tableau publié la veille par Reflection AI pour son propre modèle reprend les mêmes valeurs pour GLM-5.3 et Qwen 3.8 Max, mais y ajoute Kimi K3 à 68 % et DeepSeek V4.1 Flash à 74,2 %, deux modèles absents du graphique de Mistral. CNBC relève que le modèle « reste en retrait de la frontière » dans des domaines comme le code.

La mesure la plus lisible vient d'Artificial Analysis, qui fait tourner ses propres évaluations. Son indice d'intelligence, consulté le 6 octobre, donne les positions suivantes :

  • modèles fermés : Claude Opus 5.5, 58 points ; GPT-6 Astra, 53 ;
  • poids ouverts chinois : MiMo-V2.6-Pro de Xiaomi, 46 ; GLM-5.3, 45 ; Kimi K3, 44 ; GLM-5.3-Flash, 42 ; Qwen3.8 2.4T, 40 ; Qwen3.8-Flash-Next, 40 ; DeepSeek V4.1 Flash, 39 ;
  • Mistral Large 4 Preview, 38 ;
  • DeepSeek V4 Pro, 36 ;
  • poids ouverts hors Chine : Motif 3 (Corée du Sud), 34 ; Inkling Small de Thinking Machines (États-Unis), 26 ; Mistral Medium 3.5, 14 ; gpt-oss-120b d'OpenAI, 12 ; Mistral Large 3, 9.

Sur cet indice, Large 4 est le huitième modèle à poids ouverts, à huit points de MiMo-V2.6-Pro et derrière six autres modèles chinois. « Compétitif avec les plus forts » se défend à l'échelle d'une génération plutôt que d'un classement. La seconde moitié de la phrase tient sans réserve, avec douze points d'avance sur le meilleur modèle ouvert américain mesuré. La formule donnée à CNBC, « hors Chine », se joue en revanche à quatre points du coréen Motif 3. Beam, présenté le 5 octobre par Reflection AI, n'était pas encore mesuré. Le saut le plus net reste interne. Mistral Large 3, modèle sans raisonnement sur un indice qui favorise le raisonnement, pointait à 9. Mistral précise que l'entraînement par renforcement « est encore en cours », que le modèle « ne montre aucun signe de saturation » et que cette première étape est financée par la levée de 3 milliards d'euros de septembre. Les chiffres de l'aperçu sont donc provisoires.

Artificial Analysis classe d'ailleurs Large 4, pour l'instant, parmi les modèles propriétaires, faute de poids publiés. Et la documentation qui met Large 4 en vitrine liste toujours, parmi ses modèles généralistes et avec la mention « third-party », GLM 5.3 de Z.ai, qui remplacera GLM 5.2 sur la plateforme à son retrait le 31 octobre. Mistral avait commencé à servir GLM-5.2 sur ses propres serveurs en août, une configuration qu'ActuIA décrivait début septembre comme celle d'une Europe qui assemble ce que la Chine fournit.

La cybersécurité, le terrain où plusieurs modèles fermés refusent la tâche

Mistral construit son argumentaire commercial sur un domaine précis, la cybersécurité, et c'est là que les chiffres indépendants lui sont le plus favorables. Sur le Cyber Index d'Artificial Analysis, qui combine trois évaluations de découverte, de reproduction et de correction de vulnérabilités dans de vrais dépôts de code, Large 4 Preview obtient 49,5 points et se classe cinquième des 18 modèles évalués au 6 octobre. Devant lui, Grok 4.7 (56,4), MiMo-V2.6-Pro (56,1), GPT-6 Luna (52,7) et GLM-5.3-Flash (49,9). Parmi les suivants, Muse Spark 1.3 de Meta (44,3), Kimi K3 (41,3), GLM-5.3 (36,4), GPT-6 Astra (33,4) et Claude Opus 5.5 (28,7).

Le détail de l'épreuve CyberGym-E2E, où il faut reproduire une vulnérabilité réelle puis la corriger, explique l'écart. Large 4 y réussit 81,7 % des tâches, le meilleur score des 18 modèles. GPT-6 Astra est à zéro avec un taux de refus de 100 %, Claude Opus 5.5 à 0,8 % avec 98,5 % de refus. Le refus relève d'une politique d'éditeur, puisque Grok 4.7 et GPT-6 Luna, fermés eux aussi, traitent la tâche. Mistral en tire son argument. « Les refus au niveau du fournisseur peuvent bloquer la recherche légitime de vulnérabilités et la réponse à incident », écrit l'entreprise, et perdre l'accès à une capacité au milieu d'un incident « peut devenir en soi un risque de sécurité critique ».

L'argument a un précédent documenté. Dans son compte rendu de l'intrusion menée par un agent autonome en juillet, Hugging Face explique avoir d'abord soumis son analyse forensique à des API commerciales, avant d'être bloqué par « les garde-fous de sécurité des fournisseurs, qui ne peuvent pas distinguer un répondant à incident d'un attaquant ». L'entreprise a fini par faire tourner l'analyse sur GLM-5.2, un modèle à poids ouverts, sur sa propre infrastructure, tout en précisant qu'il ne s'agissait « pas d'un argument contre les mesures de sécurité des modèles hébergés ». Guillaume Lample, cofondateur et directeur scientifique de Mistral, va plus loin dans la déclaration transmise à CNBC. Les capacités de cyberdéfense « permettront aux entreprises et aux gouvernements de se défendre contre des acteurs malveillants qui débrident des modèles fermés pour mener des cyberattaques ».

Mistral tient en parallèle un discours de prudence. Avant la publication des poids, le modèle est testé en conditions réelles par des responsables de cybersécurité, des partenaires agréés et des autorités étatiques, qui accèdent à une version « avec une modération réduite et des capacités cyber étendues ». La frontière entre la version publique et la version « étendue » tiendra toutefois à peu de chose une fois les poids téléchargeables, puisqu'un modèle ouvert se réentraîne.

Souveraineté, licence et calendrier, les trois questions pour les entreprises

Le matin même, avant l'annonce, Arthur Mensch participait à une discussion intitulée « Sovereign, Open, Safe : Pick Two? » au salon AI Everything d'Abou Dhabi. Le directeur général de Mistral y a estimé que « 99 % des cas d'usage » traités par l'entreprise peuvent l'être avec des modèles ouverts et qu'il n'y a « aucune raison de payer la marge d'API des modèles fermés ». « Le récit selon lequel l'Europe ne peut pas rivaliser n'est tout simplement pas vrai », a-t-il ajouté. Le billet promet une région européenne opérée de bout en bout par Mistral « sous le droit européen », puis un déploiement sur cloud privé ou sur site avec les poids.

Trois points restent à trancher pour un acheteur. La licence, absente de la fiche au 6 octobre, décidera si Large 4 se réutilise aussi librement que Large 3. Le coût d'exploitation reste inconnu, Mistral n'ayant pas publié de configuration matérielle de référence pour un modèle de 1 050 milliards de paramètres. Le calendrier, lui, est mouvant. Mistral indique que la capacité de calcul financée par la levée de septembre « arrive en ligne dans les mois à venir » et annonce « des améliorations importantes et rapides dans les semaines et les mois à venir ».

Avec les poids, Mistral promet des précisions sur l'architecture, des benchmarks complémentaires et sa méthode de post-entraînement. La licence ne figure pas dans cette liste.