GolemTechNews
IA

Mistral Large 4 « Le Chonk » : 1 000 milliards de paramètres en Europe

Mistral sort son plus gros modèle, l'ouvre fin octobre et assume de se comparer aux chinois plutôt qu'aux américains. Les chiffres, les benchmarks, et ce qui coince.

La rédaction GolemTech News généré le 2026-10-07 5 min de lecture 5 sources
Mistral Large 4 « Le Chonk » : 1 000 milliards de paramètres en Europe
Illustration : GolemTech News (IA)

Mistral Large 4, surnommé Le Chonk par ses propres créateurs, a été dévoilé le 6 octobre 2026. Un nom de meme pour un modèle de 1 000 milliards de paramètres : la start-up parisienne a visiblement décidé que la sobriété marketing n'était plus une priorité. Derrière la blague, l'annonce est sérieuse — c'est le plus gros modèle jamais entraîné en Europe, et Mistral promet d'en publier les poids avant la fin du mois.

Ce qui rend l'affaire intéressante, ce n'est pas la taille. C'est le positionnement : Mistral ne prétend plus battre GPT-6 ou Claude. Elle se compare aux modèles ouverts chinois. Le terrain de jeu a changé.

Ce que Mistral a mis sur la table le 6 octobre

Mistral Large 4 est un modèle mixture-of-experts nativement multimodal : il avale texte et images sans module de vision greffé après coup. Sur le papier, 1 000 milliards de paramètres au total, dont 49 milliards activés à chaque inférence — c'est tout l'intérêt d'une architecture MoE, on ne réveille qu'une fraction du réseau par requête.

Petite zone de flottement à signaler : selon les relevés, les chiffres publiés ont circulé en deux versions (1 000 milliards avec 49 milliards actifs d'un côté, 675 milliards avec 41 milliards actifs dans certaines fiches techniques). Mistral a communiqué sur la première. Tant que les poids ne sont pas téléchargeables, personne d'extérieur ne peut trancher.

Le modèle est disponible en préversion publique via l'API de Mistral Studio, à 1,36 dollar le million de tokens en entrée et 4,18 dollars en sortie. Les poids ouverts, eux, sont annoncés pour le 27 octobre. Mistral a aussi donné un accès anticipé à des « responsables cybersécurité » et à des autorités étatiques avant l'ouverture large — un détail qui dit beaucoup de sa clientèle cible.

3 800 GPU, deux mois, dix mégawatts

L'entraînement s'est fait from scratch sur 3 800 GPU Nvidia Grace Blackwell, dans les centres de données que Mistral exploite en Europe. Environ deux mois de calcul, et de l'ordre de dix mégawatts de puissance consommée pendant la campagne. Ce n'est pas un détail d'ingénieur : c'est l'argument de souveraineté matérialisé en kilowattheures sur le sol européen.

Le corpus couvre plus de 160 langues, dont les 24 langues officielles de l'Union. Pour une administration estonienne ou un industriel portugais, c'est plus décisif qu'un point de benchmark.

Le contexte financier aide : en septembre 2026, Mistral a bouclé une série D de 3 milliards d'euros menée par Samsung, avec a16z et Nvidia au tour de table, pour une valorisation de 21 milliards. L'entreprise revendique plus de 125 grands comptes, dont Airbus, ASML et HSBC.

Benchmarks : costaud en cyber, moyen ailleurs

Là où Le Chonk impressionne vraiment, c'est la sécurité offensive et défensive :

  • top 5 mondial sur le Cyber Index d'Artificial Analysis ;
  • 82 % sur la reproduction et le patch de vulnérabilités ;
  • 93 % sur Cybench ;
  • 93,3 % d'attaques repoussées sur le B3 AI Security Benchmark.

Sur le reste, le tableau est plus contrasté :

  • code agentique : 62 % sur DeepSWE, devant GLM-5.3 de Zhipu (61 %) et DeepSeek-V4-Pro (57 %) — l'écart tient dans l'épaisseur du trait ;
  • finance : 67 % sur FinWorkBench, à égalité avec DeepSeek-V4-Pro, devant GLM-5.3 (65 %) ;
  • tâches juridiques : 15 %. Oui, quinze. Mistral y devance la plupart de ses concurrents, ce qui en dit surtout long sur le niveau général des modèles sur le droit ;
  • ancrage visuel : 73 % sur DIOR-RSVG (télédétection) contre 68 % pour GPT-6 Astra, et 42 % contre 41 % sur Dense 200.

Battre un modèle fermé américain sur du visual grounding, c'est la ligne que Mistral met en avant. Honnêtement, elle est méritée. Mais elle ne dit rien de la qualité de conversation ou de rédaction au quotidien, où les comparaisons sont beaucoup plus floues.

Pourquoi « open weights » n'est pas un détail

Guillaume Lample, cofondateur, résume l'argument commercial mieux que n'importe quelle plaquette : si vous utilisez un modèle fermé, rien ne garantit qu'il sera encore là demain. Déprécié, repricé, modifié sans préavis — tout utilisateur d'API a vécu au moins l'un des trois.

Des poids téléchargeables, ça change la nature du contrat :

  • vous pouvez geler une version et la faire tourner cinq ans ;
  • vous pouvez l'héberger dans un environnement sans sortie réseau, ce qui est la condition d'entrée dans la défense, le nucléaire ou la santé ;
  • vous pouvez l'auditer, le fine-tuner, le quantifier.

C'est exactement la stratégie qui a fait décoller DeepSeek, Qwen et Kimi : rendre le modèle incontournable chez les développeurs avant de monétiser. Mistral applique la recette avec un argument que les labos chinois n'ont pas : la juridiction européenne.

Les réserves qu'on entend déjà

Trois critiques reviennent, et elles sont fondées.

D'abord les concurrents chinois ouverts. Kimi K3 et GLM-5.3 restent redoutables et dépassent souvent Le Chonk sur les tâches générales et une partie du code. Le slogan « meilleur modèle ouvert hors de Chine » est précis — et il contient son propre aveu.

Ensuite les modèles fermés. L'écart avec GPT-6.1 ou Opus 5.5 est estimé à environ six mois par les observateurs. Six mois, dans ce secteur, c'est à la fois énorme et rattrapable.

Enfin l'usage réel. Lors des premiers tests publics, le modèle s'est montré très bavard dans sa phase de raisonnement, au point de saturer la fenêtre de contexte avant d'avoir produit sa réponse. Un tarif d'entrée à 1,36 dollar perd son charme si vous payez trois fois le raisonnement. Et héberger soi-même un modèle de cette taille, même MoE, suppose une infrastructure mémoire que peu d'entreprises alignent sans y réfléchir.

Ce qu'il faut surveiller d'ici au 27 octobre

Deux choses, pas plus.

La licence. « Open weights » ne veut pas dire Apache 2.0. Si Mistral assortit la publication de restrictions d'usage commercial, l'effet d'entraînement sur la communauté sera très différent de celui d'un Mistral Small 4 livré sous Apache.

Les versions quantifiées. Le succès des modèles ouverts se joue dans les 48 heures qui suivent la publication, quand la communauté sort les variantes 4 bits qui tournent sur du matériel raisonnable. Si personne ne peut faire tourner Le Chonk ailleurs que dans un centre de données, il restera une démonstration de souveraineté — pas un outil.

Rendez-vous le 27.

Sources

  1. Generation-NT — Mistral dévoile Mistral Large 4
  2. The Next Web — Mistral launches Large 4
  3. Mistral AI — Annonce officielle Mistral Large 4
  4. Stork.ai — Le Chonk: benchmarks, price and trade-offs
  5. CNBC — Mistral unveils new AI model

À lire aussi