DeepSeek V4.1 Flash : l'écart avec les labos américains tombe à 3 %
Sur LiveBench, 2,3 points séparent désormais le modèle chinois du meilleur Anthropic. Et sur le code agentique, il passe devant.
Il y a un chiffre qui circule depuis le relevé de classement du 4 octobre et qui mérite qu'on s'y arrête : 81,1. C'est le score de DeepSeek V4.1 Flash sur LiveBench. Le meilleur modèle d'Anthropic est à 83,4. Soit 2,3 points, environ 3 % d'écart. En mai, l'écart était d'environ 9 %. En début d'année, autour de 15 %. La courbe ne laisse pas beaucoup de place à l'interprétation.
Un rattrapage qui s'accélère
Trois mesures, trois moments de 2026 :
- début d'année : ~15 % d'écart entre le meilleur modèle chinois et le meilleur modèle américain sur LiveBench ;
- mai : ~9 % ;
- octobre : ~3 %.
Le détail le plus gênant pour les laboratoires américains n'est pas le score global mais un sous-benchmark. Sur le code agentique — un modèle qui enchaîne des actions, lit des fichiers, lance des tests, corrige —, DeepSeek obtient 77,3 contre 66,1 pour Anthropic. Pas un écart cosmétique. Onze points sur la compétence précise que toute l'industrie du développement logiciel est en train d'acheter.
À relativiser toutefois : sur l'ensemble du top 15 de LiveBench, seules trois entrées sont chinoises. Le sommet reste occupé par les labos américains. Ce qui a changé, c'est la hauteur de la marche.
Ce qu'est précisément V4.1 Flash
Sorti le 10 septembre 2026, V4.1 Flash est présenté par DeepSeek comme le plus petit membre de sa nouvelle famille d'architectures — pensée pour une inférence rapide, un débit élevé et un passage à l'échelle vers des modèles plus gros.
Caractéristiques revendiquées :
- fenêtre de contexte de 1 million de tokens, sortie maximale de 384 000 tokens ;
- compréhension visuelle multimodale native, intégrée à l'architecture et non déportée sur un endpoint de vision séparé ;
- un travail de fond sur la compression du cache KV, documenté dans un papier dédié sur arXiv.
Ce dernier point n'est pas de la cuisine interne. Le cache KV, c'est la mémoire de travail d'un modèle pendant qu'il génère. Plus le contexte est long, plus il gonfle, plus il coûte cher en VRAM. Compresser ce cache, c'est servir un million de tokens de contexte sans faire exploser la facture matérielle. Quand on dispose de moins de GPU de dernière génération que ses concurrents, c'est là qu'on gagne.
Les autres scores, et la grille tarifaire
Les chiffres publiés par DeepSeek sur la série de benchmarks habituels :
- 90,6 sur Terminal-Bench 2.1 (contre 82,7 pour le V4 Flash précédent) ;
- 74,2 % sur DeepSWE v1.1 (contre 54,4 avant) ;
- 88,1 sur CyberGym, orienté tâches de sécurité ;
- 65,4 sur NL2Repo-Bench ;
- 90,9 sur GPQA Diamond ;
- un elo Codeforces de 3 471.
Le saut de 54,4 à 74,2 sur DeepSWE en une génération est le genre de progression qui ne s'obtient pas par simple ajustement d'hyperparamètres.
Mais la vraie arme reste le prix. En heures creuses : 0,003 $ par million de tokens d'entrée mis en cache, 0,15 $ pour l'entrée non mise en cache, 0,60 $ pour la sortie. En heures pleines, ces tarifs doublent. Même doublés, ils restent sans rapport avec ce que facturent les modèles premium occidentaux. Pour un agent de code qui relit cinquante fois le même dépôt, le tarif d'entrée mis en cache change la nature du calcul économique.
Pourquoi ça va si vite
Deux explications dominent, et elles ne s'excluent pas.
La première est technique : optimisation logicielle agressive, exploitation maximale du matériel disponible, architectures pensées pour le rapport capacité/coût plutôt que pour la performance brute. Quand on ne peut pas empiler les puces, on optimise.
La seconde est géopolitique et plus inconfortable pour Washington : ce resserrement interroge l'efficacité réelle des contrôles à l'export de puces. L'intention était de ralentir. Le résultat observable est un écart de benchmark qui se referme.
L'autre face du tableau est financière. Robert Lea, analyste chez Bloomberg Intelligence, résume la situation du secteur chinois : « Mettre le secteur de l'IA chinois sur une trajectoire de profit soutenable exigera un refroidissement de la pression concurrentielle, une consolidation du secteur, et une approche plus rationnelle des prix. » Plus de 1 100 grands modèles de langage coexistent en Chine. Cette profusion produit de l'innovation et des prix cassés — elle ne produit pas de marges.
Ce que les benchmarks ne mesurent pas
Un avertissement nécessaire. LiveBench est l'un des classements les plus honnêtes du marché, parce qu'il renouvelle régulièrement ses questions pour limiter la contamination des jeux d'entraînement. Il reste un thermomètre partiel.
Ce qu'un score de 81,1 ne dit pas :
- la fiabilité sur des tâches longues et peu cadrées, celles qui comptent en production ;
- la qualité du refus face aux demandes problématiques ;
- la stabilité d'un modèle servi en volume, au-delà de la démonstration ;
- et pour une entreprise européenne, les questions de localisation des données et de conformité, qui pèsent souvent plus lourd qu'une différence de 2,3 points.
Une revue indépendante attribue à V4.1 Flash un 9,5/10 en le qualifiant de l'un des modèles les plus solides côté rapport qualité-prix pour les agents de code et les usages d'API à fort volume — tout en précisant qu'il ne remplace pas les modèles premium sur les tâches les plus exigeantes. Un positionnement, pas un sacre.
Ce que ça change concrètement
Pour une équipe qui construit sur des API, la décision se reformule. Il ne s'agit plus de choisir entre un modèle bon et un modèle bon marché. Il s'agit d'accepter ou non 3 % d'écart moyen contre une division du coût par un facteur important, avec un gain net sur certaines tâches de code.
Beaucoup vont arbitrer par usage : le modèle premium sur le raisonnement difficile et le contact client, le modèle chinois sur le volume, les tests, la relecture de code, l'extraction de données. C'est déjà la pratique dans les équipes qui comptent leurs tokens.
La question de fond, elle, reste ouverte pour les six prochains mois : que se passe-t-il quand l'écart approche zéro et que l'un des deux camps facture quarante fois moins ? Les laboratoires américains ont jusqu'ici répondu par la sortie d'un modèle plus puissant. Ça marche tant que le saut de génération reste visible à l'œil nu.