DeepSeek V4 : le modèle chinois qui casse les prix et divise
1,6 trillion de paramètres, 80,6 % sur SWE-bench, un tarif dix fois inférieur à la concurrence — et toujours aucune vérification indépendante.
Le 13 août 2026, DeepSeek a fait passer son checkpoint V4-Pro-0813 en disponibilité générale. Pas une preview, pas une liste d'attente : de la production, ouverte, avec une grille tarifaire affichée. DeepSeek V4 revient donc au centre de la conversation, avec le même schéma qu'à chaque sortie du laboratoire chinois — des chiffres spectaculaires, une facture minuscule, et un silence assourdissant du côté des évaluateurs indépendants.
On a regardé ce qui tient et ce qui reste à démontrer.
Ce que c'est, techniquement
Deux modèles dans la famille, sortis initialement le 24 avril 2026 :
- V4-Pro : 1,6 trillion de paramètres au total, environ 49 milliards actifs par token.
- V4-Flash : 284 milliards de paramètres, environ 13 milliards actifs par token.
Les deux offrent une fenêtre de contexte d'un million de tokens. Les deux sont exclusivement textuels — pas de vision, pas d'audio, pas de vidéo. C'est un choix assumé, et il explique une partie de l'efficacité : quand on ne paie pas le coût d'entraînement d'encodeurs multimodaux, on met tout dans le raisonnement et le code.
Deux briques d'architecture méritent d'être citées, parce qu'elles ne sont pas cosmétiques :
- mHC (manifold-constrained hyper-connections) : un cadre mathématique qui contraint l'amplification du signal à rester sous un facteur 2. Traduit en langage humain : ça empêche l'entraînement d'un mélange d'experts géant de diverger, sans ajouter un surcoût significatif.
- DSA (DeepSeek Sparse Attention) : attention creuse compressée et hiérarchique, dont le coût croît de façon à peu près linéaire au lieu de quadratique sur les contextes longs.
C'est le deuxième point qui rend le million de tokens économiquement viable. La plupart des modèles annoncent une grande fenêtre ; peu la rendent utilisable sans exploser la facture.
Les benchmarks annoncés
Sur SWE-bench Verified — le test de référence pour la résolution de vraies issues GitHub — V4-Pro est donné à 80,6 %. C'est très haut. Cela le place à égalité pratique avec Claude Opus 4.7 sur cet exercice, et devant la plupart des modèles ouverts.
Sur LiveCodeBench et les épreuves de type Codeforces, V4-Pro est en tête des benchmarks orientés code.
Ailleurs, le tableau se dégrade :
- sur SimpleQA-Verified (rappel factuel pur), Gemini 3.1 Pro domine largement ;
- sur GPQA Diamond (raisonnement scientifique multi-étapes difficile), Claude reste devant ;
- sur HLE (Humanity's Last Exam), le benchmark académique le plus dur du moment : Claude Opus 4.7 à 46,9 %, V4-Pro à 37,7 %. Neuf points d'écart, ce n'est pas du bruit.
Le portrait est cohérent : un modèle taillé pour le code et l'agentique, moins solide dès qu'on lui demande de savoir des choses ou d'enchaîner un raisonnement long et retors.
Le vrai argument : le prix
C'est là que la discussion bascule. Les tarifs API, par million de tokens :
| Modèle | Entrée (miss) | Entrée (cache) | Sortie |
|---|---|---|---|
| V4-Flash | 0,14 $ | 0,0028 $ | 0,28 $ |
| V4-Pro | 0,435 $ | 0,003625 $ | 0,87 $ |
La remise de 75 % sur V4-Pro, initialement promotionnelle, est devenue permanente le 31 mai 2026.
Regardez la colonne du cache. 0,003625 $ le million de tokens en entrée mise en cache, c'est un ordre de grandeur qui change la conception des applications : relire un dépôt de code entier à chaque requête cesse d'être une folie budgétaire. Pour un agent qui tourne en boucle sur le même contexte, la différence avec les modèles occidentaux ne se compte pas en pourcentages mais en facteurs.
C'est aussi la stratégie assumée du laboratoire depuis deux ans : ne pas gagner la course à l'intelligence brute, mais rendre l'intelligence suffisante quasi gratuite.
Le problème : personne n'a vérifié
Il faut le dire clairement. Les gains annoncés — jusqu'à 49,9 points de pourcentage d'amélioration selon la communication du fournisseur — n'ont été répliqués par aucun évaluateur tiers au moment où le modèle passe en GA.
Ce n'est pas une accusation de tricherie. C'est un constat de méthode. Les benchmarks auto-rapportés souffrent de plusieurs biais bien identifiés :
- le choix du harnais d'évaluation (scaffold, nombre de tentatives, outils autorisés) change les scores SWE-bench de plusieurs points sans toucher au modèle ;
- la contamination des jeux de test par les données d'entraînement est difficile à exclure sur un corpus de cette taille ;
- un checkpoint daté (0813) n'est pas forcément celui qui a servi à produire les chiffres publiés.
Tant qu'Artificial Analysis, LMArena ou des équipes académiques n'ont pas repassé le modèle sur leurs propres pipelines, le 80,6 % reste une affirmation commerciale, pas un résultat.
Ce que ça implique concrètement
Pour une équipe technique française qui se demande si elle bascule, quelques repères :
- Sur le code de production, la seule évaluation qui compte est la vôtre. Prenez trente issues réelles de votre dépôt, faites tourner les deux modèles, comparez le taux de patch qui passe la CI. Ça coûte quelques euros avec ces tarifs.
- Sur les données sensibles, la question de la juridiction reste entière. L'API est hébergée en Chine ; pour du RGPD strict, il faut passer par un hébergeur tiers qui sert les poids ouverts, avec le surcoût que ça implique.
- Sur la stabilité, attention aux dépréciations. Les identifiants historiques
deepseek-chatetdeepseek-reasoneront été retirés le 24 juillet 2026. Le rythme de rotation est rapide, plus rapide que celui des fournisseurs américains.
Ce que cette sortie dit du marché
Août 2026 a vu défiler une dizaine de modèles en quelques semaines — Gemini 3.7 Flash, Seed 2.1 Turbo, GPT-5.6 Luna, Meta Muse Spark 1.1, et donc DeepSeek V4-Pro-0813. Neuf annonces datées en sept jours sur la seule première semaine du mois, venues de quatre fournisseurs de modèles, d'un laboratoire image-vidéo et d'un régulateur.
La compétition ne porte plus sur le score au sommet. Elle porte sur le rapport intelligence/prix, sur la latence, et sur la distribution — être présent par défaut dans Bedrock, dans un IDE, dans un assistant grand public.
DeepSeek joue une seule carte dans ce jeu, et il la joue bien : le coût. Reste à savoir si un modèle qui perd neuf points sur le raisonnement difficile mais coûte cinq fois moins cher est le bon choix pour votre cas d'usage. La réponse dépend entièrement de ce que vous lui demandez — et elle se mesure, elle ne se déduit pas d'un tableau de benchmarks.
Sources
- DeepSeek V4 Explained: V4-Pro 1.6T vs V4-Flash 284B
- TechTimes — DeepSeek V4 Pro 0813 Goes GA: Benchmark Claims Await Independent Proof
- Codersera — DeepSeek V4-Pro Review: Pricing, Benchmarks & Verdict
- Codersera — DeepSeek V4 Guide: Pro & Flash, GA + Pricing
- AI Model Releases: August 2026 Tracker and Dated Ledger