Gemini 4 Argon : Google reprend la tête, et la garde fermée
13 benchmarks sur 18, un million de tokens en sortie, deux dollars le million en entrée — et un accès réservé à des équipes de cyberdéfense triées sur volet.
Le 30 septembre 2026, Google a annoncé Gemini 4 Argon, son premier modèle frontière depuis février. Et pour la première fois depuis longtemps, les tableaux de benchmarks penchent clairement du côté de Mountain View : Argon devance GPT-6 Astra et Claude Opus 5.5 sur 13 des 18 tests publiés. Le détail qui transforme l'annonce en objet politique : presque personne ne peut l'utiliser. L'accès initial passe par le Fairwind Program, réservé à des équipes de cyberdéfense jugées de confiance, pendant qu'une revue gouvernementale pré-déploiement se poursuit.
Gemini 4 Argon : ce que disent les chiffres
Sur les 18 benchmarks que Google a choisi de divulguer, Argon mène seul sur 12 et se classe premier ex aequo sur un treizième. GPT-6 Astra conserve trois premières places, Claude Opus 5.5 en garde deux.
Les résultats les plus parlants :
- DeepSWE v1.1 (ingénierie logicielle agentique) : 77,9 % pour Argon, contre 74,2 % pour Claude Opus 5.5 et 74,1 % pour GPT-6 Astra. Trois modèles dans un mouchoir de poche.
- Harvey Legal Agent Benchmark (analyse juridique) : 19,6 % contre 5,4 % pour GPT-6 Astra et 3,8 % pour Claude Opus 5.5. Un écart d'un facteur quatre.
- AutomationBench (automatisation de processus métier) : 51,3 % contre 42,5 % pour Claude Opus 5.5.
- GraphWalks (raisonnement sur contexte long) : 84,2 % contre 71,8 % pour GPT-6 Astra.
- LVBench (compréhension de vidéo longue) : 91,7 %, état de l'art.
- CWE-bench v1 (correction de vulnérabilités) : 68 %, premier ex aequo.
Le score Harvey mérite un instant d'attention. Passer de 5 % à 19,6 % sur un benchmark juridique agentique, ce n'est pas une amélioration incrémentale, c'est un changement de catégorie. Cela reste, au passage, un score de 19,6 % — autrement dit un modèle qui échoue sur quatre tâches juridiques complexes sur cinq. Le progrès est spectaculaire et le niveau absolu reste bas. Les deux sont vrais.
Un million de tokens en sortie : le vrai saut technique
Les benchmarks font les titres, mais la caractéristique la plus structurante d'Argon est ailleurs : un million de tokens en sortie, contre 64 000 pour la génération précédente. Un facteur quinze.
La fenêtre de contexte en entrée, tout le monde la connaît. La limite de sortie, beaucoup moins — et c'est elle qui coinçait en pratique. Un modèle incapable de produire plus de 64 000 tokens d'un coup ne peut pas générer une base de code complète, une refonte de documentation intégrale, ou un rapport d'audit de plusieurs centaines de pages sans découpage artificiel. Avec un million de tokens disponibles en écriture, Google vise explicitement les workflows dits « long-horizon » : des tâches qui s'étalent, se ramifient et produisent beaucoup.
Google appuie la démonstration sur ses usages internes, et ce sont les exemples les plus concrets de l'annonce :
- optimisation autonome de la mémoire dans ses propres centres de données, avec plus de 300 TiB libérés ;
- migrations de bases de code à grande échelle, de C et C++ vers Rust.
Deux chantiers massifs, ingrats, parfaitement adaptés à une machine qui ne se lasse pas.
Le prix, l'arme la plus efficace
La grille tarifaire d'introduction :
- 2 dollars par million de tokens en entrée ;
- 10 dollars par million de tokens en sortie ;
- 0,10 dollar par million pour l'entrée mise en cache, soit 95 % de remise.
Passé la période d'introduction, les tarifs doublent : 4 dollars en entrée, 20 en sortie. Même à ce niveau, le positionnement est agressif. Au lancement, Argon coûte environ un cinquième du tarif standard de GPT-6 Astra et la moitié de celui de Claude Opus 5.5.
La remise de 95 % sur le cache est sous-estimée. Pour un agent qui rejoue en boucle le même contexte volumineux — une base de code, un corpus réglementaire, un historique de tickets — c'est la ligne qui décide de la viabilité économique du produit. À 0,10 dollar le million, relire un gros contexte à chaque itération cesse d'être un problème de facture.
Le verrou : un modèle annoncé mais pas livré
Voilà où l'affaire devient intéressante. Argon sort en disponibilité restreinte. L'accès initial est réservé à des testeurs de confiance et à des défenseurs cyber via le Fairwind Program, le temps qu'aboutisse une revue gouvernementale préalable au déploiement. Google promet une ouverture aux abonnés AI Ultra et aux clients API payants « dès que possible ».
Annoncer les benchmarks d'un modèle que le public ne peut pas tester, c'est un exercice d'équilibriste. Les scores communiqués sont ceux du fournisseur, dans sa propre comparaison, sur les 18 benchmarks qu'il a retenus. Aucune contre-vérification indépendante n'est possible à ce stade. Toute la littérature sur l'évaluation des modèles rappelle la même chose : les chiffres annoncés par un laboratoire et les performances observées par des utilisateurs tiers ne coïncident pas toujours.
Il y a aussi une lecture plus franche de ce calendrier : réserver d'abord un modèle de pointe aux équipes de sécurité, alors qu'il excelle justement sur la correction de vulnérabilités (68 % sur CWE-bench v1), ressemble beaucoup à une gestion du double usage. Un modèle qui répare des failles sait aussi les trouver.
La course, vue de haut
Cette annonce ne vit pas seule. Elle tombe dans un mois de septembre-octobre 2026 saturé :
- OpenAI a renoncé à sortir GPT-6.1 Astra et lui a substitué GPT-6.1 Sol, présenté comme proche en performance sur le code agentique et l'usage d'ordinateur, pour un cinquième du prix du modèle abandonné, avec 1,05 million de tokens de contexte ;
- Anthropic a accéléré sur Claude Sonnet 5.5, plus de 30 % plus rapide que Sonnet 5 et jusqu'à 30 % moins cher par token.
Le schéma est net : les trois laboratoires ne se battent plus seulement sur la performance brute, mais sur le rapport performance/prix, et sur la capacité à tenir des tâches longues. La bataille des démonstrations impressionnantes cède la place à celle des coûts d'exploitation.
Ce qu'il faut en retenir
Gemini 4 Argon reprend l'avantage sur les benchmarks, casse les prix et multiplie par quinze la longueur de ce qu'il peut écrire d'un seul tenant. Trois arguments solides. En face : des scores non vérifiés par des tiers, un accès verrouillé, et des tarifs qui doubleront à la fin de la période d'introduction.
Pour quelqu'un qui construit aujourd'hui sur une API, la conclusion pratique est inconfortable : le modèle le mieux placé sur le papier n'est pas disponible, et celui qu'on peut utiliser maintenant sera probablement dépassé avant la fin du trimestre. C'est devenu le rythme normal du secteur.