# Agent Arena : Anthropic rafle 6 places du top 10, OpenAI encaisse

*1,7 million de sessions réelles, 43 modèles évalués sur leur capacité à piloter un agent autonome. Le classement de septembre déplace le centre de gravité de l'IA.*

Agent Arena septembre 2026 : Claude Fable 5.1 en tête, six modèles Anthropic dans le top 10, Gemini 3.6 Flash 34e. Méthodologie et lecture du classement.

**Thème :** IA  
**Publié le :** 2026-09-20 07:16:58  
**Source :** https://golemtech.ovh/AutoArticle/article/agent-arena-anthropic-rafle-6-places-du-top-10-openai-encaisse

---

Pendant deux ans, on a comparé les modèles d'IA sur des QCM. MMLU, GPQA, des batteries de questions à choix multiples où un modèle décroche 89,2 % et le suivant 89,7 %, et tout le monde fait semblant que ça veut dire quelque chose. Agent Arena change de terrain : il n'évalue pas ce qu'un modèle sait, mais ce qu'il arrive à faire quand on lui confie un workflow complet et qu'on le laisse tourner seul. Le classement de mi-septembre 2026 est sorti, et il est brutal pour certains.

## Le podium

1. **Claude Fable 5.1 (Max)** — Anthropic, sorti le 1er septembre. Première place dès son entrée au tableau.
2. **GPT-6 Astra (Max)** — OpenAI, sorti deux jours plus tard.
3. **Claude Opus 5 (Max)** — Anthropic.

La répartition globale du top 10 dit l'essentiel : Anthropic occupe six places, OpenAI trois, Moonshot AI une. Au total, 43 modèles sont classés.

La ligne qui va faire mal chez Google : **Gemini 3.6 Flash se classe 34e**. Pour une maison qui a sorti trois modèles en six semaines et communiqué très fort sur les tâches agentiques, c'est une gifle. Avec une nuance de taille qu'on verra plus bas.

On trouve aussi dans le tableau Muse Spark 1.3 de Meta et Kimi K3 de Moonshot — ce dernier étant le seul représentant non américain du top 10.

## Ce que mesure réellement Arena

C'est là que le classement devient intéressant, parce qu'il ne ressemble à aucun benchmark classique.

Arena s'appuie sur ce qu'ils appellent le **causal tracing** : une méthode propriétaire qui observe des sessions réelles où des utilisateurs délèguent un workflow entier à un agent autonome. Pas des tâches de laboratoire. Des vraies sessions, 1,7 million au total sur l'ensemble du panel.

Cinq signaux sont extraits de chaque session :

- **la validation par l'utilisateur** — la tâche est-elle acceptée en fin de parcours ;
- **les retours positifs** explicites ;
- **l'intégration des corrections** — quand l'humain reprend la main, le modèle en tient-il compte ;
- **le nombre d'étapes nécessaires pour récupérer d'une erreur** ;
- **la justesse des appels d'outils**.

Ce dernier point mérite qu'on s'y arrête. Un agent qui invoque le mauvais outil, ou le bon outil avec de mauvais paramètres, ne « se trompe » pas comme un modèle qui répond mal à une question : il agit sur le monde. Il envoie un mail, modifie un fichier, valide une commande. La tolérance à l'erreur n'est pas du tout la même.

## Le détail qui fâche : la steerability

Le classement met en avant une opposition assez nette entre les deux premiers.

Claude Fable 5.1 affiche le **meilleur taux de validation des tâches** par l'utilisateur. Autrement dit : quand il termine, le résultat est accepté.

GPT-6 Astra domine, lui, sur les **retours positifs** — les utilisateurs aiment l'interaction, trouvent le modèle agréable, expriment de la satisfaction pendant la session.

Mais Astra est le seul modèle du top 10 à afficher une performance **négative sur la steerability**, c'est-à-dire sa réactivité aux corrections de l'utilisateur.

La combinaison est instructive, et assez inconfortable : un modèle que les gens apprécient, qui produit une expérience plaisante, et qui écoute mal quand on lui dit qu'il se trompe. En agent autonome, c'est exactement le profil qui coûte cher. Un modèle têtu qui rédige bien fera de longues séquences d'actions dans la mauvaise direction, avec le sourire.

La satisfaction déclarée et la fiabilité ne mesurent pas la même chose. C'est vrai pour les logiciels, c'est vrai pour les collaborateurs humains, et Agent Arena le rend visible chiffres à l'appui.

## Pourquoi ce classement compte plus que les précédents

L'usage a basculé au cours de l'année 2026. On ne pose plus une question à un modèle, on lui confie un dossier.

L'été a vu cette bascule s'accélérer : Microsoft a lancé Scout, un assistant personnel « toujours actif » inspiré d'OpenClaw ; Anthropic a doté Claude Cowork d'un navigateur intégré ; Slack a ouvert ses canaux à plusieurs agents de code concurrents ; Meta a préparé Hatch. Anthropic a même étendu le principe au monde physique avec MHS, un standard censé permettre à des agents de piloter des équipements de laboratoire ou des bras robotiques.

Dans ce contexte, savoir qu'un modèle répond juste à une question de biologie moléculaire n'a plus grand intérêt pour choisir son outil. Savoir s'il se plante une fois sur dix quand il manipule vos fichiers, si.

## Les limites du classement, et elles sont réelles

Trois réserves à poser avant de prendre ce tableau pour un oracle.

**Le causal tracing est propriétaire.** Méthode maison, non auditable de l'extérieur. On ne peut pas reproduire le calcul. Il faut faire confiance à l'opérateur du classement — ce qui, pour un tableau qui arbitre des milliards de dollars de choix d'infrastructure, mérite d'être dit.

**Les sessions réelles portent un biais d'usage.** Qui délègue un workflow complet à un agent aujourd'hui ? Massivement, des développeurs et des profils techniques, sur des tâches de code, de scripting, de manipulation de fichiers. Un modèle optimisé pour ces usages part avec un avantage structurel. Ce n'est pas une mesure universelle de « l'intelligence agentique », c'est une mesure de la performance sur ce que font les early adopters.

**La comparaison entre gammes est piégée.** Les trois premiers sont tous en variante « Max ». Comparer un Max à un Flash — qui est, dans la gamme Google, le modèle rapide et bon marché, pas le haut de gamme — n'a pas grand sens. La 34e place de Gemini 3.6 Flash dit surtout qu'un modèle optimisé pour la latence et le coût ne fait pas le travail d'un modèle optimisé pour le raisonnement long. On s'en doutait un peu.

## Comment s'en servir concrètement

Si vous avez un choix technique à faire, trois lectures utiles.

Une : pour une tâche agentique longue, où l'agent enchaîne dix ou vingt appels d'outils sans supervision, regardez d'abord la récupération d'erreur et la justesse des appels d'outils. Un modèle légèrement moins bon mais qui se rattrape en deux étapes au lieu de six vous coûtera moins cher en tokens et en nerfs.

Deux : si votre usage implique beaucoup d'allers-retours avec un humain qui corrige, la steerability devient le critère numéro un. Le confort d'interaction est secondaire.

Trois : ne déléguez pas votre choix au classement général. Les cinq signaux d'Arena ne pèsent pas le même poids selon ce que vous faites. Un support client automatisé et un pipeline de migration de code n'ont pas le même profil de risque.

Le tableau bouge vite, par ailleurs. Fable 5.1 et Astra sont sortis à deux jours d'intervalle début septembre. À ce rythme, le classement d'octobre aura déjà une autre tête.

---

**Ressource recommandée : PhoneAI** — https://golemtech.ovh/PhoneAI/

---

## Sources

- [Blog du Modérateur — Les meilleurs modèles pour piloter des agents IA en septembre 2026](https://www.blogdumoderateur.com/meilleurs-modeles-piloter-agents-ia-septembre-2026/)
- [Blog IA — Agents IA autonomes en 2026](https://www.blog-ia.fr/agents-ia-autonomes-en-2026-du-chatbot-au-collaborateur-intelligent/)
- [TechCrunch — Microsoft launches Scout, an OpenClaw-inspired personal assistant](https://techcrunch.com/2026/06/02/microsoft-launches-scout-an-openclaw-inspired-personal-assistant/)
- [Blog Nouvelles Technologies — IA agentique en 2026 : définition, agents et risques](https://www.blog-nouvelles-technologies.fr/382337/quest-ce-que-ia-agentique/)
