Grok 4.6 : xAI casse les prix et vise les agents qui tournent longtemps
Sorti le 12 août, le nouveau modèle d'Elon Musk égale GPT-5.6 sur les benchmarks pour moitié moins cher. Et reste indisponible en Europe.
Cinq semaines. C'est le délai qui sépare Grok 4.5 de Grok 4.6, mis en ligne le 12 août 2026 par xAI. Dans n'importe quelle autre industrie, sortir une version majeure de son produit phare tous les mois et demi relèverait de la panique. Dans l'IA de 2026, c'est devenu le rythme de croisière. Ce qui distingue cette sortie des précédentes tient en une ligne du tableau tarifaire : 2 dollars le million de tokens en entrée, 6 dollars en sortie. Soit environ la moitié de ce que facturent les modèles de frontière concurrents.
Ce qui a changé sous le capot (spoiler : pas la taille)
Grok 4.6 repose sur la même base que Grok 4.5 : 1 500 milliards de paramètres. Aucune inflation du modèle. Les gains viennent du post-entraînement — apprentissage par renforcement étendu, notamment sur l'optimisation de kernels, le développement web et la CAO.
Ce détail dit beaucoup de l'état de la discipline. Pendant trois ans, progresser signifiait grossir. Depuis un an, les laboratoires récoltent leurs gains ailleurs : dans la qualité des données de renforcement, dans la distillation, dans la façon dont le modèle décide de dépenser son budget de raisonnement. Grok 4.6 est un cas d'école de cette bascule.
L'autre évolution notable est la fenêtre de contexte : 500 000 tokens. Environ l'équivalent d'un million et demi de caractères, soit une base de code de taille moyenne, ou la totalité des comptes rendus d'un projet sur un an.
Les chiffres de performance
Sur l'Artificial Analysis Intelligence Index, l'agrégateur de benchmarks devenu la référence officieuse du secteur, Grok 4.6 marque 61 points. Repères :
- à égalité avec GPT-5.6 Sol Max, le haut de gamme d'OpenAI ;
- deux points derrière Claude Opus 5, à 63 ;
- cinq points de mieux que Grok 4.5, sorti en juillet.
Les progressions les plus nettes concernent les tâches agentiques, ce qui n'est pas un hasard vu le positionnement revendiqué :
- DeepSWE (résolution de tickets logiciels réels) : de 54 à 65,9.
- APEX-Agents : de 47,1 à 57,5.
Un chiffre m'intéresse davantage que les scores bruts : sur des tâches complexes, Grok 4.6 boucle en une cinquantaine d'étapes là où Claude Opus 5 en consomme environ le double. Quand on facture à l'usage et qu'un agent tourne en boucle pendant des heures, l'efficacité par étape pèse plus lourd que deux points d'indice.
Le vrai sujet, c'est la grille tarifaire
Décomposons, parce que le marketing s'arrête souvent à la première ligne :
- Entrée standard : 2 $ par million de tokens.
- Sortie standard : 6 $ par million.
- Entrée mise en cache : 0,50 $ par million.
- Au-delà de 200 000 tokens de contexte, les tarifs doublent : 4 $ en entrée, 12 $ en sortie.
Ce dernier point mérite d'être lu deux fois. La fenêtre de 500 000 tokens est vendue comme l'argument différenciant, mais son exploitation réelle bascule dans une grille à prix double dès qu'on dépasse 200 000. Le contexte long existe, il n'est simplement pas gratuit — ce qui est cohérent avec le coût mémoire de l'attention, mais mérite d'être intégré au calcul avant de migrer un pipeline entier.
Sur la sortie, l'économie annoncée face à Claude Opus 5 tourne autour de 60 %. Pour une équipe qui brûle plusieurs milliers d'euros par mois en tokens, l'arbitrage n'est plus philosophique.
Une guerre des prix qui a commencé ailleurs
Grok 4.6 ne déclenche pas ce mouvement, il y répond. Les six semaines précédentes :
- 21 juillet — Google sort Gemini 3.6 Flash, qui consomme 17 % de tokens de sortie en moins que la version précédente à qualité comparable. Baisser la consommation, c'est baisser la facture sans toucher au tarif affiché.
- 24 juillet — Anthropic complète sa gamme avec Claude Opus 5, quatrième modèle en moins de deux mois, positionné à moitié prix de Fable 5.
- 30 juillet — OpenAI coupe de 80 % le tarif de Luna sur son API et de 20 % celui de Terra, en réponse assumée à la pression des modèles chinois à bas coût.
L'écart de performance entre les cinq ou six modèles de tête tient désormais dans une poignée de points d'indice. Quand la différenciation technique se réduit à ça, le terrain de bataille se déplace mécaniquement vers le prix, la latence et la disponibilité. C'est exactement ce qu'on observe.
Les zones d'ombre
Trois réserves, et elles ne sont pas cosmétiques.
L'Europe n'y a pas droit. Grok 4.6 est distribué via Grok Build (abonnement SuperGrok), l'éditeur Cursor, OpenRouter, Vercel et Cloudflare — mais l'accès reste indisponible dans l'Union européenne. xAI ne détaille pas ses raisons ; l'entrée en application des obligations de l'AI Act pour les modèles à usage général, échelonnée depuis l'été 2025, offre une explication évidente. Pour une entreprise française qui construit son socle technique, un fournisseur inaccessible n'est pas un fournisseur.
Le cycle de sortie décrédibilise l'annonce elle-même. Musk a indiqué que Grok 4.7 serait « nettement meilleur » et prêt sous trois à quatre semaines, avec l'intégration de données issues de SpaceX — les deux entités ayant fusionné. Grok 5 est attendu pour la fin d'année. Difficile de bâtir une architecture de production sur un modèle dont le successeur est annoncé avant que la documentation du précédent soit stabilisée.
Les benchmarks saturent. DeepSWE, APEX-Agents et consorts sont des proxys utiles, pas des mesures d'utilité. Un modèle qui gagne douze points sur la résolution de tickets GitHub ne produit pas nécessairement du meilleur code sur votre base propriétaire, avec vos conventions et votre dette technique. Le seul test qui compte reste l'évaluation interne sur vos propres tâches.
Faut-il migrer ?
Trois profils, trois réponses.
- Vous faites tourner des agents longs, du code agentique, de l'automatisation à gros volume, et vous êtes hors UE : le calcul penche franchement pour Grok 4.6. L'écart de prix compense largement les deux points d'indice manquants, et l'efficacité par étape amplifie l'écart.
- Vous êtes en Europe : la question ne se pose pas encore. Regardez plutôt du côté des offres accessibles et de ce que la baisse générale des tarifs vous permet de renégocier.
- Vous cherchez la qualité maximale sur du raisonnement difficile, sans contrainte de budget : Claude Opus 5 garde la tête de l'indice, et deux points à ce niveau se voient sur les tâches les plus dures.
Ce qui se joue avec cette sortie dépasse xAI. En dix-huit mois, le coût du token de sortie sur un modèle de frontière a été divisé plusieurs fois. Les applications qui n'étaient pas rentables à 30 dollars le million le deviennent à 6. C'est là que les prochains produits vont apparaître — pas dans le classement des benchmarks.