GolemTechNews
IA

Gemini 3.8 Flash : Google sort son troisième modèle en six semaines

Meilleur sur tous les benchmarks maison, moins cher que la concurrence à intelligence égale — mais il brûle plus de tokens et son prix double le 1er janvier.

La rédaction GolemTech News généré le 2026-09-12 6 min de lecture 4 sources
Gemini 3.8 Flash : Google sort son troisième modèle en six semaines
Illustration : GolemTech News (IA)

Trois modèles Flash en six semaines. Le 13 août, Gemini 3.7 Flash. Le 2 septembre 2026, Gemini 3.8 Flash. À ce rythme, la numérotation va finir par ressembler à une plaque d'immatriculation. Derrière la cadence, il y a un message assez clair envoyé par Google : dans une période de remaniements internes chez DeepMind et de lancements produits repoussés, l'entreprise tient à rappeler qu'elle est toujours sur la ligne de front.

Ce que Gemini 3.8 Flash apporte réellement mérite un examen moins enthousiaste que les communiqués. Il y a du solide, et il y a un piège.

Ce qui a été lancé, et où

Le modèle est multimodal en entrée — texte, image, audio, vidéo, PDF — avec une fenêtre de contexte d'un million de tokens et 64 000 tokens en sortie. Il est disponible depuis le 2 septembre sur :

  • l'application Gemini, pour les abonnés Google AI Pro et Ultra ;
  • le mode AI de la recherche Google ;
  • Gemini dans Google Sheets ;
  • Google AI Studio ;
  • l'API Gemini.

La date de coupure des connaissances est fixée à mars 2026 pour l'essentiel des domaines, avec des zones où elle remonte à janvier 2025. Le positionnement annoncé : le code au long cours et les agents autonomes, c'est-à-dire les tâches où le modèle doit enchaîner des dizaines d'appels d'outils sans qu'un humain repasse derrière.

Les chiffres

Sur l'Intelligence Index en mode raisonnement élevé, Gemini 3.8 Flash marque 59, soit trois points de mieux que son prédécesseur. Ça le place à égalité avec GPT-5.6 Sol et Grok 4.6. Devant, on trouve Claude Fable 5.1 à 66 et Claude Opus 5 à 63.

Donc non, ce n'est pas le meilleur modèle du marché. Mais le vrai argument de Google n'est pas là, il est dans le rapport qualité-prix :

  • 0,75 $ par million de tokens en entrée, 3,75 $ en sortie — tarif d'introduction.
  • 0,58 $ par tâche de l'Intelligence Index, ce qui en fait le modèle le moins cher à ce niveau d'intelligence.
  • En face, Claude Fable 5.1 tourne autour de 3,76 $ par tâche, soit environ six fois plus.

Sur DeepSWE v1.1, un benchmark d'ingénierie logicielle complexe, le modèle dépasse la plupart des modèles frontière bien plus gros que lui. C'est le résultat qui a fait le plus parler, parce qu'un « petit » modèle qui bat des mastodontes sur du raisonnement multi-étapes n'était pas acquis il y a un an.

Le détail que Google admet lui-même

Voilà où ça devient intéressant, et honnête à porter au crédit de Google. Gemini 3.8 Flash n'est pas construit sur un nouveau modèle de base : c'est une évolution de 3.7 Flash. Sa progression vient largement du fait qu'il travaille plus dur — il exécute davantage d'étapes de raisonnement, appelle les outils de façon itérative, et consomme donc nettement plus de tokens de réflexion sur les requêtes complexes.

Google va jusqu'à recommander explicitement de rester sur 3.7 Flash si votre priorité est l'efficience. C'est une phrase qu'on ne lit pas souvent dans une annonce de lancement.

La conséquence pratique est immédiate pour quiconque facture à l'usage : le prix affiché par million de tokens ne dit rien du coût réel. Un modèle 20 % moins cher au token mais qui en consomme 60 % de plus sur vos prompts est un modèle plus cher. La seule façon de trancher, c'est de rejouer votre propre charge de travail et de comparer les factures. Pas les tableaux de benchmarks.

Le 1er janvier 2027, la note double

À surveiller de très près : les tarifs annoncés sont des tarifs d'introduction, valables jusqu'au 31 décembre 2026. Au 1er janvier 2027, ils doublent — 1,50 $ en entrée, 7,50 $ en sortie.

Si vous construisez aujourd'hui un produit dont l'économie repose sur le coût unitaire de Gemini 3.8 Flash, votre modèle financier a une date d'expiration inscrite dans le calendrier. Ce n'est pas un détail de bas de page, c'est un multiplicateur par deux sur la ligne de coût principale d'une application IA. Les équipes qui ont dimensionné leurs marges sur le tarif de septembre feraient bien de refaire leurs tableaux maintenant, pas en décembre.

Gemini 3.8 Flash Cyber, la variante dont personne ne parle

En parallèle, Google a lancé une déclinaison verrouillée baptisée 3.8 Flash Cyber, distribuée en accès restreint via le Fairwind Program. Sa spécialité : la recherche et la correction de vulnérabilités logicielles. Elle vise les gouvernements, les opérateurs d'infrastructures critiques et les mainteneurs de logiciels.

L'intérêt stratégique est évident. Un modèle capable de lire des bases de code entières et d'y repérer des failles est utile aux défenseurs — et tout aussi utile aux attaquants. D'où la distribution sous contrôle, avec liste d'accès plutôt qu'API ouverte. On verra si la digue tient. Historiquement, ce type de capacité finit par se diffuser, soit par fuite, soit par réplication en open source quelques mois plus tard.

Ce que cette sortie dit de la course

Trois lectures se dégagent.

La première, c'est que la frontière de l'IA ne se déplace plus par sauts de génération mais par itérations serrées. Trois Flash en six semaines, ce n'est pas de la R&D fondamentale, c'est du post-entraînement et de l'optimisation d'inférence livrés en continu. Le rythme produit a remplacé le rythme scientifique.

La deuxième, c'est que la bataille se joue désormais sur le coût par tâche réussie, pas sur le score brut. Google ne prétend pas battre Anthropic sur l'intelligence pure. Il prétend délivrer 90 % du résultat pour un sixième du prix. Pour un développeur qui lance des milliers d'appels par jour, c'est l'argument qui décide.

La troisième, plus inconfortable, c'est que « faire réfléchir le modèle plus longtemps » est devenu le levier d'amélioration le plus rentable. On gagne des points de benchmark en dépensant du calcul à l'inférence. Ça marche. Mais c'est aussi un aveu : les gains architecturaux se font plus rares, et le client paie la différence en tokens.

Faut-il basculer ?

Si vous faites du code agentique long, des pipelines multi-étapes, de l'analyse de documents volumineux : le test vaut le coup, et le rapport prix-performance est difficile à ignorer d'ici décembre.

Si votre usage est de la classification, de l'extraction, du résumé à gros volume — bref tout ce qui est simple et massif — Google vous dit lui-même de ne pas bouger. Restez sur 3.7 Flash, votre facture vous remerciera.

Et dans tous les cas, notez la date du 31 décembre 2026 quelque part. C'est elle qui coûtera le plus cher.

Sources

  1. The Register — With Gemini 3.8 Flash, Google reminds everyone it's still in the race
  2. 9to5Google — Gemini 3.8 Flash rolling out three weeks after last release
  3. eesel AI — Gemini 3.8 Flash review 2026: benchmarks, pricing, and the catch
  4. Codersera — Gemini 3.8 Flash: Specs, Pricing, What Changed (2026)

À lire aussi