cd /news/large-language-models/gemini-3-8-flash-vs-3-7-flash-nouvea… · home topics large-language-models article
[ARTICLE · art-120014] src=dev.to ↗ pub= topic=large-language-models verified=true sentiment=· neutral

Gemini 3.8 Flash vs 3.7 Flash : Nouveautés et faut-il mettre à jour ?

Google released Gemini 3.8 Flash on September 2, 2026, three weeks after Gemini 3.7 Flash, with the same pricing and context window but improved reasoning and tool use. Benchmarks show modest gains over 3.7 Flash, such as a higher Artificial Analysis intelligence index (59 vs. 56) and a 12-point improvement on the τ³-Banking tool-use benchmark. Google says 3.8 Flash is its most intelligent Flash model, but 3.7 Flash remains fully supported, so migration is not urgent.

read9 min views2 publishedSep 3, 2026

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines après Gemini 3.7 Flash et six semaines après 3.6 Flash. Le prix de lancement reste identique — 0,75 $ en entrée et 3,75 $ en sortie par million de jetons jusqu'au 31 décembre — tout comme le contexte d'un million de jetons et une vitesse annoncée comme similaire. La différence principale est le fonctionnement du modèle : raisonnement en étapes plus courtes, vérification de ses propres résultats et appels d'outils itératifs. Les scores progressent, mais chaque tâche peut consommer davantage de jetons.

Essayez Apidog dès aujourd’hui

La vraie question n'est donc pas de savoir si 3.8 Flash est meilleur — sur le papier, oui — mais si le gain de qualité justifie le coût supplémentaire pour votre charge de travail et si votre code supporte les changements d'API.

Google indique que Gemini 3.7 Flash « reste entièrement pris en charge » et n'a annoncé aucune date de dépréciation. La migration n'est pas urgente.

Critère Gemini 3.8 Flash Gemini 3.7 Flash
ID du modèle gemini-3.8-flash
gemini-3.7-flash
Date de sortie 2 septembre 2026 13 août 2026
Base « Basé sur Gemini 3.7 Flash »
Contexte / sortie maximale 1 048 576 / 65 536 jetons Identique
Prix d'entrée jusqu'au 31 décembre 2026 0,75 $ / million 0,75 $ / million
Prix de sortie jusqu'au 31 décembre 2026 3,75 $ / million, réflexion incluse 3,75 $ / million, réflexion incluse
Prix standard à partir du 1er janvier 2027 1,50 $ / 7,50 $ 1,50 $ / 7,50 $
Lecture du cache de contexte 0,075 $ / million au lancement Identique
Traitement par lots Réduction de 50 % Identique
Niveaux de réflexion
low , medium par défaut, high
low , medium , high
Niveau minimal Erreur de validation Accepté, à mapper vers low
Date limite de connaissance Mars 2026 Non précisée dans la documentation 3.8
Vitesse de sortie Environ 300 jetons/s Environ la même vitesse
Indice d'intelligence Artificial Analysis 59 56
Support Version actuelle Entièrement prise en charge

Les deux modèles partagent :

generateContent

.La vitesse est également proche. Google décrit 3.8 Flash comme ayant « le même prix que 3.7, et une vitesse similaire ». Artificial Analysis a mesuré 302,1 jetons de sortie par seconde au niveau high

. Le temps avant le premier jeton était toutefois de 13,30 secondes, car le modèle raisonne avant de commencer à répondre.

Le code existant fonctionne généralement après avoir remplacé l'identifiant du modèle par gemini-3.8-flash

, sous réserve des changements majeurs décrits plus loin.

Google présente 3.8 Flash comme « notre modèle Flash le plus intelligent », destiné notamment à l'ingénierie logicielle longue, aux agents autonomes et aux workflows d'entreprise complexes.

Sur les tâches difficiles, le modèle :

Benchmark 3.8 Flash 3.7 Flash Écart
Agent financier Vals v2 61,4 % 59,0 % +2,4
HLE-Verified 54,9 % 53,6 % +1,3
Benchmark de l'agent juridique Harvey 10,0 % 8,8 % +1,2

Les gains sont modestes mais constants. Dans ces trois benchmarks, 3.8 Flash dépasse aussi les modèles plus coûteux présentés dans le tableau de Google, notamment Claude Opus 5 et GPT-5.6 Sol.

Artificial Analysis attribue un indice d'intelligence de 59 à 3.8 Flash au niveau high

, contre 56 pour 3.7 Flash et 52 pour 3.6 Flash. Sur τ³-Banking, son benchmark d'utilisation d'outils, 3.8 Flash atteint 45 %, soit 12 points de plus que 3.7 Flash.

Pour les agents qui utilisent réellement des outils, ce résultat est probablement plus utile que l'indice général.

Google affirme que 3.8 Flash accomplit « plus de trois fois plus de tâches que Gemini 3.7 Flash » dans les workflows longs et riches en documents.

Il s'agit d'une évaluation interne, sans harnais public. Elle reste néanmoins cohérente avec la conception du modèle : davantage de vérifications peuvent réduire les erreurs dans une tâche composée de dizaines d'étapes.

Sur DeepSWE v1.1, Gemini 3.7 Flash a obtenu 65,3 %, contre 49,0 % pour 3.6 Flash. Google affirme que 3.8 Flash dépasse la plupart des grands modèles frontières pour une fraction du coût, mais le score exact n'est pas fourni dans le texte de la fiche modèle.

Les résultats textuels de 3.8 Flash pour SWE-Bench Pro, Terminal-Bench et OSWorld ne sont pas publiés. Si ces benchmarks sont déterminants pour votre projet, mesurez-les sur votre propre dépôt ou attendez des évaluations indépendantes.

Google signale un « bond significatif » sur les tests d'injection de prompt Gray Swan, sans publier de score global.

Les écarts détaillés par rapport à 3.7 Flash sont les suivants :

Ce dernier résultat indique une légère hausse des refus excessifs.

Configuration Coût par tâche Temps par tâche
Gemini 3.7 Flash, high
0,40 $ 2,2 min
Gemini 3.8 Flash, low
0,24 $ 0,8 min
Gemini 3.8 Flash, medium
0,41 $ Non publié
Gemini 3.8 Flash, high
0,58 $ 2,5 min

Trois conclusions pratiques :

high

coûte environ 45 % de plushigh

, avec 14 % de temps réel supplémentaire.medium

coûte presque autanthigh

.low

est à la fois moins cher et plus rapideLe niveau de réflexion est donc le principal réglage pour arbitrer qualité, coût et latence.

thinking_level: "minimal"

n'est plus accepté Gemini 3.8 Flash accepte uniquement :

{
  "thinkingLevel": "low"
}

Les valeurs disponibles sont :

low

;medium

;high

.Une configuration 3.7 utilisant minimal

renvoie désormais une erreur de validation. Mappez cette valeur vers low

avant la migration.

call_id

et name

Avec l'API Interactions, chaque function_result

doit contenir les deux champs :

{
  "type": "function_result",
  "call_id": "call_123",
  "name": "search_database",
  "result": {
    "items": []
  }
}

Avec l'ancien endpoint generateContent

, functionResponse

doit également renvoyer l'identifiant correspondant et le nom de la fonction.

Un système qui renvoie uniquement les résultats indexés par le nom de la fonction peut échouer au deuxième tour d'une boucle d'outils.

Le guide de migration recommande également de vérifier les points suivants :

temperature

à sa valeur par défaut, 1.0

;thinking_level

plutôt qu'un entier thinking_budget

;candidate_count

;Ces règles ne sont pas toutes nouvelles avec 3.8, mais une base de code 3.7 qui les ignorait peut révéler ses problèmes lors du changement de modèle.

Charge de travail Recommandation Raisons
Agents multi-étapes avec appels d'outils Migrer vers medium ou high
+12 points sur τ³-Banking et boucles d'outils itératives
Extraction et révision de documents longs Migrer Le gain annoncé par Google cible précisément ce scénario
Codage agentique Migrer, puis mesurer Les données textuelles DeepSWE sont encore incomplètes
Agents financiers, juridiques et de recherche Migrer Les trois benchmarks publiés par Google sont favorables
Classification, extraction et chat à gros volume Rester sur 3.7 ou utiliser 3.8 en low
Le coût par tâche est prioritaire
Endpoints utilisateur sensibles à la latence Utiliser 3.8 en low
0,8 minute par tâche contre 2,2 minutes pour 3.7 en high
Configuration utilisant minimal
Migrer d'abord le paramètre Erreur de validation sans conversion vers low
Pipelines batch au centime près Rester sur 3.7 jusqu'à une nouvelle évaluation 30 % de jetons de sortie supplémentaires peuvent augmenter la facture

En résumé : plus la tâche est longue, difficile et agentique, plus le raisonnement supplémentaire de 3.8 justifie son coût. Pour les tâches courtes et répétitives, le niveau de réflexion et le coût par tâche comptent davantage que le score maximal.

Les chiffres d'Artificial Analysis ne reflètent pas nécessairement votre application. Avant de changer le modèle en production, exécutez les mêmes prompts sur Gemini 3.7 Flash et Gemini 3.8 Flash.

Dans Apidog :

GEMINI_API_KEY

comme variable d'environnement ;model

comme variable de scénario ;POST

vers l'endpoint suivant :

https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent

Configurez l'en-tête x-goog-api-key

pour utiliser la variable d'environnement, puis utilisez le même corps pour les deux modèles :

{
  "contents": [
    {
      "parts": [
        {
          "text": "{{golden_prompt}}"
        }
      ]
    }
  ],
  "generationConfig": {
    "thinkingConfig": {
      "thinkingLevel": "medium"
    }
  }
}

Construisez ensuite un scénario en deux étapes :

model = gemini-3.7-flash

;model = gemini-3.8-flash

.Ajoutez des assertions sur :

usageMetadata.candidatesTokenCount

;usageMetadata.thoughtsTokenCount

;Utilisez un plafond correspondant à votre budget et exécutez le scénario sur 10 à 20 prompts de référence. Le rapport regroupera les réponses, les nombres de jetons et les résultats des assertions pour les deux modèles.

Une fois les seuils validés, planifiez le scénario afin qu'une augmentation inattendue des jetons de réflexion fasse échouer un test au lieu d'augmenter silencieusement votre facture. Le plan gratuit d'Apidog couvre ce workflow.

Pas nécessairement. Google parle d'une vitesse « environ identique » et Artificial Analysis mesure environ 300 jetons par seconde au niveau high

.

Le temps total par tâche augmente toutefois avec le raisonnement supplémentaire : 2,5 minutes pour 3.8 Flash en high

, contre 2,2 minutes pour 3.7 Flash en high

. En low

, 3.8 Flash descend à 0,8 minute.

Pas par jeton. Les deux modèles coûtent 0,75 $ en entrée et 3,75 $ en sortie jusqu'au 31 décembre 2026, puis 1,50 $ et 7,50 $.

Le coût par tâche est différent : Artificial Analysis mesure 0,58 $ pour 3.8 Flash en high

, contre 0,40 $ pour 3.7 Flash en high

, principalement parce que 3.8 Flash produit environ 30 % de jetons supplémentaires.

Non. Google indique que 3.7 Flash reste entièrement pris en charge et n'a communiqué aucune date de fin de vie.

Deux éléments principaux :

thinking_level: "minimal"

renvoie une erreur 400 INVALID_ARGUMENT

;name

.Le reste de l'API Gemini 3 reste inchangé.

La progression 3.7 était plus marquée sur les données disponibles : DeepSWE est passé de 49,0 % à 65,3 %, tandis que l'indice Artificial Analysis est passé de 52 à 56.

Le passage à 3.8 apporte trois points supplémentaires sur cet indice et modifie surtout la manière dont le modèle consomme les jetons. Consultez aussi Gemini 3.6 Flash vs 3.5 Flash pour l'évolution précédente.

Migrez vers Gemini 3.8 Flash si vos workflows sont agentiques, utilisent de nombreux outils ou traitent de longs documents. C'est dans ces scénarios que les benchmarks publiés montrent les gains les plus intéressants.

Pour les appels courts et répétitifs, restez sur 3.7 Flash ou utilisez 3.8 Flash en low

. Dans tous les cas :

minimal

en low

;

── more in #large-language-models 4 stories · sorted by recency
── more on @google 3 stories trending now
sponsored brought to you by zahid.host 4,200+ EU-deployed projects
reading about agents? ship yours in a single git push.

Run your AI side-project on zahid.host

EU-based hosting, git-push deploys, automatic HTTPS, no cold starts. Free tier with a custom domain — perfect for shipping the agent you just read about.

$git push zahid main
Live at https://your-agent.zahid.host
Get free account → Pricing
from €0/mo · no card required
LIVE [news/gemini-3-8-flash-vs-…] indexed:0 read:9min 2026-09-03 ·