# Gemini 3.8 Flash vs 3.7 Flash : Nouveautés et faut-il mettre à jour ?

> Source: <https://dev.to/antoine_laurentt/gemini-38-flash-vs-37-flash-nouveautes-et-faut-il-mettre-a-jour--56ce>
> Published: 2026-09-03 08:36:26+00:00

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines après Gemini 3.7 Flash et six semaines après 3.6 Flash. Le prix de lancement reste identique — 0,75 $ en entrée et 3,75 $ en sortie par million de jetons jusqu'au 31 décembre — tout comme le contexte d'un million de jetons et une vitesse annoncée comme similaire. La différence principale est le fonctionnement du modèle : raisonnement en étapes plus courtes, vérification de ses propres résultats et appels d'outils itératifs. Les scores progressent, mais chaque tâche peut consommer davantage de jetons.

[Essayez Apidog dès aujourd’hui](https://apidog.com/?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation)

La vraie question n'est donc pas de savoir si 3.8 Flash est meilleur — sur le papier, oui — mais si le gain de qualité justifie le coût supplémentaire pour votre charge de travail et si votre code supporte les changements d'API.

Google indique que Gemini 3.7 Flash « reste entièrement pris en charge » et n'a annoncé aucune date de dépréciation. La migration n'est pas urgente.

| Critère | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| ID du modèle | `gemini-3.8-flash` |
`gemini-3.7-flash` |
| Date de sortie | 2 septembre 2026 | 13 août 2026 |
| Base | « Basé sur Gemini 3.7 Flash » | — |
| Contexte / sortie maximale | 1 048 576 / 65 536 jetons | Identique |
| Prix d'entrée jusqu'au 31 décembre 2026 | 0,75 $ / million | 0,75 $ / million |
| Prix de sortie jusqu'au 31 décembre 2026 | 3,75 $ / million, réflexion incluse | 3,75 $ / million, réflexion incluse |
| Prix standard à partir du 1er janvier 2027 | 1,50 $ / 7,50 $ | 1,50 $ / 7,50 $ |
| Lecture du cache de contexte | 0,075 $ / million au lancement | Identique |
| Traitement par lots | Réduction de 50 % | Identique |
| Niveaux de réflexion |
`low` , `medium` par défaut, `high`
|
`low` , `medium` , `high`
|
| Niveau minimal | Erreur de validation | Accepté, à mapper vers `low`
|
| Date limite de connaissance | Mars 2026 | Non précisée dans la documentation 3.8 |
| Vitesse de sortie | Environ 300 jetons/s | Environ la même vitesse |
| Indice d'intelligence Artificial Analysis | 59 | 56 |
| Support | Version actuelle | Entièrement prise en charge |

Les deux modèles partagent :

`generateContent`

.La vitesse est également proche. Google décrit 3.8 Flash comme ayant « le même prix que 3.7, et une vitesse similaire ». Artificial Analysis a mesuré 302,1 jetons de sortie par seconde au niveau `high`

. Le temps avant le premier jeton était toutefois de 13,30 secondes, car le modèle raisonne avant de commencer à répondre.

Le code existant fonctionne généralement après avoir remplacé l'identifiant du modèle par `gemini-3.8-flash`

, sous réserve des changements majeurs décrits plus loin.

Google présente 3.8 Flash comme « notre modèle Flash le plus intelligent », destiné notamment à l'ingénierie logicielle longue, aux agents autonomes et aux workflows d'entreprise complexes.

Sur les tâches difficiles, le modèle :

| Benchmark | 3.8 Flash | 3.7 Flash | Écart |
|---|---|---|---|
| Agent financier Vals v2 | 61,4 % | 59,0 % | +2,4 |
| HLE-Verified | 54,9 % | 53,6 % | +1,3 |
| Benchmark de l'agent juridique Harvey | 10,0 % | 8,8 % | +1,2 |

Les gains sont modestes mais constants. Dans ces trois benchmarks, 3.8 Flash dépasse aussi les modèles plus coûteux présentés dans le tableau de Google, notamment Claude Opus 5 et GPT-5.6 Sol.

Artificial Analysis attribue un indice d'intelligence de 59 à 3.8 Flash au niveau `high`

, contre 56 pour 3.7 Flash et 52 pour 3.6 Flash. Sur τ³-Banking, son benchmark d'utilisation d'outils, 3.8 Flash atteint 45 %, soit 12 points de plus que 3.7 Flash.

Pour les agents qui utilisent réellement des outils, ce résultat est probablement plus utile que l'indice général.

Google affirme que 3.8 Flash accomplit « plus de trois fois plus de tâches que Gemini 3.7 Flash » dans les workflows longs et riches en documents.

Il s'agit d'une évaluation interne, sans harnais public. Elle reste néanmoins cohérente avec la conception du modèle : davantage de vérifications peuvent réduire les erreurs dans une tâche composée de dizaines d'étapes.

Sur DeepSWE v1.1, Gemini 3.7 Flash a obtenu 65,3 %, contre 49,0 % pour 3.6 Flash. Google affirme que 3.8 Flash dépasse la plupart des grands modèles frontières pour une fraction du coût, mais le score exact n'est pas fourni dans le texte de la fiche modèle.

Les résultats textuels de 3.8 Flash pour SWE-Bench Pro, Terminal-Bench et OSWorld ne sont pas publiés. Si ces benchmarks sont déterminants pour votre projet, mesurez-les sur votre propre dépôt ou attendez des évaluations indépendantes.

Google signale un « bond significatif » sur les tests d'injection de prompt Gray Swan, sans publier de score global.

Les écarts détaillés par rapport à 3.7 Flash sont les suivants :

Ce dernier résultat indique une légère hausse des refus excessifs.

| Configuration | Coût par tâche | Temps par tâche |
|---|---|---|
Gemini 3.7 Flash, `high`
|
0,40 $ | 2,2 min |
Gemini 3.8 Flash, `low`
|
0,24 $ | 0,8 min |
Gemini 3.8 Flash, `medium`
|
0,41 $ | Non publié |
Gemini 3.8 Flash, `high`
|
0,58 $ | 2,5 min |

Trois conclusions pratiques :

`high`

coûte environ 45 % de plus`high`

, avec 14 % de temps réel supplémentaire.`medium`

coûte presque autant`high`

.`low`

est à la fois moins cher et plus rapideLe niveau de réflexion est donc le principal réglage pour arbitrer qualité, coût et latence.

`thinking_level: "minimal"`

n'est plus accepté
Gemini 3.8 Flash accepte uniquement :

```
{
  "thinkingLevel": "low"
}
```

Les valeurs disponibles sont :

`low`

;`medium`

;`high`

.Une configuration 3.7 utilisant `minimal`

renvoie désormais une erreur de validation. Mappez cette valeur vers `low`

avant la migration.

`call_id`

et `name`

Avec l'API Interactions, chaque `function_result`

doit contenir les deux champs :

```
{
  "type": "function_result",
  "call_id": "call_123",
  "name": "search_database",
  "result": {
    "items": []
  }
}
```

Avec l'ancien endpoint `generateContent`

, `functionResponse`

doit également renvoyer l'identifiant correspondant et le nom de la fonction.

Un système qui renvoie uniquement les résultats indexés par le nom de la fonction peut échouer au deuxième tour d'une boucle d'outils.

Le guide de migration recommande également de vérifier les points suivants :

`temperature`

à sa valeur par défaut, `1.0`

;`thinking_level`

plutôt qu'un entier `thinking_budget`

;`candidate_count`

;Ces règles ne sont pas toutes nouvelles avec 3.8, mais une base de code 3.7 qui les ignorait peut révéler ses problèmes lors du changement de modèle.

| Charge de travail | Recommandation | Raisons |
|---|---|---|
| Agents multi-étapes avec appels d'outils | Migrer vers `medium` ou `high`
|
+12 points sur τ³-Banking et boucles d'outils itératives |
| Extraction et révision de documents longs | Migrer | Le gain annoncé par Google cible précisément ce scénario |
| Codage agentique | Migrer, puis mesurer | Les données textuelles DeepSWE sont encore incomplètes |
| Agents financiers, juridiques et de recherche | Migrer | Les trois benchmarks publiés par Google sont favorables |
| Classification, extraction et chat à gros volume | Rester sur 3.7 ou utiliser 3.8 en `low`
|
Le coût par tâche est prioritaire |
| Endpoints utilisateur sensibles à la latence | Utiliser 3.8 en `low`
|
0,8 minute par tâche contre 2,2 minutes pour 3.7 en `high`
|
Configuration utilisant `minimal`
|
Migrer d'abord le paramètre | Erreur de validation sans conversion vers `low`
|
| Pipelines batch au centime près | Rester sur 3.7 jusqu'à une nouvelle évaluation | 30 % de jetons de sortie supplémentaires peuvent augmenter la facture |

En résumé : plus la tâche est longue, difficile et agentique, plus le raisonnement supplémentaire de 3.8 justifie son coût. Pour les tâches courtes et répétitives, le niveau de réflexion et le coût par tâche comptent davantage que le score maximal.

Les chiffres d'Artificial Analysis ne reflètent pas nécessairement votre application. Avant de changer le modèle en production, exécutez les mêmes prompts sur Gemini 3.7 Flash et Gemini 3.8 Flash.

Dans [Apidog](https://apidog.com/?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) :

`GEMINI_API_KEY`

comme variable d'environnement ;`model`

comme variable de scénario ;`POST`

vers l'endpoint suivant :

```
https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
```

Configurez l'en-tête `x-goog-api-key`

pour utiliser la variable d'environnement, puis utilisez le même corps pour les deux modèles :

```
{
  "contents": [
    {
      "parts": [
        {
          "text": "{{golden_prompt}}"
        }
      ]
    }
  ],
  "generationConfig": {
    "thinkingConfig": {
      "thinkingLevel": "medium"
    }
  }
}
```

Construisez ensuite un scénario en deux étapes :

`model = gemini-3.7-flash`

;`model = gemini-3.8-flash`

.Ajoutez des assertions sur :

`usageMetadata.candidatesTokenCount`

;`usageMetadata.thoughtsTokenCount`

;Utilisez un plafond correspondant à votre budget et exécutez le scénario sur 10 à 20 prompts de référence. Le rapport regroupera les réponses, les nombres de jetons et les résultats des assertions pour les deux modèles.

Une fois les seuils validés, planifiez le scénario afin qu'une augmentation inattendue des jetons de réflexion fasse échouer un test au lieu d'augmenter silencieusement votre facture. Le plan gratuit d'Apidog couvre ce workflow.

Pas nécessairement. Google parle d'une vitesse « environ identique » et Artificial Analysis mesure environ 300 jetons par seconde au niveau `high`

.

Le temps total par tâche augmente toutefois avec le raisonnement supplémentaire : 2,5 minutes pour 3.8 Flash en `high`

, contre 2,2 minutes pour 3.7 Flash en `high`

. En `low`

, 3.8 Flash descend à 0,8 minute.

Pas par jeton. Les deux modèles coûtent 0,75 $ en entrée et 3,75 $ en sortie jusqu'au 31 décembre 2026, puis 1,50 $ et 7,50 $.

Le coût par tâche est différent : Artificial Analysis mesure 0,58 $ pour 3.8 Flash en `high`

, contre 0,40 $ pour 3.7 Flash en `high`

, principalement parce que 3.8 Flash produit environ 30 % de jetons supplémentaires.

Non. Google indique que 3.7 Flash reste entièrement pris en charge et n'a communiqué aucune date de fin de vie.

Deux éléments principaux :

`thinking_level: "minimal"`

renvoie une erreur `400 INVALID_ARGUMENT`

;`name`

.Le reste de l'API Gemini 3 reste inchangé.

La progression 3.7 était plus marquée sur les données disponibles : DeepSWE est passé de 49,0 % à 65,3 %, tandis que l'indice Artificial Analysis est passé de 52 à 56.

Le passage à 3.8 apporte trois points supplémentaires sur cet indice et modifie surtout la manière dont le modèle consomme les jetons. Consultez aussi [Gemini 3.6 Flash vs 3.5 Flash](https://apidog.com/fr/blog/gemini-3-6-flash-vs-gemini-3-5-flash?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) pour l'évolution précédente.

Migrez vers Gemini 3.8 Flash si vos workflows sont agentiques, utilisent de nombreux outils ou traitent de longs documents. C'est dans ces scénarios que les benchmarks publiés montrent les gains les plus intéressants.

Pour les appels courts et répétitifs, restez sur 3.7 Flash ou utilisez 3.8 Flash en `low`

. Dans tous les cas :

`minimal`

en `low`

;
