Gemini 3.8 Flash vs 3.7 Flash : Nouveautés et faut-il mettre à jour ? Google released Gemini 3.8 Flash on September 2, 2026, three weeks after Gemini 3.7 Flash, with the same pricing and context window but improved reasoning and tool use. Benchmarks show modest gains over 3.7 Flash, such as a higher Artificial Analysis intelligence index (59 vs. 56) and a 12-point improvement on the τ³-Banking tool-use benchmark. Google says 3.8 Flash is its most intelligent Flash model, but 3.7 Flash remains fully supported, so migration is not urgent. Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines après Gemini 3.7 Flash et six semaines après 3.6 Flash. Le prix de lancement reste identique — 0,75 $ en entrée et 3,75 $ en sortie par million de jetons jusqu'au 31 décembre — tout comme le contexte d'un million de jetons et une vitesse annoncée comme similaire. La différence principale est le fonctionnement du modèle : raisonnement en étapes plus courtes, vérification de ses propres résultats et appels d'outils itératifs. Les scores progressent, mais chaque tâche peut consommer davantage de jetons. Essayez Apidog dès aujourd’hui https://apidog.com/?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation La vraie question n'est donc pas de savoir si 3.8 Flash est meilleur — sur le papier, oui — mais si le gain de qualité justifie le coût supplémentaire pour votre charge de travail et si votre code supporte les changements d'API. Google indique que Gemini 3.7 Flash « reste entièrement pris en charge » et n'a annoncé aucune date de dépréciation. La migration n'est pas urgente. | Critère | Gemini 3.8 Flash | Gemini 3.7 Flash | |---|---|---| | ID du modèle | gemini-3.8-flash | gemini-3.7-flash | | Date de sortie | 2 septembre 2026 | 13 août 2026 | | Base | « Basé sur Gemini 3.7 Flash » | — | | Contexte / sortie maximale | 1 048 576 / 65 536 jetons | Identique | | Prix d'entrée jusqu'au 31 décembre 2026 | 0,75 $ / million | 0,75 $ / million | | Prix de sortie jusqu'au 31 décembre 2026 | 3,75 $ / million, réflexion incluse | 3,75 $ / million, réflexion incluse | | Prix standard à partir du 1er janvier 2027 | 1,50 $ / 7,50 $ | 1,50 $ / 7,50 $ | | Lecture du cache de contexte | 0,075 $ / million au lancement | Identique | | Traitement par lots | Réduction de 50 % | Identique | | Niveaux de réflexion | low , medium par défaut, high | low , medium , high | | Niveau minimal | Erreur de validation | Accepté, à mapper vers low | | Date limite de connaissance | Mars 2026 | Non précisée dans la documentation 3.8 | | Vitesse de sortie | Environ 300 jetons/s | Environ la même vitesse | | Indice d'intelligence Artificial Analysis | 59 | 56 | | Support | Version actuelle | Entièrement prise en charge | Les deux modèles partagent : generateContent .La vitesse est également proche. Google décrit 3.8 Flash comme ayant « le même prix que 3.7, et une vitesse similaire ». Artificial Analysis a mesuré 302,1 jetons de sortie par seconde au niveau high . Le temps avant le premier jeton était toutefois de 13,30 secondes, car le modèle raisonne avant de commencer à répondre. Le code existant fonctionne généralement après avoir remplacé l'identifiant du modèle par gemini-3.8-flash , sous réserve des changements majeurs décrits plus loin. Google présente 3.8 Flash comme « notre modèle Flash le plus intelligent », destiné notamment à l'ingénierie logicielle longue, aux agents autonomes et aux workflows d'entreprise complexes. Sur les tâches difficiles, le modèle : | Benchmark | 3.8 Flash | 3.7 Flash | Écart | |---|---|---|---| | Agent financier Vals v2 | 61,4 % | 59,0 % | +2,4 | | HLE-Verified | 54,9 % | 53,6 % | +1,3 | | Benchmark de l'agent juridique Harvey | 10,0 % | 8,8 % | +1,2 | Les gains sont modestes mais constants. Dans ces trois benchmarks, 3.8 Flash dépasse aussi les modèles plus coûteux présentés dans le tableau de Google, notamment Claude Opus 5 et GPT-5.6 Sol. Artificial Analysis attribue un indice d'intelligence de 59 à 3.8 Flash au niveau high , contre 56 pour 3.7 Flash et 52 pour 3.6 Flash. Sur τ³-Banking, son benchmark d'utilisation d'outils, 3.8 Flash atteint 45 %, soit 12 points de plus que 3.7 Flash. Pour les agents qui utilisent réellement des outils, ce résultat est probablement plus utile que l'indice général. Google affirme que 3.8 Flash accomplit « plus de trois fois plus de tâches que Gemini 3.7 Flash » dans les workflows longs et riches en documents. Il s'agit d'une évaluation interne, sans harnais public. Elle reste néanmoins cohérente avec la conception du modèle : davantage de vérifications peuvent réduire les erreurs dans une tâche composée de dizaines d'étapes. Sur DeepSWE v1.1, Gemini 3.7 Flash a obtenu 65,3 %, contre 49,0 % pour 3.6 Flash. Google affirme que 3.8 Flash dépasse la plupart des grands modèles frontières pour une fraction du coût, mais le score exact n'est pas fourni dans le texte de la fiche modèle. Les résultats textuels de 3.8 Flash pour SWE-Bench Pro, Terminal-Bench et OSWorld ne sont pas publiés. Si ces benchmarks sont déterminants pour votre projet, mesurez-les sur votre propre dépôt ou attendez des évaluations indépendantes. Google signale un « bond significatif » sur les tests d'injection de prompt Gray Swan, sans publier de score global. Les écarts détaillés par rapport à 3.7 Flash sont les suivants : Ce dernier résultat indique une légère hausse des refus excessifs. | Configuration | Coût par tâche | Temps par tâche | |---|---|---| Gemini 3.7 Flash, high | 0,40 $ | 2,2 min | Gemini 3.8 Flash, low | 0,24 $ | 0,8 min | Gemini 3.8 Flash, medium | 0,41 $ | Non publié | Gemini 3.8 Flash, high | 0,58 $ | 2,5 min | Trois conclusions pratiques : high coûte environ 45 % de plus high , avec 14 % de temps réel supplémentaire. medium coûte presque autant high . low est à la fois moins cher et plus rapideLe niveau de réflexion est donc le principal réglage pour arbitrer qualité, coût et latence. thinking level: "minimal" n'est plus accepté Gemini 3.8 Flash accepte uniquement : { "thinkingLevel": "low" } Les valeurs disponibles sont : low ; medium ; high .Une configuration 3.7 utilisant minimal renvoie désormais une erreur de validation. Mappez cette valeur vers low avant la migration. call id et name Avec l'API Interactions, chaque function result doit contenir les deux champs : { "type": "function result", "call id": "call 123", "name": "search database", "result": { "items": } } Avec l'ancien endpoint generateContent , functionResponse doit également renvoyer l'identifiant correspondant et le nom de la fonction. Un système qui renvoie uniquement les résultats indexés par le nom de la fonction peut échouer au deuxième tour d'une boucle d'outils. Le guide de migration recommande également de vérifier les points suivants : temperature à sa valeur par défaut, 1.0 ; thinking level plutôt qu'un entier thinking budget ; candidate count ;Ces règles ne sont pas toutes nouvelles avec 3.8, mais une base de code 3.7 qui les ignorait peut révéler ses problèmes lors du changement de modèle. | Charge de travail | Recommandation | Raisons | |---|---|---| | Agents multi-étapes avec appels d'outils | Migrer vers medium ou high | +12 points sur τ³-Banking et boucles d'outils itératives | | Extraction et révision de documents longs | Migrer | Le gain annoncé par Google cible précisément ce scénario | | Codage agentique | Migrer, puis mesurer | Les données textuelles DeepSWE sont encore incomplètes | | Agents financiers, juridiques et de recherche | Migrer | Les trois benchmarks publiés par Google sont favorables | | Classification, extraction et chat à gros volume | Rester sur 3.7 ou utiliser 3.8 en low | Le coût par tâche est prioritaire | | Endpoints utilisateur sensibles à la latence | Utiliser 3.8 en low | 0,8 minute par tâche contre 2,2 minutes pour 3.7 en high | Configuration utilisant minimal | Migrer d'abord le paramètre | Erreur de validation sans conversion vers low | | Pipelines batch au centime près | Rester sur 3.7 jusqu'à une nouvelle évaluation | 30 % de jetons de sortie supplémentaires peuvent augmenter la facture | En résumé : plus la tâche est longue, difficile et agentique, plus le raisonnement supplémentaire de 3.8 justifie son coût. Pour les tâches courtes et répétitives, le niveau de réflexion et le coût par tâche comptent davantage que le score maximal. Les chiffres d'Artificial Analysis ne reflètent pas nécessairement votre application. Avant de changer le modèle en production, exécutez les mêmes prompts sur Gemini 3.7 Flash et Gemini 3.8 Flash. Dans Apidog https://apidog.com/?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation : GEMINI API KEY comme variable d'environnement ; model comme variable de scénario ; POST vers l'endpoint suivant : https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent Configurez l'en-tête x-goog-api-key pour utiliser la variable d'environnement, puis utilisez le même corps pour les deux modèles : { "contents": { "parts": { "text": "{{golden prompt}}" } } , "generationConfig": { "thinkingConfig": { "thinkingLevel": "medium" } } } Construisez ensuite un scénario en deux étapes : model = gemini-3.7-flash ; model = gemini-3.8-flash .Ajoutez des assertions sur : usageMetadata.candidatesTokenCount ; usageMetadata.thoughtsTokenCount ;Utilisez un plafond correspondant à votre budget et exécutez le scénario sur 10 à 20 prompts de référence. Le rapport regroupera les réponses, les nombres de jetons et les résultats des assertions pour les deux modèles. Une fois les seuils validés, planifiez le scénario afin qu'une augmentation inattendue des jetons de réflexion fasse échouer un test au lieu d'augmenter silencieusement votre facture. Le plan gratuit d'Apidog couvre ce workflow. Pas nécessairement. Google parle d'une vitesse « environ identique » et Artificial Analysis mesure environ 300 jetons par seconde au niveau high . Le temps total par tâche augmente toutefois avec le raisonnement supplémentaire : 2,5 minutes pour 3.8 Flash en high , contre 2,2 minutes pour 3.7 Flash en high . En low , 3.8 Flash descend à 0,8 minute. Pas par jeton. Les deux modèles coûtent 0,75 $ en entrée et 3,75 $ en sortie jusqu'au 31 décembre 2026, puis 1,50 $ et 7,50 $. Le coût par tâche est différent : Artificial Analysis mesure 0,58 $ pour 3.8 Flash en high , contre 0,40 $ pour 3.7 Flash en high , principalement parce que 3.8 Flash produit environ 30 % de jetons supplémentaires. Non. Google indique que 3.7 Flash reste entièrement pris en charge et n'a communiqué aucune date de fin de vie. Deux éléments principaux : thinking level: "minimal" renvoie une erreur 400 INVALID ARGUMENT ; name .Le reste de l'API Gemini 3 reste inchangé. La progression 3.7 était plus marquée sur les données disponibles : DeepSWE est passé de 49,0 % à 65,3 %, tandis que l'indice Artificial Analysis est passé de 52 à 56. Le passage à 3.8 apporte trois points supplémentaires sur cet indice et modifie surtout la manière dont le modèle consomme les jetons. Consultez aussi Gemini 3.6 Flash vs 3.5 Flash https://apidog.com/fr/blog/gemini-3-6-flash-vs-gemini-3-5-flash?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation pour l'évolution précédente. Migrez vers Gemini 3.8 Flash si vos workflows sont agentiques, utilisent de nombreux outils ou traitent de longs documents. C'est dans ces scénarios que les benchmarks publiés montrent les gains les plus intéressants. Pour les appels courts et répétitifs, restez sur 3.7 Flash ou utilisez 3.8 Flash en low . Dans tous les cas : minimal en low ;