# Gemini 3.8 Flash vs 3.7 Flash: Perbedaan dan Haruskah Anda Upgrade?

> Source: <https://dev.to/walse/gemini-38-flash-vs-37-flash-perbedaan-dan-haruskah-anda-upgrade-21km>
> Published: 2026-09-03 08:33:33+00:00

Google merilis Gemini 3.8 Flash pada 2 September 2026, tiga minggu setelah Gemini 3.7 Flash dan enam minggu setelah 3.6 Flash. Harga perkenalan, konteks 1 juta token, dan kecepatannya kurang lebih sama. Perubahan utamanya ada pada cara model bekerja: Gemini 3.8 Flash menggunakan langkah penalaran yang lebih kecil, memverifikasi hasilnya sendiri, dan memanggil alat secara berulang. Hasilnya, skor tolok ukur meningkat—tetapi setiap tugas juga dapat menggunakan lebih banyak token.

Jadi, pertanyaan yang tepat bukan sekadar “apakah Gemini 3.8 Flash lebih baik?”. Di atas kertas, jawabannya ya. Pertanyaannya adalah apakah kualitas tambahan sepadan dengan biaya token ekstra pada beban kerja Anda, serta apakah perubahan yang bersifat merusak akan memengaruhi kode yang sudah ada.

Perbandingan ini merangkum perbedaan, biaya, perubahan API, dan rekomendasi berdasarkan beban kerja. Sumbernya mencakup [postingan peluncuran Google](https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/), [dokumentasi model terbaru Gemini](https://ai.google.dev/gemini-api/docs/latest-model), dan pengujian independen Artificial Analysis. Untuk spesifikasi lengkap, lihat [apa itu Gemini 3.8 Flash](https://apidog.com/id/blog/what-is-gemini-3-8-flash?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).

Google juga menyatakan bahwa Gemini 3.7 Flash “tetap didukung penuh” dan belum mengumumkan tanggal penghentian. Anda tidak harus segera bermigrasi.

| Atribut | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| ID model | `gemini-3.8-flash` |
`gemini-3.7-flash` |
| Dirilis | 2 September 2026 | 13 Agustus 2026 |
| Dasar | “Berdasarkan Gemini 3.7 Flash” (
|

`low`

, `medium`

(default), `high`

`low`

, `medium`

, `high`

`low`

saat migrasiKedua model berada pada baris harga yang sama di [halaman harga Google](https://ai.google.dev/gemini-api/docs/pricing):

[Referensi spesifikasi dan harga Gemini 3.7 Flash](https://apidog.com/id/blog/gemini-3-7-flash-specs-pricing-reference?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) juga masih dapat digunakan sebagai referensi harga Gemini 3.8 Flash secara baris per baris.

Batasnya tidak berubah:

Kedua model tidak mendukung pembuatan audio, pembuatan gambar, atau Live API.

Logan Kilpatrick dari Google menggambarkan Gemini 3.8 Flash sebagai model dengan “harga yang sama dengan 3.7, kecepatannya kurang lebih sama”.

Artificial Analysis mengukur:

`high`

Waktu hingga token pertama lebih lama karena model menyelesaikan penalaran sebelum mulai menulis.

Interactions API menjadi jalur utama Google untuk Gemini 3.x. Endpoint `generateContent`

lama juga “tetap didukung penuh” tanpa tanggal penghentian.

Secara umum, kode Gemini 3.7 Flash dapat dijalankan dengan `gemini-3.8-flash`

hanya dengan mengganti string model. Namun, periksa dua perubahan yang bersifat merusak di bagian migrasi.

Google memosisikan Gemini 3.8 Flash sebagai “model Flash kami yang paling cerdas”, khususnya untuk:

Desain yang mendasarinya adalah penalaran tambahan, pemanggilan alat berulang, langkah penalaran yang lebih kecil, dan verifikasi hasil selama proses berlangsung.

Google menerbitkan tiga perbandingan numerik di [halaman DeepMind Flash](https://deepmind.google/models/gemini/flash/):

| Tolok ukur | Gemini 3.8 Flash | Gemini 3.7 Flash | Perubahan |
|---|---|---|---|
| Vals Finance Agent v2 | 61,4% | 59,0% | +2,4 |
| HLE-Verified | 54,9% | 53,6% | +1,3 |
| Harvey Legal Agent Benchmark | 10,0% | 8,8% | +1,2 |

Peningkatannya moderat tetapi konsisten. Pada ketiga baris tersebut, Gemini 3.8 Flash juga mengungguli model yang lebih besar dalam tabel Google, termasuk Claude Opus 5 dengan skor 58,6% pada Vals Finance dan 54,4% pada HLE-Verified.

Lihat juga [perbandingan Gemini 3.8 Flash dengan Claude Fable 5.1 dan GPT-5.6 Sol](https://apidog.com/id/blog/gemini-3-8-flash-vs-claude-fable-5-1-vs-gpt-5-6-sol?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).

Dalam ulasan [Artificial Analysis](https://artificialanalysis.ai/articles/gemini-3-8-flash), Gemini 3.8 Flash memperoleh skor 59 pada Indeks Kecerdasan dengan tingkat `high`

.

Perbandingannya:

Pada skor tersebut, Gemini 3.8 Flash setara dengan GPT-5.6 Sol pada `xhigh`

dan Grok 4.6 pada `medium`

, serta satu poin di atas Claude Fable 5.1 pada `medium`

.

Yang lebih relevan untuk agen adalah evaluasi penggunaan alat τ³-Banking:

Jika agen Anda benar-benar memanggil alat, metrik ini lebih berguna daripada indeks kecerdasan umum.

Google menyatakan bahwa Gemini 3.8 Flash “menyelesaikan lebih dari tiga kali lipat tugas dibandingkan Gemini 3.7 Flash” pada alur kerja panjang dan padat dokumen.

Ini merupakan evaluasi internal tanpa alat uji publik. Anggap sebagai arahan, bukan jaminan. Namun, klaim tersebut selaras dengan desain model: verifikasi tambahan paling membantu ketika satu kesalahan dapat menggagalkan pekerjaan yang terdiri dari puluhan langkah.

Pada DeepSWE v1.1:

Google menyatakan bahwa Gemini 3.8 Flash mengungguli sebagian besar model frontier yang lebih besar dengan sebagian kecil biayanya. Namun, persentase pasti Gemini 3.8 Flash hanya muncul pada tabel gambar kartu model, bukan pada teks publikasi.

Angka untuk SWE-Bench Pro, Terminal-bench, dan OSWorld juga tidak dipublikasikan dalam teks. Jika tolok ukur tersebut menentukan keputusan Anda, uji sendiri di repositori dan toolchain Anda.

Google melaporkan “lompatan signifikan” pada pengujian injeksi prompt Gray Swan, tetapi tidak memberikan angka lengkap.

[Kartu model Gemini 3.8 Flash](https://deepmind.google/models/model-cards/gemini-3-8-flash/) menunjukkan perubahan berikut dibandingkan Gemini 3.7 Flash:

Angka terakhir menunjukkan sedikit peningkatan dalam mencegah penolakan berlebihan.

Harga per token tidak berubah. Yang berubah adalah biaya per tugas.

Google menyatakan bahwa Gemini 3.8 Flash dapat menggunakan lebih banyak token pada tugas yang panjang dan kompleks, terutama pada tingkat usaha yang lebih tinggi.

Artificial Analysis mengukur rata-rata sekitar 48.000 token keluaran per tugas untuk Gemini 3.8 Flash—sekitar 30% lebih banyak daripada Gemini 3.7 Flash.

| Konfigurasi | Biaya per tugas | Waktu per tugas |
|---|---|---|
Gemini 3.7 Flash, `high`
|
$0,40 | 2,2 menit |
Gemini 3.8 Flash, `low`
|
$0,24 | 0,8 menit |
Gemini 3.8 Flash, `medium`
|
$0,41 | Tidak dipublikasikan |
Gemini 3.8 Flash, `high`
|
$0,58 | 2,5 menit |

Tiga kesimpulan penting:

`high`

sekitar 45% lebih mahal per tugas dibandingkan Gemini 3.7 Flash pada `high`

, serta membutuhkan waktu 14% lebih lama.`medium`

—tingkat default—hanya berbeda sekitar $0,01 dari Gemini 3.7 Flash pada `high`

.`low`

adalah opsi termurah dan tercepat dalam pengujian tersebut.Untuk analisis volume harian, lihat [rincian harga Gemini 3.8 Flash](https://apidog.com/id/blog/gemini-3-8-flash-pricing?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).

Intinya: jika Anda membayar berdasarkan tugas, peningkatan ini tidak gratis. `thinkingLevel`

adalah kontrol utama untuk menentukan keseimbangan kualitas, biaya, dan latensi. [Panduan tingkat pemikiran Gemini 3.8 Flash](https://apidog.com/id/blog/gemini-3-8-flash-thinking-levels?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) menjelaskan perbedaan tiap tingkat.

Dua perubahan berikut dapat langsung memengaruhi kode Gemini 3.7 Flash.

`thinking_level: "minimal"`

tidak lagi valid
Gemini 3.8 Flash hanya menerima:

`low`

`medium`

`high`

Jika konfigurasi Gemini 3.7 Flash menggunakan `minimal`

, petakan nilainya ke `low`

:

```
{
  "thinkingConfig": {
    "thinkingLevel": "low"
  }
}
```

Tanpa perubahan tersebut, API akan mengembalikan kesalahan validasi.

`call_id`

dan `name`

Setiap `function_result`

pada Interactions API membutuhkan kedua bidang tersebut.

Pada endpoint `generateContent`

lama, setiap `functionResponse`

harus menyertakan `id`

yang cocok dan `name`

.

Respons yang hanya mengembalikan nama fungsi dapat gagal pada giliran kedua dalam perulangan alat.

Selain itu, periksa kembali aturan Gemini 3 berikut saat migrasi:

`temperature`

pada nilai default `1.0`

. Google memperingatkan bahwa nilai yang lebih rendah dapat menyebabkan perulangan atau penurunan kinerja.`thinking_level`

, bukan integer `thinking_budget`

.`candidate_count`

.Detail lengkap tersedia dalam [panduan migrasi Gemini 3.7 ke 3.8 Flash](https://apidog.com/id/blog/gemini-3-7-to-3-8-flash-migration-guide?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).

| Beban kerja | Rekomendasi | Alasan |
|---|---|---|
| Agen multi-langkah dengan pemanggilan alat | Tingkatkan ke `medium` atau `high`
|
+12 poin pada τ³-Banking; perulangan alat adalah inti desain 3.8 |
| Ekstraksi dan tinjauan dokumen panjang | Tingkatkan | Klaim Google tentang penyelesaian tugas 3x menargetkan skenario ini |
| Pengkodean agen dalam toolchain pengujian | Tingkatkan, lalu ukur | Angka DeepSWE 3.8 tidak dipublikasikan dalam teks |
| Agen keuangan, hukum, dan penelitian | Tingkatkan | Ketiga tolok ukur Google yang dipublikasikan menguntungkan 3.8 |
| Klasifikasi, ekstraksi, dan chat volume tinggi | Tetap di 3.7 atau gunakan 3.8 pada `low`
|
Biaya per tugas lebih penting; `low` lebih murah daripada 3.7 pada `high`
|
| Endpoint yang sensitif terhadap latensi | Gunakan 3.8 pada `low`
|
0,8 menit per tugas dibandingkan 2,2 menit untuk 3.7 pada `high`
|
Menggunakan tingkat pemikiran `minimal`
|
Migrasikan terlebih dahulu |
`minimal` menyebabkan kesalahan validasi |
| Pipeline batch dengan anggaran sangat ketat | Tetap di 3.7 hingga diuji ulang | Harga per token sama, tetapi token keluaran meningkat sekitar 30% |

Polanya jelas: semakin sulit, panjang, dan agentic tugasnya, semakin banyak token yang digunakan Gemini 3.8 Flash. Untuk tugas pendek dan berulang, tingkat pemikiran atau model lama dapat memberikan biaya yang lebih baik.

Angka Artificial Analysis bukan angka dari workload Anda. Sebelum mengganti model di produksi, jalankan prompt Anda sendiri pada kedua model dan bandingkan jumlah tokennya.

[Apidog](https://apidog.com/?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) dapat digunakan untuk membuat pengujian ini dalam beberapa langkah.

Atur `GEMINI_API_KEY`

sebagai environment variable di Apidog.

Tambahkan request `POST`

ke endpoint berikut:

```
https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
```

Gunakan `x-goog-api-key`

dan ambil nilainya dari variabel `GEMINI_API_KEY`

.

Jadikan `model`

sebagai variabel skenario. Gunakan body yang sama pada kedua pengujian:

```
{
  "contents": [
    {
      "parts": [
        {
          "text": "{{golden_prompt}}"
        }
      ]
    }
  ],
  "generationConfig": {
    "thinkingConfig": {
      "thinkingLevel": "medium"
    }
  }
}
```

Gunakan dua langkah:

`model`

= `gemini-3.7-flash`

`model`

= `gemini-3.8-flash`

Pada setiap langkah, tambahkan assertion untuk:

`usageMetadata.candidatesTokenCount`

`usageMetadata.thoughtsTokenCount`

Tetapkan batas assertion sesuai anggaran token Anda.

Gunakan dataset berisi 10–20 prompt emas yang mewakili workload produksi.

Laporan pengujian akan menampilkan respons dan hasil assertion dari kedua model dalam satu proses. Dengan begitu, peningkatan token sekitar 30% dapat dibandingkan langsung dengan workload Anda sendiri.

Setelah hasilnya sesuai, [jadwalkan skenario pengujian](https://apidog.com/id/blog/how-to-schedule-api-tests-apidog?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation). Jika jumlah token pemikiran tiba-tiba meningkat setelah pembaruan model, pengujian akan gagal lebih awal daripada menunggu tagihan meningkat.

Anda dapat [mengunduh Apidog](https://apidog.com/download?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation); paket gratis mencakup alur kerja ini.

Tidak secara umum. Google menyebut kecepatannya “kurang lebih sama”, sementara Artificial Analysis mengukur sekitar 300 token keluaran per detik pada tingkat `high`

.

Karena Gemini 3.8 Flash menggunakan lebih banyak langkah penalaran, waktu per tugas dalam pengujian Artificial Analysis sedikit meningkat:

`high`

: 2,2 menit`high`

: 2,5 menit`low`

: 0,8 menitTidak jika dihitung per token. Keduanya berharga $0,75 untuk masukan dan $3,75 untuk keluaran hingga 31 Desember 2026, kemudian naik menjadi $1,50 dan $7,50.

Namun, biaya per tugas lebih tinggi. Artificial Analysis mengukur:

`high`

: $0,40 per tugas`high`

: $0,58 per tugasPerbedaannya berasal dari penggunaan token keluaran yang sekitar 30% lebih tinggi.

Belum ada tanggal penghentian. Google menyatakan bahwa Gemini 3.7 Flash “tetap didukung penuh”, sehingga Anda masih dapat menggunakannya.

[Postingan tentang Gemini 3.7 Flash](https://apidog.com/id/blog/whats-new-in-gemini-3-7-flash?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) tetap menjadi referensi untuk model tersebut.

Dua hal utama:

`thinking_level: "minimal"`

mengembalikan kesalahan `400 INVALID_ARGUMENT`

.`call_id`

pada Interactions API`id`

dan `name`

pada endpoint `generateContent`

lamaGemini 3.7 Flash merupakan lompatan yang lebih besar:

Gemini 3.8 Flash menambahkan tiga poin pada indeks tersebut dan mengubah cara model menggunakan token untuk verifikasi serta pemanggilan alat.

Untuk generasi sebelumnya, baca [Gemini 3.6 Flash vs 3.5 Flash](https://apidog.com/id/blog/gemini-3-6-flash-vs-gemini-3-5-flash?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).

Tingkatkan ke Gemini 3.8 Flash jika workload Anda:

Di area tersebut, Google dan Artificial Analysis sama-sama menunjukkan peningkatan.

Tetap gunakan Gemini 3.7 Flash—atau gunakan Gemini 3.8 Flash pada tingkat `low`

—jika Anda menjalankan panggilan pendek dan berulang dengan biaya per tugas sebagai metrik utama.

Apa pun pilihan Anda:

`minimal`

ke `low`

.`candidatesTokenCount`

dan `thoughtsTokenCount`

.
