# เจมิไน 3.8 แฟลช: เปรียบเทียบระดับการคิด ต่ำ ปานกลาง สูง พร้อมเหตุผลที่ระดับ Minimal หายไป

> Source: <https://dev.to/thanawat_wonchai/ecchmiain-38-aeflch-epriiybethiiybradabkaarkhid-tam-paanklaang-suung-phrmehtuphlthiiradab-minimal-haayaip-2p2n>
> Published: 2026-09-03 08:36:14+00:00

`thinking_level`

ของ Gemini 3.8 Flash ให้เหมาะกับแต่ละเส้นทาง
Gemini 3.8 Flash มีระดับการคิดสามระดับ ได้แก่ `low`

, `medium`

และ `high`

การตั้งค่านี้ควบคุมปริมาณการให้เหตุผลภายในก่อนโมเดลตอบกลับ และส่งผลโดยตรงต่อความหน่วง โทเค็นเอาต์พุต และค่าใช้จ่าย Google ออกแบบ 3.8 Flash ให้ “ทำงานหนักขึ้น” กับงานซับซ้อน ดังนั้นการเลือกระดับจึงสำคัญกว่าเดิมเมื่อเทียบกับ 3.7 Flash หากต้องการดูภาพรวมการเปิดตัว โปรดอ่าน [ภาพรวม Gemini 3.8 Flash](https://apidog.com/th/blog/what-is-gemini-3-8-flash?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) ส่วนบทความนี้จะเน้นเฉพาะการตั้งค่าระดับการคิด

มีสองประเด็นที่มักทำให้ทีมสับสน:

`medium`

ไม่ใช่ `high`

โดย Gemini 3 Pro ใช้ `high`

เป็นค่าเริ่มต้น`minimal`

ซึ่งเคยใช้กับ Gemini 3.7 Flash ไม่รองรับใน 3.8 Flash อีกต่อไป คำขอจะล้มเหลวตั้งแต่การตรวจสอบความถูกต้อง ก่อนสร้างโทเค็นใดๆ ดูรายละเอียดได้ที่ บทความนี้ครอบคลุมสิ่งที่แต่ละระดับทำ ค่าใช้จ่าย วิธีตั้งค่าใน API ทั้งสองแบบ กลยุทธ์การเลือกใช้ และการทดสอบที่ทำซ้ำได้ใน Apidog

| ระดับ | คำแนะนำของ Google | ค่าใช้จ่ายต่อภารกิจ (AA) | เวลาต่อภารกิจ (AA) | เหมาะกับ |
|---|---|---|---|---|
`low` |
ลดความหน่วงและค่าใช้จ่าย เหมาะกับคำสั่งง่าย แชท และงานปริมาณสูง | $0.24 | 0.8 นาที | งานที่ผู้ใช้รอผลโดยตรง การค้นหาจากข้อความถอดเสียง การจัดหมวดหมู่ |
`medium` (ค่าเริ่มต้น) |
สมดุลสำหรับโค้ดซับซ้อนและงานแบบเอเจนต์ | $0.41 | ไม่ระบุ | เส้นทางส่วนใหญ่ การถามตอบวิดีโอทั่วไป |
`high` |
ให้เหตุผลลึกที่สุดสำหรับปัญหาหลายขั้นตอน | $0.58 | 2.5 นาที | การถามตอบภาพหนาแน่น วิดีโอยาวกว่า 60 นาที และขั้นตอนวางแผนสำคัญ |
`minimal` |
ไม่รองรับใน 3.8 Flash | n/a | n/a | ห้ามใช้ ให้แมปเป็น `low`
|

ค่าใช้จ่ายและเวลาเป็นค่าเฉลี่ยจากการทดสอบ Intelligence Index ของ [Artificial Analysis](https://artificialanalysis.ai/articles/gemini-3-8-flash) โดยใช้ราคาโทเค็นเบื้องต้นของ Google ตัวเลขนี้ไม่ใช่ข้อมูลจาก Google และไม่ได้อ้างอิงพรอมต์ของคุณโดยตรง ให้ใช้เพื่อดูอัตราส่วน แล้ววัดเส้นทางจริงของคุณเอง

คำตอบของ 3.8 Flash อาจมี **thinking tokens** ซึ่งเป็นการให้เหตุผลที่โมเดลสร้างขึ้นก่อนคำตอบที่ผู้ใช้มองเห็น โทเค็นเหล่านี้ถูกคิดเป็น output tokens:

API รายงานจำนวนดังกล่าวแยกต่างหากใน `usageMetadata.thoughtsTokenCount`

ระดับการคิดทำหน้าที่เป็นคำแนะนำว่าโมเดลควรใช้การให้เหตุผลมากน้อยเพียงใด:

`low`

`medium`

`high`

พฤติกรรมที่ทำให้ 3.8 Flash แตกต่างคือ ในงานซับซ้อน โมเดลอาจ:

หากจำนวนโทเค็นเพิ่มขึ้นมาก คำแนะนำแรกของ Google คือ ลด `thinking_level`

และคำแนะนำถัดมาคือใช้ 3.7 Flash ต่อไป ซึ่งยังได้รับการสนับสนุนอย่างเต็มที่

`thinking_level`

เป็น enum ไม่ใช่งบประมาณโทเค็น

`thinking_budget`

แบบจำนวนเต็มจากโมเดลรุ่นก่อนถูกนำออกใน Gemini 3 ดังนั้นคุณไม่สามารถกำหนดว่า “ใช้ thinking tokens สูงสุด 2,000 โทเค็น” ได้ ต้องเลือกระดับแล้ววัดผลจริง

`medium`

ไม่ใช่ `high`

หากไม่ส่งฟิลด์นี้ 3.8 Flash จะใช้ `medium`

ซึ่งอาจสร้างปัญหาได้สองกรณี:

`high`

`thinking_budget`

ระหว่างย้ายจาก 3.7 Flash อาจใช้ `medium`

โดยไม่ตั้งใจ แม้แต่ในเส้นทางแชทที่ควรใช้ `low`

วิธีแก้คือกำหนด `thinking_level`

อย่างชัดเจนในทุกคำขอและทุกเส้นทาง ควรเก็บค่าไว้ในไฟล์กำหนดค่าหรือ routing config แทนการกระจายไว้ในโค้ด เพื่อให้โปรไฟล์ค่าใช้จ่ายไม่เปลี่ยนโดยไม่ตั้งใจเมื่อค่าเริ่มต้นของ Google เปลี่ยน

`minimal`

ไม่รองรับแล้ว: วิธีแก้ข้อผิดพลาด
Gemini 3.8 Flash รองรับเฉพาะ `low`

, `medium`

และ `high`

ตาม [หน้าโมเดล](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash)

หากส่ง `minimal`

ผ่าน REST API คำขอจะถูกปฏิเสธด้วยสถานะ `400 INVALID_ARGUMENT`

:

```
Thinking level MINIMAL is not supported for this model.
Please retry with other thinking level.
```

ข้อผิดพลาดนี้ตรวจสอบแล้วด้วยการเรียกใช้งานจริงเมื่อวันที่ 3 กันยายน 2026 SDK อาจห่อหุ้มข้อผิดพลาดไว้ใน exception ของตัวเอง ดังนั้นควรตรวจสอบสถานะ `400`

หรือรหัส `INVALID_ARGUMENT`

ไม่ควรผูกกับข้อความอย่างเดียว

```
{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "minimal" }
}
{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "low" }
}
```

Google แนะนำให้แมปโดยตรง:

```
minimal → low
```

อย่าพยายามใช้ `thinking_budget`

เพื่อสร้างระดับที่ต่ำกว่า และอย่าลด `temperature`

เพื่อให้โมเดล “ใจเย็นลง” Google แนะนำให้คงค่าเริ่มต้น `1.0`

ในโมเดล Gemini 3 ทั้งหมด เพราะการลดค่าอาจทำให้เกิดการวนซ้ำหรือเอาต์พุตด้อยคุณภาพ

รายละเอียดเรื่อง thought signatures และข้อกำหนด `call_id`

ใน function response อยู่ใน [คู่มือการย้ายข้อมูล 3.7 ไป 3.8 Flash](https://apidog.com/th/blog/gemini-3-7-to-3-8-flash-migration-guide?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation)

เนื่องจากข้อผิดพลาดเกิดขึ้นตั้งแต่ขั้นตอน validation คุณสามารถเพิ่มคำขอทดสอบที่ใช้ `minimal`

เพื่อจับการตั้งค่าที่ถอยกลับไปใช้ค่าที่ไม่รองรับได้โดยไม่ต้องรอให้เกิดการสร้างโทเค็น

ราคาต่อโทเค็นไม่ได้เปลี่ยนตามระดับ ตาม [หน้าการกำหนดราคา](https://ai.google.dev/gemini-api/docs/pricing):

สิ่งที่แตกต่างระหว่างระดับคือจำนวน output tokens ที่โมเดลสร้างขึ้น

| โมเดลและระดับ | ค่าใช้จ่ายต่อภารกิจ | เวลาต่อภารกิจ |
|---|---|---|
Gemini 3.8 Flash `low`
|
$0.24 | 0.8 นาที |
Gemini 3.8 Flash `medium`
|
$0.41 | ไม่ระบุ |
Gemini 3.8 Flash `high`
|
$0.58 | 2.5 นาที |
Gemini 3.7 Flash `high`
|
$0.40 | 2.2 นาที |

ที่มา: Artificial Analysis, การทดสอบ Intelligence Index โดยใช้ราคาแนะนำ

ข้อสังเกตสำคัญจากตาราง:

`low`

มีค่าใช้จ่ายประมาณ 41% ของ `high`

และใช้เวลาประมาณหนึ่งในสาม จึงเป็นตัวเลือกสำคัญสำหรับงานที่ไวต่อความหน่วง`medium`

บน 3.8 Flash มีค่าใช้จ่ายใกล้เคียงกับ `high`

บน 3.7 Flash ($0.41 เทียบกับ $0.40)`high`

บน 3.8 Flash แพงกว่า `high`

บน 3.7 Flash ประมาณ 45% แม้ราคาต่อโทเค็นเท่ากัน เนื่องจากสร้าง output tokens มากขึ้นประมาณ 30% หรือเฉลี่ยราว 48k โทเค็นต่อภารกิจในดัชนีอย่าสรุปว่าคุณภาพจะเพิ่มหรือลดเป็นเส้นตรงตามค่าใช้จ่าย คะแนน Intelligence Index ของ Artificial Analysis ที่ 59 สำหรับ 3.8 Flash มาจากการรันด้วย `high`

พวกเขาไม่ได้เผยแพร่คะแนนของ `medium`

หรือ `low`

ดังนั้นควรประเมินงานของคุณเองก่อนลดระดับ

สำหรับตัวอย่างการคำนวณค่าใช้จ่าย 1,000 ภารกิจต่อวัน และการเปลี่ยนราคาในวันที่ 31 ธันวาคม โปรดดู [การกำหนดราคา Gemini 3.8 Flash](https://apidog.com/th/blog/gemini-3-8-flash-pricing?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation)

`thinking_level`

ใน Interactions API
Interactions API เป็นอินเทอร์เฟซหลักของ Google สำหรับ Gemini 3.x ระดับจะอยู่ใน `generation_config`

และใช้รูปแบบ `snake_case`

```
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Explain HTTP caching in 3 sentences.",
    generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
```

`thinking_level`

เป็นฟิลด์ระดับคำขอ จึงต้องส่งทุกครั้ง รวมถึงการโต้ตอบต่อเนื่องที่ใช้ `previous_interaction_id`

การตอบกลับจะเป็นรายการขั้นตอน เช่น thoughts และ tool calls ก่อนจบด้วย `model_output`

โดย SDK จะแสดงข้อความสุดท้ายผ่าน `output_text`

ดูตัวอย่างการใช้งานแบบเต็ม รวมถึง multi-turn และ streaming ได้ที่ [วิธีใช้ Gemini 3.8 Flash API](https://apidog.com/th/blog/how-to-use-gemini-3-8-flash-api?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation)

`generateContent`

แบบดั้งเดิม
โค้ด Gemini ส่วนใหญ่ยังใช้ `generateContent`

ซึ่ง Google เรียกว่า legacy API แต่ยังได้รับการสนับสนุนอย่างเต็มที่และยังไม่มีวันยุติการใช้งาน

ใน API นี้ ฟิลด์จะอยู่ลึกลงไปอีกหนึ่งระดับและใช้รูปแบบ `camelCase`

```
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-[REDACTED CREDENTIAL]" -H 'Content-Type: application/json' -X POST \
  -d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
python
from google.genai import types

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Explain HTTP caching in 3 sentences.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="low")
    ),
)
print(response.usage_metadata.thoughts_token_count)
```

`includeThoughts: true`

จะเพิ่ม thought summaries เข้าไปใน response ซึ่งมีประโยชน์ตอนปรับระดับ แต่ไม่จำเป็นเมื่อใช้งานจริง

ฟิลด์ที่ควรเฝ้าดูคือ:

```
usageMetadata.thoughtsTokenCount
```

นี่คือจำนวน thinking tokens ที่ถูกเรียกเก็บเป็น output tokens และควรเป็นหนึ่งในตัวชี้วัดหลักของการทดสอบ

ให้มอง `thinking_level`

เป็น **การตัดสินใจระดับเส้นทาง** ไม่ใช่การตั้งค่ากลางทั้งระบบ

`low`

เมื่อผู้ใช้กำลังรอผลและ first-token latency สำคัญ`low`

แล้วทำ evaluation เพื่อยืนยันความแม่นยำ ตัวอย่างวิดีโอของ Google ก็ใช้ `low`

สำหรับการค้นหาจากข้อความถอดเสียง`medium`

เป็นค่าเริ่มต้น ยกระดับเฉพาะขั้นตอนวางแผนที่กำหนดทุกขั้นตอนถัดไปเป็น `high`

แล้วลดกลับลงมา การใช้ `high`

ตลอด tool loop อาจเพิ่มค่าใช้จ่ายอย่างรวดเร็ว`high`

ร่วมกับ Batch API ซึ่งลดค่าใช้จ่ายได้ 50% เมื่อไม่ใช่งานแบบโต้ตอบ`high`

: การถามตอบภาพที่มีข้อมูลหนาแน่น หรือวิดีโอยาวกว่า 60 นาที`medium`

: การถามตอบวิดีโอทั่วไป`low`

: การค้นหาจากข้อความถอดเสียงหากแม้แต่ `low`

ของ 3.8 Flash ยังช้าหรือแพงเกินไป ให้พิจารณาตระกูล Flash-Lite [คู่มือ Gemini 3.1 Flash-Lite](https://apidog.com/th/blog/gemini-3-1-flash-lite?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) ครอบคล้าดูจำนวนโทเค็นหลังอัปเกรด

ข้อมูลจาก Artificial Analysis ช่วยบอกอัตราส่วน แต่มีเพียงพรอมต์จริงของคุณเท่านั้นที่จะบอกค่า latency, token usage และค่าใช้จ่ายที่ใช้งานได้จริง

สร้างสถานการณ์ทดสอบใน Apidog โดยส่ง golden prompt เดียวกันด้วยทั้งสามระดับ:

`GEMINI_API_KEY`

ใน Apidog และอ้างอิงใน header เป็น `{{GEMINI_API_KEY}}`

`THINKING_LEVEL`

เพื่อใช้ request เดียวกับทั้งสามขั้นตอน`POST`

ไปยัง `/v1beta/models/gemini-3.8-flash:generateContent`

โดยกำหนดค่า:

```
   {
     "thinkingConfig": {
       "thinkingLevel": "{{THINKING_LEVEL}}"
     }
   }
```

`THINKING_LEVEL`

เป็น `low`

, `medium`

และ `high`

`200`

`usageMetadata.thoughtsTokenCount`

`low`

อยู่ภายใต้ขีดจำกัด latency และ token ที่เส้นทางยอมรับได้`high`

ใช้การให้เหตุผลอย่างน้อยเท่ากับ `low`

หลังการรันครั้งแรก ให้เก็บค่าของแต่ละขั้นตอนไว้ในตัวแปร เพื่อให้การตรวจสอบทำได้อัตโนมัติ หาก `low`

ใช้โทเค็นมากกว่า `high`

ให้ถือว่าโมเดลหรือค่าเริ่มต้นอาจเปลี่ยนโดยไม่รู้ตัว

```
   {
     "thinkingLevel": "minimal"
   }
```

จากนั้นยืนยันว่าการตอบกลับไม่ใช่ `200`

เมื่อเปลี่ยน model ID ในอนาคต ขั้นตอนนี้ช่วยตรวจสอบว่าโมเดลใหม่ยังปฏิเสธค่าที่ไม่รองรับหรือไม่

สำหรับ streaming response สามารถใช้แนวทางเดียวกันกับ SSE ได้ ดูรายละเอียดที่ [วิธีทดสอบ LLM APIs ที่สตรีมผ่าน SSE](https://apidog.com/th/blog/test-llm-ai-apis-sse?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation)

[ดาวน์โหลด Apidog](https://apidog.com/download?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) เพื่อเริ่มทดสอบ โดยแผนฟรีรองรับ scenario เหล่านี้

ไม่ ราคาของ 3.8 Flash ยังคงเป็น $0.75 ต่อล้าน input tokens และ $3.75 ต่อล้าน output tokens ตามราคาแนะนำ โดยไม่ขึ้นกับระดับ

ระดับจะเปลี่ยนจำนวน output tokens ที่โมเดลสร้างขึ้นเพื่อการคิด และโทเค็นเหล่านั้นจะถูกคิดในราคา output รายละเอียดเรื่องการแคช การประมวลผลแบบแบตช์ และการขึ้นราคาในวันที่ 1 มกราคมอยู่ใน [หน้าการกำหนดราคา](https://ai.google.dev/gemini-api/docs/pricing)

ไม่ได้ ใน Gemini 3 `thinking_budget`

ถูกแทนที่ด้วย enum `thinking_level`

และ 3.8 Flash รองรับเฉพาะ `low`

, `medium`

และ `high`

หากต้องการจำกัดเพดาน ให้บังคับใช้ผ่าน evaluation, monitoring และ alerting แทนการกำหนดใน request

ใช้ `high`

Artificial Analysis รัน Intelligence Index ด้วยระดับ `high`

เพื่อสร้างคะแนนหลัก และเผยแพร่ค่าใช้จ่ายกับเวลาของ `low`

และ `medium`

แต่ไม่ได้เผยแพร่คะแนนดัชนีของสองระดับนั้น

จึงควรถือว่าคุณภาพของ `low`

และ `medium`

ยังไม่ได้รับการยืนยันบน benchmark เดียวกัน จนกว่าคุณจะทดสอบเอง

`temperature`

เพื่อลดการคิดหรือไม่
ไม่ควร Google แนะนำให้คง `temperature`

ที่ค่าเริ่มต้น `1.0`

ในโมเดล Gemini 3 ทั้งหมด การลดค่าอาจทำให้เกิดการวนซ้ำหรือเอาต์พุตด้อยคุณภาพ

ใช้ `thinking_level`

เพื่อควบคุมความลึกของการให้เหตุผล

`low`

ยังช้าหรือแพงเกินไปควรทำอย่างไร
มีสองทางเลือก:

อ่านการเปรียบเทียบเพิ่มเติมได้ที่ [การเปรียบเทียบ Gemini 3.8 Flash กับ Gemini 3.7 Flash](https://apidog.com/th/blog/gemini-3-8-flash-vs-gemini-3-7-flash?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation)

Gemini 3.8 Flash มีสามระดับการคิดและใช้ `medium`

เป็นค่าเริ่มต้น โมเดลยังสามารถใช้โทเค็นมากขึ้นในงานซับซ้อนตามการออกแบบ

แนวทางที่ควรทำ:

`thinking_level`

อย่างชัดเจนในทุกเส้นทาง`minimal`

ที่ยังหลงเหลืออยู่เป็น `low`

`thinking_budget`

กับ Gemini 3`temperature`

ไว้ที่ `1.0`

`usageMetadata.thoughtsTokenCount`

`low`

, `medium`

และ `high`

ด้วยพรอมต์จริงของคุณตัวเลขจาก Artificial Analysis—$0.24, $0.41 และ $0.58 ต่อภารกิจ—ช่วยให้เห็นรูปแบบโดยรวม ส่วนการทดสอบสามขั้นตอนใน Apidog จะบอกต้นทุนและ latency ของระบบคุณเอง ก่อนการเปลี่ยนแปลงราคาในวันที่ 31 ธันวาคมจะทำให้ผลลัพธ์เหล่านี้สำคัญยิ่งขึ้น
