thinking_level
ของ Gemini 3.8 Flash ให้เหมาะกับแต่ละเส้นทาง
Gemini 3.8 Flash มีระดับการคิดสามระดับ ได้แก่ low
, medium
และ high
การตั้งค่านี้ควบคุมปริมาณการให้เหตุผลภายในก่อนโมเดลตอบกลับ และส่งผลโดยตรงต่อความหน่วง โทเค็นเอาต์พุต และค่าใช้จ่าย Google ออกแบบ 3.8 Flash ให้ “ทำงานหนักขึ้น” กับงานซับซ้อน ดังนั้นการเลือกระดับจึงสำคัญกว่าเดิมเมื่อเทียบกับ 3.7 Flash หากต้องการดูภาพรวมการเปิดตัว โปรดอ่าน ภาพรวม Gemini 3.8 Flash ส่วนบทความนี้จะเน้นเฉพาะการตั้งค่าระดับการคิด
มีสองประเด็นที่มักทำให้ทีมสับสน:
medium
ไม่ใช่ high
โดย Gemini 3 Pro ใช้ high
เป็นค่าเริ่มต้นminimal
ซึ่งเคยใช้กับ Gemini 3.7 Flash ไม่รองรับใน 3.8 Flash อีกต่อไป คำขอจะล้มเหลวตั้งแต่การตรวจสอบความถูกต้อง ก่อนสร้างโทเค็นใดๆ ดูรายละเอียดได้ที่ บทความนี้ครอบคลุมสิ่งที่แต่ละระดับทำ ค่าใช้จ่าย วิธีตั้งค่าใน API ทั้งสองแบบ กลยุทธ์การเลือกใช้ และการทดสอบที่ทำซ้ำได้ใน Apidog
| ระดับ | คำแนะนำของ Google | ค่าใช้จ่ายต่อภารกิจ (AA) | เวลาต่อภารกิจ (AA) | เหมาะกับ |
|---|---|---|---|---|
low |
||||
| ลดความหน่วงและค่าใช้จ่าย เหมาะกับคำสั่งง่าย แชท และงานปริมาณสูง | $0.24 | 0.8 นาที | งานที่ผู้ใช้รอผลโดยตรง การค้นหาจากข้อความถอดเสียง การจัดหมวดหมู่ | |
medium (ค่าเริ่มต้น) |
||||
| สมดุลสำหรับโค้ดซับซ้อนและงานแบบเอเจนต์ | $0.41 | ไม่ระบุ | เส้นทางส่วนใหญ่ การถามตอบวิดีโอทั่วไป | |
high |
||||
| ให้เหตุผลลึกที่สุดสำหรับปัญหาหลายขั้นตอน | $0.58 | 2.5 นาที | การถามตอบภาพหนาแน่น วิดีโอยาวกว่า 60 นาที และขั้นตอนวางแผนสำคัญ | |
minimal |
||||
| ไม่รองรับใน 3.8 Flash | n/a | n/a | ห้ามใช้ ให้แมปเป็น low |
|
ค่าใช้จ่ายและเวลาเป็นค่าเฉลี่ยจากการทดสอบ Intelligence Index ของ Artificial Analysis โดยใช้ราคาโทเค็นเบื้องต้นของ Google ตัวเลขนี้ไม่ใช่ข้อมูลจาก Google และไม่ได้อ้างอิงพรอมต์ของคุณโดยตรง ให้ใช้เพื่อดูอัตราส่วน แล้ววัดเส้นทางจริงของคุณเอง
คำตอบของ 3.8 Flash อาจมี thinking tokens ซึ่งเป็นการให้เหตุผลที่โมเดลสร้างขึ้นก่อนคำตอบที่ผู้ใช้มองเห็น โทเค็นเหล่านี้ถูกคิดเป็น output tokens:
API รายงานจำนวนดังกล่าวแยกต่างหากใน usageMetadata.thoughtsTokenCount
ระดับการคิดทำหน้าที่เป็นคำแนะนำว่าโมเดลควรใช้การให้เหตุผลมากน้อยเพียงใด:
low
medium
high
พฤติกรรมที่ทำให้ 3.8 Flash แตกต่างคือ ในงานซับซ้อน โมเดลอาจ:
หากจำนวนโทเค็นเพิ่มขึ้นมาก คำแนะนำแรกของ Google คือ ลด thinking_level
และคำแนะนำถัดมาคือใช้ 3.7 Flash ต่อไป ซึ่งยังได้รับการสนับสนุนอย่างเต็มที่
thinking_level
เป็น enum ไม่ใช่งบประมาณโทเค็น
thinking_budget
แบบจำนวนเต็มจากโมเดลรุ่นก่อนถูกนำออกใน Gemini 3 ดังนั้นคุณไม่สามารถกำหนดว่า “ใช้ thinking tokens สูงสุด 2,000 โทเค็น” ได้ ต้องเลือกระดับแล้ววัดผลจริง
medium
ไม่ใช่ high
หากไม่ส่งฟิลด์นี้ 3.8 Flash จะใช้ medium
ซึ่งอาจสร้างปัญหาได้สองกรณี:
high
thinking_budget
ระหว่างย้ายจาก 3.7 Flash อาจใช้ medium
โดยไม่ตั้งใจ แม้แต่ในเส้นทางแชทที่ควรใช้ low
วิธีแก้คือกำหนด thinking_level
อย่างชัดเจนในทุกคำขอและทุกเส้นทาง ควรเก็บค่าไว้ในไฟล์กำหนดค่าหรือ routing config แทนการกระจายไว้ในโค้ด เพื่อให้โปรไฟล์ค่าใช้จ่ายไม่เปลี่ยนโดยไม่ตั้งใจเมื่อค่าเริ่มต้นของ Google เปลี่ยน
minimal
ไม่รองรับแล้ว: วิธีแก้ข้อผิดพลาด
Gemini 3.8 Flash รองรับเฉพาะ low
, medium
และ high
ตาม หน้าโมเดล
หากส่ง minimal
ผ่าน REST API คำขอจะถูกปฏิเสธด้วยสถานะ 400 INVALID_ARGUMENT
:
Thinking level MINIMAL is not supported for this model.
Please retry with other thinking level.
ข้อผิดพลาดนี้ตรวจสอบแล้วด้วยการเรียกใช้งานจริงเมื่อวันที่ 3 กันยายน 2026 SDK อาจห่อหุ้มข้อผิดพลาดไว้ใน exception ของตัวเอง ดังนั้นควรตรวจสอบสถานะ 400
หรือรหัส INVALID_ARGUMENT
ไม่ควรผูกกับข้อความอย่างเดียว
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "minimal" }
}
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "low" }
}
Google แนะนำให้แมปโดยตรง:
minimal → low
อย่าพยายามใช้ thinking_budget
เพื่อสร้างระดับที่ต่ำกว่า และอย่าลด temperature
เพื่อให้โมเดล “ใจเย็นลง” Google แนะนำให้คงค่าเริ่มต้น 1.0
ในโมเดล Gemini 3 ทั้งหมด เพราะการลดค่าอาจทำให้เกิดการวนซ้ำหรือเอาต์พุตด้อยคุณภาพ
รายละเอียดเรื่อง thought signatures และข้อกำหนด call_id
ใน function response อยู่ใน คู่มือการย้ายข้อมูล 3.7 ไป 3.8 Flash
เนื่องจากข้อผิดพลาดเกิดขึ้นตั้งแต่ขั้นตอน validation คุณสามารถเพิ่มคำขอทดสอบที่ใช้ minimal
เพื่อจับการตั้งค่าที่ถอยกลับไปใช้ค่าที่ไม่รองรับได้โดยไม่ต้องรอให้เกิดการสร้างโทเค็น
ราคาต่อโทเค็นไม่ได้เปลี่ยนตามระดับ ตาม หน้าการกำหนดราคา:
สิ่งที่แตกต่างระหว่างระดับคือจำนวน output tokens ที่โมเดลสร้างขึ้น
| โมเดลและระดับ | ค่าใช้จ่ายต่อภารกิจ | เวลาต่อภารกิจ |
|---|---|---|
Gemini 3.8 Flash low |
||
| $0.24 | 0.8 นาที | |
Gemini 3.8 Flash medium |
||
| $0.41 | ไม่ระบุ | |
Gemini 3.8 Flash high |
||
| $0.58 | 2.5 นาที | |
Gemini 3.7 Flash high |
||
| $0.40 | 2.2 นาที |
ที่มา: Artificial Analysis, การทดสอบ Intelligence Index โดยใช้ราคาแนะนำ
ข้อสังเกตสำคัญจากตาราง:
low
มีค่าใช้จ่ายประมาณ 41% ของ high
และใช้เวลาประมาณหนึ่งในสาม จึงเป็นตัวเลือกสำคัญสำหรับงานที่ไวต่อความหน่วงmedium
บน 3.8 Flash มีค่าใช้จ่ายใกล้เคียงกับ high
บน 3.7 Flash ($0.41 เทียบกับ $0.40)high
บน 3.8 Flash แพงกว่า high
บน 3.7 Flash ประมาณ 45% แม้ราคาต่อโทเค็นเท่ากัน เนื่องจากสร้าง output tokens มากขึ้นประมาณ 30% หรือเฉลี่ยราว 48k โทเค็นต่อภารกิจในดัชนีอย่าสรุปว่าคุณภาพจะเพิ่มหรือลดเป็นเส้นตรงตามค่าใช้จ่าย คะแนน Intelligence Index ของ Artificial Analysis ที่ 59 สำหรับ 3.8 Flash มาจากการรันด้วย high
พวกเขาไม่ได้เผยแพร่คะแนนของ medium
หรือ low
ดังนั้นควรประเมินงานของคุณเองก่อนลดระดับ
สำหรับตัวอย่างการคำนวณค่าใช้จ่าย 1,000 ภารกิจต่อวัน และการเปลี่ยนราคาในวันที่ 31 ธันวาคม โปรดดู การกำหนดราคา Gemini 3.8 Flash
thinking_level
ใน Interactions API
Interactions API เป็นอินเทอร์เฟซหลักของ Google สำหรับ Gemini 3.x ระดับจะอยู่ใน generation_config
และใช้รูปแบบ snake_case
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Explain HTTP caching in 3 sentences.",
generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
thinking_level
เป็นฟิลด์ระดับคำขอ จึงต้องส่งทุกครั้ง รวมถึงการโต้ตอบต่อเนื่องที่ใช้ previous_interaction_id
การตอบกลับจะเป็นรายการขั้นตอน เช่น thoughts และ tool calls ก่อนจบด้วย model_output
โดย SDK จะแสดงข้อความสุดท้ายผ่าน output_text
ดูตัวอย่างการใช้งานแบบเต็ม รวมถึง multi-turn และ streaming ได้ที่ วิธีใช้ Gemini 3.8 Flash API
generateContent
แบบดั้งเดิม
โค้ด Gemini ส่วนใหญ่ยังใช้ generateContent
ซึ่ง Google เรียกว่า legacy API แต่ยังได้รับการสนับสนุนอย่างเต็มที่และยังไม่มีวันยุติการใช้งาน
ใน API นี้ ฟิลด์จะอยู่ลึกลงไปอีกหนึ่งระดับและใช้รูปแบบ camelCase
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-[REDACTED CREDENTIAL]" -H 'Content-Type: application/json' -X POST \
-d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
python
from google.genai import types
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Explain HTTP caching in 3 sentences.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.usage_metadata.thoughts_token_count)
includeThoughts: true
จะเพิ่ม thought summaries เข้าไปใน response ซึ่งมีประโยชน์ตอนปรับระดับ แต่ไม่จำเป็นเมื่อใช้งานจริง
ฟิลด์ที่ควรเฝ้าดูคือ:
usageMetadata.thoughtsTokenCount
นี่คือจำนวน thinking tokens ที่ถูกเรียกเก็บเป็น output tokens และควรเป็นหนึ่งในตัวชี้วัดหลักของการทดสอบ
ให้มอง thinking_level
เป็น การตัดสินใจระดับเส้นทาง ไม่ใช่การตั้งค่ากลางทั้งระบบ
low
เมื่อผู้ใช้กำลังรอผลและ first-token latency สำคัญlow
แล้วทำ evaluation เพื่อยืนยันความแม่นยำ ตัวอย่างวิดีโอของ Google ก็ใช้ low
สำหรับการค้นหาจากข้อความถอดเสียงmedium
เป็นค่าเริ่มต้น ยกระดับเฉพาะขั้นตอนวางแผนที่กำหนดทุกขั้นตอนถัดไปเป็น high
แล้วลดกลับลงมา การใช้ high
ตลอด tool loop อาจเพิ่มค่าใช้จ่ายอย่างรวดเร็วhigh
ร่วมกับ Batch API ซึ่งลดค่าใช้จ่ายได้ 50% เมื่อไม่ใช่งานแบบโต้ตอบhigh
: การถามตอบภาพที่มีข้อมูลหนาแน่น หรือวิดีโอยาวกว่า 60 นาทีmedium
: การถามตอบวิดีโอทั่วไปlow
: การค้นหาจากข้อความถอดเสียงหากแม้แต่ low
ของ 3.8 Flash ยังช้าหรือแพงเกินไป ให้พิจารณาตระกูล Flash-Lite คู่มือ Gemini 3.1 Flash-Lite ครอบคล้าดูจำนวนโทเค็นหลังอัปเกรด
ข้อมูลจาก Artificial Analysis ช่วยบอกอัตราส่วน แต่มีเพียงพรอมต์จริงของคุณเท่านั้นที่จะบอกค่า latency, token usage และค่าใช้จ่ายที่ใช้งานได้จริง
สร้างสถานการณ์ทดสอบใน Apidog โดยส่ง golden prompt เดียวกันด้วยทั้งสามระดับ:
GEMINI_API_KEY
ใน Apidog และอ้างอิงใน header เป็น {{GEMINI_API_KEY}}
THINKING_LEVEL
เพื่อใช้ request เดียวกับทั้งสามขั้นตอนPOST
ไปยัง /v1beta/models/gemini-3.8-flash:generateContent
โดยกำหนดค่า:
{
"thinkingConfig": {
"thinkingLevel": "{{THINKING_LEVEL}}"
}
}
THINKING_LEVEL
เป็น low
, medium
และ high
200
usageMetadata.thoughtsTokenCount
low
อยู่ภายใต้ขีดจำกัด latency และ token ที่เส้นทางยอมรับได้high
ใช้การให้เหตุผลอย่างน้อยเท่ากับ low
หลังการรันครั้งแรก ให้เก็บค่าของแต่ละขั้นตอนไว้ในตัวแปร เพื่อให้การตรวจสอบทำได้อัตโนมัติ หาก low
ใช้โทเค็นมากกว่า high
ให้ถือว่าโมเดลหรือค่าเริ่มต้นอาจเปลี่ยนโดยไม่รู้ตัว
{
"thinkingLevel": "minimal"
}
จากนั้นยืนยันว่าการตอบกลับไม่ใช่ 200
เมื่อเปลี่ยน model ID ในอนาคต ขั้นตอนนี้ช่วยตรวจสอบว่าโมเดลใหม่ยังปฏิเสธค่าที่ไม่รองรับหรือไม่
สำหรับ streaming response สามารถใช้แนวทางเดียวกันกับ SSE ได้ ดูรายละเอียดที่ วิธีทดสอบ LLM APIs ที่สตรีมผ่าน SSE
ดาวน์โหลด Apidog เพื่อเริ่มทดสอบ โดยแผนฟรีรองรับ scenario เหล่านี้
ไม่ ราคาของ 3.8 Flash ยังคงเป็น $0.75 ต่อล้าน input tokens และ $3.75 ต่อล้าน output tokens ตามราคาแนะนำ โดยไม่ขึ้นกับระดับ
ระดับจะเปลี่ยนจำนวน output tokens ที่โมเดลสร้างขึ้นเพื่อการคิด และโทเค็นเหล่านั้นจะถูกคิดในราคา output รายละเอียดเรื่องการแคช การประมวลผลแบบแบตช์ และการขึ้นราคาในวันที่ 1 มกราคมอยู่ใน หน้าการกำหนดราคา
ไม่ได้ ใน Gemini 3 thinking_budget
ถูกแทนที่ด้วย enum thinking_level
และ 3.8 Flash รองรับเฉพาะ low
, medium
และ high
หากต้องการจำกัดเพดาน ให้บังคับใช้ผ่าน evaluation, monitoring และ alerting แทนการกำหนดใน request
ใช้ high
Artificial Analysis รัน Intelligence Index ด้วยระดับ high
เพื่อสร้างคะแนนหลัก และเผยแพร่ค่าใช้จ่ายกับเวลาของ low
และ medium
แต่ไม่ได้เผยแพร่คะแนนดัชนีของสองระดับนั้น
จึงควรถือว่าคุณภาพของ low
และ medium
ยังไม่ได้รับการยืนยันบน benchmark เดียวกัน จนกว่าคุณจะทดสอบเอง
temperature
เพื่อลดการคิดหรือไม่
ไม่ควร Google แนะนำให้คง temperature
ที่ค่าเริ่มต้น 1.0
ในโมเดล Gemini 3 ทั้งหมด การลดค่าอาจทำให้เกิดการวนซ้ำหรือเอาต์พุตด้อยคุณภาพ
ใช้ thinking_level
เพื่อควบคุมความลึกของการให้เหตุผล
low
ยังช้าหรือแพงเกินไปควรทำอย่างไร มีสองทางเลือก:
อ่านการเปรียบเทียบเพิ่มเติมได้ที่ การเปรียบเทียบ Gemini 3.8 Flash กับ Gemini 3.7 Flash
Gemini 3.8 Flash มีสามระดับการคิดและใช้ medium
เป็นค่าเริ่มต้น โมเดลยังสามารถใช้โทเค็นมากขึ้นในงานซับซ้อนตามการออกแบบ
แนวทางที่ควรทำ:
thinking_level
อย่างชัดเจนในทุกเส้นทางminimal
ที่ยังหลงเหลืออยู่เป็น low
thinking_budget
กับ Gemini 3temperature
ไว้ที่ 1.0
usageMetadata.thoughtsTokenCount
low
, medium
และ high
ด้วยพรอมต์จริงของคุณตัวเลขจาก Artificial Analysis—$0.24, $0.41 และ $0.58 ต่อภารกิจ—ช่วยให้เห็นรูปแบบโดยรวม ส่วนการทดสอบสามขั้นตอนใน Apidog จะบอกต้นทุนและ latency ของระบบคุณเอง ก่อนการเปลี่ยนแปลงราคาในวันที่ 31 ธันวาคมจะทำให้ผลลัพธ์เหล่านี้สำคัญยิ่งขึ้น