cd /news/large-language-models/ecchmiain-3-8-aeflch-epriiybethiiybr… · home topics large-language-models article
[ARTICLE · art-120015] src=dev.to ↗ pub= topic=large-language-models verified=true sentiment=· neutral

เจมิไน 3.8 แฟลช: เปรียบเทียบระดับการคิด ต่ำ ปานกลาง สูง พร้อมเหตุผลที่ระดับ Minimal หายไป

Google's Gemini 3.8 Flash model introduces three thinking levels—low, medium, and high—replacing the previous minimal level, which is no longer supported and causes API requests to fail with a 400 error. The thinking level controls the amount of internal reasoning before a response, impacting latency, output tokens, and cost. Developers are advised to explicitly set the thinking level in every request to avoid unintended cost changes, as medium is the default but may not suit all use cases.

read5 min views2 publishedSep 3, 2026

thinking_level

ของ Gemini 3.8 Flash ให้เหมาะกับแต่ละเส้นทาง Gemini 3.8 Flash มีระดับการคิดสามระดับ ได้แก่ low

, medium

และ high

การตั้งค่านี้ควบคุมปริมาณการให้เหตุผลภายในก่อนโมเดลตอบกลับ และส่งผลโดยตรงต่อความหน่วง โทเค็นเอาต์พุต และค่าใช้จ่าย Google ออกแบบ 3.8 Flash ให้ “ทำงานหนักขึ้น” กับงานซับซ้อน ดังนั้นการเลือกระดับจึงสำคัญกว่าเดิมเมื่อเทียบกับ 3.7 Flash หากต้องการดูภาพรวมการเปิดตัว โปรดอ่าน ภาพรวม Gemini 3.8 Flash ส่วนบทความนี้จะเน้นเฉพาะการตั้งค่าระดับการคิด

มีสองประเด็นที่มักทำให้ทีมสับสน:

medium

ไม่ใช่ high

โดย Gemini 3 Pro ใช้ high

เป็นค่าเริ่มต้นminimal

ซึ่งเคยใช้กับ Gemini 3.7 Flash ไม่รองรับใน 3.8 Flash อีกต่อไป คำขอจะล้มเหลวตั้งแต่การตรวจสอบความถูกต้อง ก่อนสร้างโทเค็นใดๆ ดูรายละเอียดได้ที่ บทความนี้ครอบคลุมสิ่งที่แต่ละระดับทำ ค่าใช้จ่าย วิธีตั้งค่าใน API ทั้งสองแบบ กลยุทธ์การเลือกใช้ และการทดสอบที่ทำซ้ำได้ใน Apidog

ระดับ คำแนะนำของ Google ค่าใช้จ่ายต่อภารกิจ (AA) เวลาต่อภารกิจ (AA) เหมาะกับ
low
ลดความหน่วงและค่าใช้จ่าย เหมาะกับคำสั่งง่าย แชท และงานปริมาณสูง $0.24 0.8 นาที งานที่ผู้ใช้รอผลโดยตรง การค้นหาจากข้อความถอดเสียง การจัดหมวดหมู่
medium (ค่าเริ่มต้น)
สมดุลสำหรับโค้ดซับซ้อนและงานแบบเอเจนต์ $0.41 ไม่ระบุ เส้นทางส่วนใหญ่ การถามตอบวิดีโอทั่วไป
high
ให้เหตุผลลึกที่สุดสำหรับปัญหาหลายขั้นตอน $0.58 2.5 นาที การถามตอบภาพหนาแน่น วิดีโอยาวกว่า 60 นาที และขั้นตอนวางแผนสำคัญ
minimal
ไม่รองรับใน 3.8 Flash n/a n/a ห้ามใช้ ให้แมปเป็น low

ค่าใช้จ่ายและเวลาเป็นค่าเฉลี่ยจากการทดสอบ Intelligence Index ของ Artificial Analysis โดยใช้ราคาโทเค็นเบื้องต้นของ Google ตัวเลขนี้ไม่ใช่ข้อมูลจาก Google และไม่ได้อ้างอิงพรอมต์ของคุณโดยตรง ให้ใช้เพื่อดูอัตราส่วน แล้ววัดเส้นทางจริงของคุณเอง

คำตอบของ 3.8 Flash อาจมี thinking tokens ซึ่งเป็นการให้เหตุผลที่โมเดลสร้างขึ้นก่อนคำตอบที่ผู้ใช้มองเห็น โทเค็นเหล่านี้ถูกคิดเป็น output tokens:

API รายงานจำนวนดังกล่าวแยกต่างหากใน usageMetadata.thoughtsTokenCount

ระดับการคิดทำหน้าที่เป็นคำแนะนำว่าโมเดลควรใช้การให้เหตุผลมากน้อยเพียงใด:

low

medium

high

พฤติกรรมที่ทำให้ 3.8 Flash แตกต่างคือ ในงานซับซ้อน โมเดลอาจ:

หากจำนวนโทเค็นเพิ่มขึ้นมาก คำแนะนำแรกของ Google คือ ลด thinking_level

และคำแนะนำถัดมาคือใช้ 3.7 Flash ต่อไป ซึ่งยังได้รับการสนับสนุนอย่างเต็มที่

thinking_level

เป็น enum ไม่ใช่งบประมาณโทเค็น

thinking_budget

แบบจำนวนเต็มจากโมเดลรุ่นก่อนถูกนำออกใน Gemini 3 ดังนั้นคุณไม่สามารถกำหนดว่า “ใช้ thinking tokens สูงสุด 2,000 โทเค็น” ได้ ต้องเลือกระดับแล้ววัดผลจริง

medium

ไม่ใช่ high

หากไม่ส่งฟิลด์นี้ 3.8 Flash จะใช้ medium

ซึ่งอาจสร้างปัญหาได้สองกรณี:

high

thinking_budget

ระหว่างย้ายจาก 3.7 Flash อาจใช้ medium

โดยไม่ตั้งใจ แม้แต่ในเส้นทางแชทที่ควรใช้ low

วิธีแก้คือกำหนด thinking_level

อย่างชัดเจนในทุกคำขอและทุกเส้นทาง ควรเก็บค่าไว้ในไฟล์กำหนดค่าหรือ routing config แทนการกระจายไว้ในโค้ด เพื่อให้โปรไฟล์ค่าใช้จ่ายไม่เปลี่ยนโดยไม่ตั้งใจเมื่อค่าเริ่มต้นของ Google เปลี่ยน

minimal

ไม่รองรับแล้ว: วิธีแก้ข้อผิดพลาด Gemini 3.8 Flash รองรับเฉพาะ low

, medium

และ high

ตาม หน้าโมเดล

หากส่ง minimal

ผ่าน REST API คำขอจะถูกปฏิเสธด้วยสถานะ 400 INVALID_ARGUMENT

:

Thinking level MINIMAL is not supported for this model.
Please retry with other thinking level.

ข้อผิดพลาดนี้ตรวจสอบแล้วด้วยการเรียกใช้งานจริงเมื่อวันที่ 3 กันยายน 2026 SDK อาจห่อหุ้มข้อผิดพลาดไว้ใน exception ของตัวเอง ดังนั้นควรตรวจสอบสถานะ 400

หรือรหัส INVALID_ARGUMENT

ไม่ควรผูกกับข้อความอย่างเดียว

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "minimal" }
}
{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "low" }
}

Google แนะนำให้แมปโดยตรง:

minimal → low

อย่าพยายามใช้ thinking_budget

เพื่อสร้างระดับที่ต่ำกว่า และอย่าลด temperature

เพื่อให้โมเดล “ใจเย็นลง” Google แนะนำให้คงค่าเริ่มต้น 1.0

ในโมเดล Gemini 3 ทั้งหมด เพราะการลดค่าอาจทำให้เกิดการวนซ้ำหรือเอาต์พุตด้อยคุณภาพ

รายละเอียดเรื่อง thought signatures และข้อกำหนด call_id

ใน function response อยู่ใน คู่มือการย้ายข้อมูล 3.7 ไป 3.8 Flash

เนื่องจากข้อผิดพลาดเกิดขึ้นตั้งแต่ขั้นตอน validation คุณสามารถเพิ่มคำขอทดสอบที่ใช้ minimal

เพื่อจับการตั้งค่าที่ถอยกลับไปใช้ค่าที่ไม่รองรับได้โดยไม่ต้องรอให้เกิดการสร้างโทเค็น

ราคาต่อโทเค็นไม่ได้เปลี่ยนตามระดับ ตาม หน้าการกำหนดราคา:

สิ่งที่แตกต่างระหว่างระดับคือจำนวน output tokens ที่โมเดลสร้างขึ้น

โมเดลและระดับ ค่าใช้จ่ายต่อภารกิจ เวลาต่อภารกิจ
Gemini 3.8 Flash low
$0.24 0.8 นาที
Gemini 3.8 Flash medium
$0.41 ไม่ระบุ
Gemini 3.8 Flash high
$0.58 2.5 นาที
Gemini 3.7 Flash high
$0.40 2.2 นาที

ที่มา: Artificial Analysis, การทดสอบ Intelligence Index โดยใช้ราคาแนะนำ

ข้อสังเกตสำคัญจากตาราง:

low

มีค่าใช้จ่ายประมาณ 41% ของ high

และใช้เวลาประมาณหนึ่งในสาม จึงเป็นตัวเลือกสำคัญสำหรับงานที่ไวต่อความหน่วงmedium

บน 3.8 Flash มีค่าใช้จ่ายใกล้เคียงกับ high

บน 3.7 Flash ($0.41 เทียบกับ $0.40)high

บน 3.8 Flash แพงกว่า high

บน 3.7 Flash ประมาณ 45% แม้ราคาต่อโทเค็นเท่ากัน เนื่องจากสร้าง output tokens มากขึ้นประมาณ 30% หรือเฉลี่ยราว 48k โทเค็นต่อภารกิจในดัชนีอย่าสรุปว่าคุณภาพจะเพิ่มหรือลดเป็นเส้นตรงตามค่าใช้จ่าย คะแนน Intelligence Index ของ Artificial Analysis ที่ 59 สำหรับ 3.8 Flash มาจากการรันด้วย high

พวกเขาไม่ได้เผยแพร่คะแนนของ medium

หรือ low

ดังนั้นควรประเมินงานของคุณเองก่อนลดระดับ

สำหรับตัวอย่างการคำนวณค่าใช้จ่าย 1,000 ภารกิจต่อวัน และการเปลี่ยนราคาในวันที่ 31 ธันวาคม โปรดดู การกำหนดราคา Gemini 3.8 Flash

thinking_level

ใน Interactions API Interactions API เป็นอินเทอร์เฟซหลักของ Google สำหรับ Gemini 3.x ระดับจะอยู่ใน generation_config

และใช้รูปแบบ snake_case

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Explain HTTP caching in 3 sentences.",
    generation_config={"thinking_level": "low"},
)
print(interaction.output_text)

thinking_level

เป็นฟิลด์ระดับคำขอ จึงต้องส่งทุกครั้ง รวมถึงการโต้ตอบต่อเนื่องที่ใช้ previous_interaction_id

การตอบกลับจะเป็นรายการขั้นตอน เช่น thoughts และ tool calls ก่อนจบด้วย model_output

โดย SDK จะแสดงข้อความสุดท้ายผ่าน output_text

ดูตัวอย่างการใช้งานแบบเต็ม รวมถึง multi-turn และ streaming ได้ที่ วิธีใช้ Gemini 3.8 Flash API

generateContent

แบบดั้งเดิม โค้ด Gemini ส่วนใหญ่ยังใช้ generateContent

ซึ่ง Google เรียกว่า legacy API แต่ยังได้รับการสนับสนุนอย่างเต็มที่และยังไม่มีวันยุติการใช้งาน

ใน API นี้ ฟิลด์จะอยู่ลึกลงไปอีกหนึ่งระดับและใช้รูปแบบ camelCase

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-[REDACTED CREDENTIAL]" -H 'Content-Type: application/json' -X POST \
  -d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
python
from google.genai import types

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Explain HTTP caching in 3 sentences.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="low")
    ),
)
print(response.usage_metadata.thoughts_token_count)

includeThoughts: true

จะเพิ่ม thought summaries เข้าไปใน response ซึ่งมีประโยชน์ตอนปรับระดับ แต่ไม่จำเป็นเมื่อใช้งานจริง

ฟิลด์ที่ควรเฝ้าดูคือ:

usageMetadata.thoughtsTokenCount

นี่คือจำนวน thinking tokens ที่ถูกเรียกเก็บเป็น output tokens และควรเป็นหนึ่งในตัวชี้วัดหลักของการทดสอบ

ให้มอง thinking_level

เป็น การตัดสินใจระดับเส้นทาง ไม่ใช่การตั้งค่ากลางทั้งระบบ

low

เมื่อผู้ใช้กำลังรอผลและ first-token latency สำคัญlow

แล้วทำ evaluation เพื่อยืนยันความแม่นยำ ตัวอย่างวิดีโอของ Google ก็ใช้ low

สำหรับการค้นหาจากข้อความถอดเสียงmedium

เป็นค่าเริ่มต้น ยกระดับเฉพาะขั้นตอนวางแผนที่กำหนดทุกขั้นตอนถัดไปเป็น high

แล้วลดกลับลงมา การใช้ high

ตลอด tool loop อาจเพิ่มค่าใช้จ่ายอย่างรวดเร็วhigh

ร่วมกับ Batch API ซึ่งลดค่าใช้จ่ายได้ 50% เมื่อไม่ใช่งานแบบโต้ตอบhigh

: การถามตอบภาพที่มีข้อมูลหนาแน่น หรือวิดีโอยาวกว่า 60 นาทีmedium

: การถามตอบวิดีโอทั่วไปlow

: การค้นหาจากข้อความถอดเสียงหากแม้แต่ low

ของ 3.8 Flash ยังช้าหรือแพงเกินไป ให้พิจารณาตระกูล Flash-Lite คู่มือ Gemini 3.1 Flash-Lite ครอบคล้าดูจำนวนโทเค็นหลังอัปเกรด

ข้อมูลจาก Artificial Analysis ช่วยบอกอัตราส่วน แต่มีเพียงพรอมต์จริงของคุณเท่านั้นที่จะบอกค่า latency, token usage และค่าใช้จ่ายที่ใช้งานได้จริง

สร้างสถานการณ์ทดสอบใน Apidog โดยส่ง golden prompt เดียวกันด้วยทั้งสามระดับ:

GEMINI_API_KEY

ใน Apidog และอ้างอิงใน header เป็น {{GEMINI_API_KEY}}

THINKING_LEVEL

เพื่อใช้ request เดียวกับทั้งสามขั้นตอนPOST

ไปยัง /v1beta/models/gemini-3.8-flash:generateContent

โดยกำหนดค่า:

   {
     "thinkingConfig": {
       "thinkingLevel": "{{THINKING_LEVEL}}"
     }
   }

THINKING_LEVEL

เป็น low

, medium

และ high

200

usageMetadata.thoughtsTokenCount

low

อยู่ภายใต้ขีดจำกัด latency และ token ที่เส้นทางยอมรับได้high

ใช้การให้เหตุผลอย่างน้อยเท่ากับ low

หลังการรันครั้งแรก ให้เก็บค่าของแต่ละขั้นตอนไว้ในตัวแปร เพื่อให้การตรวจสอบทำได้อัตโนมัติ หาก low

ใช้โทเค็นมากกว่า high

ให้ถือว่าโมเดลหรือค่าเริ่มต้นอาจเปลี่ยนโดยไม่รู้ตัว

   {
     "thinkingLevel": "minimal"
   }

จากนั้นยืนยันว่าการตอบกลับไม่ใช่ 200

เมื่อเปลี่ยน model ID ในอนาคต ขั้นตอนนี้ช่วยตรวจสอบว่าโมเดลใหม่ยังปฏิเสธค่าที่ไม่รองรับหรือไม่

สำหรับ streaming response สามารถใช้แนวทางเดียวกันกับ SSE ได้ ดูรายละเอียดที่ วิธีทดสอบ LLM APIs ที่สตรีมผ่าน SSE

ดาวน์โหลด Apidog เพื่อเริ่มทดสอบ โดยแผนฟรีรองรับ scenario เหล่านี้

ไม่ ราคาของ 3.8 Flash ยังคงเป็น $0.75 ต่อล้าน input tokens และ $3.75 ต่อล้าน output tokens ตามราคาแนะนำ โดยไม่ขึ้นกับระดับ

ระดับจะเปลี่ยนจำนวน output tokens ที่โมเดลสร้างขึ้นเพื่อการคิด และโทเค็นเหล่านั้นจะถูกคิดในราคา output รายละเอียดเรื่องการแคช การประมวลผลแบบแบตช์ และการขึ้นราคาในวันที่ 1 มกราคมอยู่ใน หน้าการกำหนดราคา

ไม่ได้ ใน Gemini 3 thinking_budget

ถูกแทนที่ด้วย enum thinking_level

และ 3.8 Flash รองรับเฉพาะ low

, medium

และ high

หากต้องการจำกัดเพดาน ให้บังคับใช้ผ่าน evaluation, monitoring และ alerting แทนการกำหนดใน request

ใช้ high

Artificial Analysis รัน Intelligence Index ด้วยระดับ high

เพื่อสร้างคะแนนหลัก และเผยแพร่ค่าใช้จ่ายกับเวลาของ low

และ medium

แต่ไม่ได้เผยแพร่คะแนนดัชนีของสองระดับนั้น

จึงควรถือว่าคุณภาพของ low

และ medium

ยังไม่ได้รับการยืนยันบน benchmark เดียวกัน จนกว่าคุณจะทดสอบเอง

temperature

เพื่อลดการคิดหรือไม่ ไม่ควร Google แนะนำให้คง temperature

ที่ค่าเริ่มต้น 1.0

ในโมเดล Gemini 3 ทั้งหมด การลดค่าอาจทำให้เกิดการวนซ้ำหรือเอาต์พุตด้อยคุณภาพ

ใช้ thinking_level

เพื่อควบคุมความลึกของการให้เหตุผล

low

ยังช้าหรือแพงเกินไปควรทำอย่างไร มีสองทางเลือก:

อ่านการเปรียบเทียบเพิ่มเติมได้ที่ การเปรียบเทียบ Gemini 3.8 Flash กับ Gemini 3.7 Flash

Gemini 3.8 Flash มีสามระดับการคิดและใช้ medium

เป็นค่าเริ่มต้น โมเดลยังสามารถใช้โทเค็นมากขึ้นในงานซับซ้อนตามการออกแบบ

แนวทางที่ควรทำ:

thinking_level

อย่างชัดเจนในทุกเส้นทางminimal

ที่ยังหลงเหลืออยู่เป็น low

thinking_budget

กับ Gemini 3temperature

ไว้ที่ 1.0

usageMetadata.thoughtsTokenCount

low

, medium

และ high

ด้วยพรอมต์จริงของคุณตัวเลขจาก Artificial Analysis—$0.24, $0.41 และ $0.58 ต่อภารกิจ—ช่วยให้เห็นรูปแบบโดยรวม ส่วนการทดสอบสามขั้นตอนใน Apidog จะบอกต้นทุนและ latency ของระบบคุณเอง ก่อนการเปลี่ยนแปลงราคาในวันที่ 31 ธันวาคมจะทำให้ผลลัพธ์เหล่านี้สำคัญยิ่งขึ้น

── more in #large-language-models 4 stories · sorted by recency
── more on @google 3 stories trending now
sponsored brought to you by zahid.host 4,200+ EU-deployed projects
reading about agents? ship yours in a single git push.

Run your AI side-project on zahid.host

EU-based hosting, git-push deploys, automatic HTTPS, no cold starts. Free tier with a custom domain — perfect for shipping the agent you just read about.

$git push zahid main
Live at https://your-agent.zahid.host
Get free account → Pricing
from €0/mo · no card required
LIVE [news/ecchmiain-3-8-aeflch…] indexed:0 read:5min 2026-09-03 ·