เจมิไน 3.8 แฟลช: เปรียบเทียบระดับการคิด ต่ำ ปานกลาง สูง พร้อมเหตุผลที่ระดับ Minimal หายไป Google's Gemini 3.8 Flash model introduces three thinking levels—low, medium, and high—replacing the previous minimal level, which is no longer supported and causes API requests to fail with a 400 error. The thinking level controls the amount of internal reasoning before a response, impacting latency, output tokens, and cost. Developers are advised to explicitly set the thinking level in every request to avoid unintended cost changes, as medium is the default but may not suit all use cases. thinking level ของ Gemini 3.8 Flash ให้เหมาะกับแต่ละเส้นทาง Gemini 3.8 Flash มีระดับการคิดสามระดับ ได้แก่ low , medium และ high การตั้งค่านี้ควบคุมปริมาณการให้เหตุผลภายในก่อนโมเดลตอบกลับ และส่งผลโดยตรงต่อความหน่วง โทเค็นเอาต์พุต และค่าใช้จ่าย Google ออกแบบ 3.8 Flash ให้ “ทำงานหนักขึ้น” กับงานซับซ้อน ดังนั้นการเลือกระดับจึงสำคัญกว่าเดิมเมื่อเทียบกับ 3.7 Flash หากต้องการดูภาพรวมการเปิดตัว โปรดอ่าน ภาพรวม Gemini 3.8 Flash https://apidog.com/th/blog/what-is-gemini-3-8-flash?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation ส่วนบทความนี้จะเน้นเฉพาะการตั้งค่าระดับการคิด มีสองประเด็นที่มักทำให้ทีมสับสน: medium ไม่ใช่ high โดย Gemini 3 Pro ใช้ high เป็นค่าเริ่มต้น minimal ซึ่งเคยใช้กับ Gemini 3.7 Flash ไม่รองรับใน 3.8 Flash อีกต่อไป คำขอจะล้มเหลวตั้งแต่การตรวจสอบความถูกต้อง ก่อนสร้างโทเค็นใดๆ ดูรายละเอียดได้ที่ บทความนี้ครอบคลุมสิ่งที่แต่ละระดับทำ ค่าใช้จ่าย วิธีตั้งค่าใน API ทั้งสองแบบ กลยุทธ์การเลือกใช้ และการทดสอบที่ทำซ้ำได้ใน Apidog | ระดับ | คำแนะนำของ Google | ค่าใช้จ่ายต่อภารกิจ AA | เวลาต่อภารกิจ AA | เหมาะกับ | |---|---|---|---|---| low | ลดความหน่วงและค่าใช้จ่าย เหมาะกับคำสั่งง่าย แชท และงานปริมาณสูง | $0.24 | 0.8 นาที | งานที่ผู้ใช้รอผลโดยตรง การค้นหาจากข้อความถอดเสียง การจัดหมวดหมู่ | medium ค่าเริ่มต้น | สมดุลสำหรับโค้ดซับซ้อนและงานแบบเอเจนต์ | $0.41 | ไม่ระบุ | เส้นทางส่วนใหญ่ การถามตอบวิดีโอทั่วไป | high | ให้เหตุผลลึกที่สุดสำหรับปัญหาหลายขั้นตอน | $0.58 | 2.5 นาที | การถามตอบภาพหนาแน่น วิดีโอยาวกว่า 60 นาที และขั้นตอนวางแผนสำคัญ | minimal | ไม่รองรับใน 3.8 Flash | n/a | n/a | ห้ามใช้ ให้แมปเป็น low | ค่าใช้จ่ายและเวลาเป็นค่าเฉลี่ยจากการทดสอบ Intelligence Index ของ Artificial Analysis https://artificialanalysis.ai/articles/gemini-3-8-flash โดยใช้ราคาโทเค็นเบื้องต้นของ Google ตัวเลขนี้ไม่ใช่ข้อมูลจาก Google และไม่ได้อ้างอิงพรอมต์ของคุณโดยตรง ให้ใช้เพื่อดูอัตราส่วน แล้ววัดเส้นทางจริงของคุณเอง คำตอบของ 3.8 Flash อาจมี thinking tokens ซึ่งเป็นการให้เหตุผลที่โมเดลสร้างขึ้นก่อนคำตอบที่ผู้ใช้มองเห็น โทเค็นเหล่านี้ถูกคิดเป็น output tokens: API รายงานจำนวนดังกล่าวแยกต่างหากใน usageMetadata.thoughtsTokenCount ระดับการคิดทำหน้าที่เป็นคำแนะนำว่าโมเดลควรใช้การให้เหตุผลมากน้อยเพียงใด: low medium high พฤติกรรมที่ทำให้ 3.8 Flash แตกต่างคือ ในงานซับซ้อน โมเดลอาจ: หากจำนวนโทเค็นเพิ่มขึ้นมาก คำแนะนำแรกของ Google คือ ลด thinking level และคำแนะนำถัดมาคือใช้ 3.7 Flash ต่อไป ซึ่งยังได้รับการสนับสนุนอย่างเต็มที่ thinking level เป็น enum ไม่ใช่งบประมาณโทเค็น thinking budget แบบจำนวนเต็มจากโมเดลรุ่นก่อนถูกนำออกใน Gemini 3 ดังนั้นคุณไม่สามารถกำหนดว่า “ใช้ thinking tokens สูงสุด 2,000 โทเค็น” ได้ ต้องเลือกระดับแล้ววัดผลจริง medium ไม่ใช่ high หากไม่ส่งฟิลด์นี้ 3.8 Flash จะใช้ medium ซึ่งอาจสร้างปัญหาได้สองกรณี: high thinking budget ระหว่างย้ายจาก 3.7 Flash อาจใช้ medium โดยไม่ตั้งใจ แม้แต่ในเส้นทางแชทที่ควรใช้ low วิธีแก้คือกำหนด thinking level อย่างชัดเจนในทุกคำขอและทุกเส้นทาง ควรเก็บค่าไว้ในไฟล์กำหนดค่าหรือ routing config แทนการกระจายไว้ในโค้ด เพื่อให้โปรไฟล์ค่าใช้จ่ายไม่เปลี่ยนโดยไม่ตั้งใจเมื่อค่าเริ่มต้นของ Google เปลี่ยน minimal ไม่รองรับแล้ว: วิธีแก้ข้อผิดพลาด Gemini 3.8 Flash รองรับเฉพาะ low , medium และ high ตาม หน้าโมเดล https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash หากส่ง minimal ผ่าน REST API คำขอจะถูกปฏิเสธด้วยสถานะ 400 INVALID ARGUMENT : Thinking level MINIMAL is not supported for this model. Please retry with other thinking level. ข้อผิดพลาดนี้ตรวจสอบแล้วด้วยการเรียกใช้งานจริงเมื่อวันที่ 3 กันยายน 2026 SDK อาจห่อหุ้มข้อผิดพลาดไว้ใน exception ของตัวเอง ดังนั้นควรตรวจสอบสถานะ 400 หรือรหัส INVALID ARGUMENT ไม่ควรผูกกับข้อความอย่างเดียว { "model": "gemini-3.8-flash", "input": "Classify this ticket as billing, bug, or feature.", "generation config": { "thinking level": "minimal" } } { "model": "gemini-3.8-flash", "input": "Classify this ticket as billing, bug, or feature.", "generation config": { "thinking level": "low" } } Google แนะนำให้แมปโดยตรง: minimal → low อย่าพยายามใช้ thinking budget เพื่อสร้างระดับที่ต่ำกว่า และอย่าลด temperature เพื่อให้โมเดล “ใจเย็นลง” Google แนะนำให้คงค่าเริ่มต้น 1.0 ในโมเดล Gemini 3 ทั้งหมด เพราะการลดค่าอาจทำให้เกิดการวนซ้ำหรือเอาต์พุตด้อยคุณภาพ รายละเอียดเรื่อง thought signatures และข้อกำหนด call id ใน function response อยู่ใน คู่มือการย้ายข้อมูล 3.7 ไป 3.8 Flash https://apidog.com/th/blog/gemini-3-7-to-3-8-flash-migration-guide?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation เนื่องจากข้อผิดพลาดเกิดขึ้นตั้งแต่ขั้นตอน validation คุณสามารถเพิ่มคำขอทดสอบที่ใช้ minimal เพื่อจับการตั้งค่าที่ถอยกลับไปใช้ค่าที่ไม่รองรับได้โดยไม่ต้องรอให้เกิดการสร้างโทเค็น ราคาต่อโทเค็นไม่ได้เปลี่ยนตามระดับ ตาม หน้าการกำหนดราคา https://ai.google.dev/gemini-api/docs/pricing : สิ่งที่แตกต่างระหว่างระดับคือจำนวน output tokens ที่โมเดลสร้างขึ้น | โมเดลและระดับ | ค่าใช้จ่ายต่อภารกิจ | เวลาต่อภารกิจ | |---|---|---| Gemini 3.8 Flash low | $0.24 | 0.8 นาที | Gemini 3.8 Flash medium | $0.41 | ไม่ระบุ | Gemini 3.8 Flash high | $0.58 | 2.5 นาที | Gemini 3.7 Flash high | $0.40 | 2.2 นาที | ที่มา: Artificial Analysis, การทดสอบ Intelligence Index โดยใช้ราคาแนะนำ ข้อสังเกตสำคัญจากตาราง: low มีค่าใช้จ่ายประมาณ 41% ของ high และใช้เวลาประมาณหนึ่งในสาม จึงเป็นตัวเลือกสำคัญสำหรับงานที่ไวต่อความหน่วง medium บน 3.8 Flash มีค่าใช้จ่ายใกล้เคียงกับ high บน 3.7 Flash $0.41 เทียบกับ $0.40 high บน 3.8 Flash แพงกว่า high บน 3.7 Flash ประมาณ 45% แม้ราคาต่อโทเค็นเท่ากัน เนื่องจากสร้าง output tokens มากขึ้นประมาณ 30% หรือเฉลี่ยราว 48k โทเค็นต่อภารกิจในดัชนีอย่าสรุปว่าคุณภาพจะเพิ่มหรือลดเป็นเส้นตรงตามค่าใช้จ่าย คะแนน Intelligence Index ของ Artificial Analysis ที่ 59 สำหรับ 3.8 Flash มาจากการรันด้วย high พวกเขาไม่ได้เผยแพร่คะแนนของ medium หรือ low ดังนั้นควรประเมินงานของคุณเองก่อนลดระดับ สำหรับตัวอย่างการคำนวณค่าใช้จ่าย 1,000 ภารกิจต่อวัน และการเปลี่ยนราคาในวันที่ 31 ธันวาคม โปรดดู การกำหนดราคา Gemini 3.8 Flash https://apidog.com/th/blog/gemini-3-8-flash-pricing?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation thinking level ใน Interactions API Interactions API เป็นอินเทอร์เฟซหลักของ Google สำหรับ Gemini 3.x ระดับจะอยู่ใน generation config และใช้รูปแบบ snake case curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \ -H "x-goog- REDACTED CREDENTIAL -H 'Content-Type: application/json' \ -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation config":{"thinking level":"low"}}' interaction = client.interactions.create model="gemini-3.8-flash", input="Explain HTTP caching in 3 sentences.", generation config={"thinking level": "low"}, print interaction.output text thinking level เป็นฟิลด์ระดับคำขอ จึงต้องส่งทุกครั้ง รวมถึงการโต้ตอบต่อเนื่องที่ใช้ previous interaction id การตอบกลับจะเป็นรายการขั้นตอน เช่น thoughts และ tool calls ก่อนจบด้วย model output โดย SDK จะแสดงข้อความสุดท้ายผ่าน output text ดูตัวอย่างการใช้งานแบบเต็ม รวมถึง multi-turn และ streaming ได้ที่ วิธีใช้ Gemini 3.8 Flash API https://apidog.com/th/blog/how-to-use-gemini-3-8-flash-api?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation generateContent แบบดั้งเดิม โค้ด Gemini ส่วนใหญ่ยังใช้ generateContent ซึ่ง Google เรียกว่า legacy API แต่ยังได้รับการสนับสนุนอย่างเต็มที่และยังไม่มีวันยุติการใช้งาน ใน API นี้ ฟิลด์จะอยู่ลึกลงไปอีกหนึ่งระดับและใช้รูปแบบ camelCase curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \ -H "x-goog- REDACTED CREDENTIAL " -H 'Content-Type: application/json' -X POST \ -d '{"contents": {"parts": {"text":"Explain HTTP caching in 3 sentences."} } , "generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}' python from google.genai import types response = client.models.generate content model="gemini-3.8-flash", contents="Explain HTTP caching in 3 sentences.", config=types.GenerateContentConfig thinking config=types.ThinkingConfig thinking level="low" , print response.usage metadata.thoughts token count includeThoughts: true จะเพิ่ม thought summaries เข้าไปใน response ซึ่งมีประโยชน์ตอนปรับระดับ แต่ไม่จำเป็นเมื่อใช้งานจริง ฟิลด์ที่ควรเฝ้าดูคือ: usageMetadata.thoughtsTokenCount นี่คือจำนวน thinking tokens ที่ถูกเรียกเก็บเป็น output tokens และควรเป็นหนึ่งในตัวชี้วัดหลักของการทดสอบ ให้มอง thinking level เป็น การตัดสินใจระดับเส้นทาง ไม่ใช่การตั้งค่ากลางทั้งระบบ low เมื่อผู้ใช้กำลังรอผลและ first-token latency สำคัญ low แล้วทำ evaluation เพื่อยืนยันความแม่นยำ ตัวอย่างวิดีโอของ Google ก็ใช้ low สำหรับการค้นหาจากข้อความถอดเสียง medium เป็นค่าเริ่มต้น ยกระดับเฉพาะขั้นตอนวางแผนที่กำหนดทุกขั้นตอนถัดไปเป็น high แล้วลดกลับลงมา การใช้ high ตลอด tool loop อาจเพิ่มค่าใช้จ่ายอย่างรวดเร็ว high ร่วมกับ Batch API ซึ่งลดค่าใช้จ่ายได้ 50% เมื่อไม่ใช่งานแบบโต้ตอบ high : การถามตอบภาพที่มีข้อมูลหนาแน่น หรือวิดีโอยาวกว่า 60 นาที medium : การถามตอบวิดีโอทั่วไป low : การค้นหาจากข้อความถอดเสียงหากแม้แต่ low ของ 3.8 Flash ยังช้าหรือแพงเกินไป ให้พิจารณาตระกูล Flash-Lite คู่มือ Gemini 3.1 Flash-Lite https://apidog.com/th/blog/gemini-3-1-flash-lite?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation ครอบคล้าดูจำนวนโทเค็นหลังอัปเกรด ข้อมูลจาก Artificial Analysis ช่วยบอกอัตราส่วน แต่มีเพียงพรอมต์จริงของคุณเท่านั้นที่จะบอกค่า latency, token usage และค่าใช้จ่ายที่ใช้งานได้จริง สร้างสถานการณ์ทดสอบใน Apidog โดยส่ง golden prompt เดียวกันด้วยทั้งสามระดับ: GEMINI API KEY ใน Apidog และอ้างอิงใน header เป็น {{GEMINI API KEY}} THINKING LEVEL เพื่อใช้ request เดียวกับทั้งสามขั้นตอน POST ไปยัง /v1beta/models/gemini-3.8-flash:generateContent โดยกำหนดค่า: { "thinkingConfig": { "thinkingLevel": "{{THINKING LEVEL}}" } } THINKING LEVEL เป็น low , medium และ high 200 usageMetadata.thoughtsTokenCount low อยู่ภายใต้ขีดจำกัด latency และ token ที่เส้นทางยอมรับได้ high ใช้การให้เหตุผลอย่างน้อยเท่ากับ low หลังการรันครั้งแรก ให้เก็บค่าของแต่ละขั้นตอนไว้ในตัวแปร เพื่อให้การตรวจสอบทำได้อัตโนมัติ หาก low ใช้โทเค็นมากกว่า high ให้ถือว่าโมเดลหรือค่าเริ่มต้นอาจเปลี่ยนโดยไม่รู้ตัว { "thinkingLevel": "minimal" } จากนั้นยืนยันว่าการตอบกลับไม่ใช่ 200 เมื่อเปลี่ยน model ID ในอนาคต ขั้นตอนนี้ช่วยตรวจสอบว่าโมเดลใหม่ยังปฏิเสธค่าที่ไม่รองรับหรือไม่ สำหรับ streaming response สามารถใช้แนวทางเดียวกันกับ SSE ได้ ดูรายละเอียดที่ วิธีทดสอบ LLM APIs ที่สตรีมผ่าน SSE https://apidog.com/th/blog/test-llm-ai-apis-sse?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation ดาวน์โหลด Apidog https://apidog.com/download?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation เพื่อเริ่มทดสอบ โดยแผนฟรีรองรับ scenario เหล่านี้ ไม่ ราคาของ 3.8 Flash ยังคงเป็น $0.75 ต่อล้าน input tokens และ $3.75 ต่อล้าน output tokens ตามราคาแนะนำ โดยไม่ขึ้นกับระดับ ระดับจะเปลี่ยนจำนวน output tokens ที่โมเดลสร้างขึ้นเพื่อการคิด และโทเค็นเหล่านั้นจะถูกคิดในราคา output รายละเอียดเรื่องการแคช การประมวลผลแบบแบตช์ และการขึ้นราคาในวันที่ 1 มกราคมอยู่ใน หน้าการกำหนดราคา https://ai.google.dev/gemini-api/docs/pricing ไม่ได้ ใน Gemini 3 thinking budget ถูกแทนที่ด้วย enum thinking level และ 3.8 Flash รองรับเฉพาะ low , medium และ high หากต้องการจำกัดเพดาน ให้บังคับใช้ผ่าน evaluation, monitoring และ alerting แทนการกำหนดใน request ใช้ high Artificial Analysis รัน Intelligence Index ด้วยระดับ high เพื่อสร้างคะแนนหลัก และเผยแพร่ค่าใช้จ่ายกับเวลาของ low และ medium แต่ไม่ได้เผยแพร่คะแนนดัชนีของสองระดับนั้น จึงควรถือว่าคุณภาพของ low และ medium ยังไม่ได้รับการยืนยันบน benchmark เดียวกัน จนกว่าคุณจะทดสอบเอง temperature เพื่อลดการคิดหรือไม่ ไม่ควร Google แนะนำให้คง temperature ที่ค่าเริ่มต้น 1.0 ในโมเดล Gemini 3 ทั้งหมด การลดค่าอาจทำให้เกิดการวนซ้ำหรือเอาต์พุตด้อยคุณภาพ ใช้ thinking level เพื่อควบคุมความลึกของการให้เหตุผล low ยังช้าหรือแพงเกินไปควรทำอย่างไร มีสองทางเลือก: อ่านการเปรียบเทียบเพิ่มเติมได้ที่ การเปรียบเทียบ Gemini 3.8 Flash กับ Gemini 3.7 Flash https://apidog.com/th/blog/gemini-3-8-flash-vs-gemini-3-7-flash?utm source=dev.to&utm medium=wanda&utm content=n8n-post-automation Gemini 3.8 Flash มีสามระดับการคิดและใช้ medium เป็นค่าเริ่มต้น โมเดลยังสามารถใช้โทเค็นมากขึ้นในงานซับซ้อนตามการออกแบบ แนวทางที่ควรทำ: thinking level อย่างชัดเจนในทุกเส้นทาง minimal ที่ยังหลงเหลืออยู่เป็น low thinking budget กับ Gemini 3 temperature ไว้ที่ 1.0 usageMetadata.thoughtsTokenCount low , medium และ high ด้วยพรอมต์จริงของคุณตัวเลขจาก Artificial Analysis—$0.24, $0.41 และ $0.58 ต่อภารกิจ—ช่วยให้เห็นรูปแบบโดยรวม ส่วนการทดสอบสามขั้นตอนใน Apidog จะบอกต้นทุนและ latency ของระบบคุณเอง ก่อนการเปลี่ยนแปลงราคาในวันที่ 31 ธันวาคมจะทำให้ผลลัพธ์เหล่านี้สำคัญยิ่งขึ้น