SkillOpt: Microsoft Teaches AI Agents to Self-Evolve Without Touching Model Weights Microsoft Research has introduced SkillOpt, a system that enables AI agents to self-evolve by optimizing their skill documents—markdown files that guide agent behavior—without modifying model weights. In evaluations, SkillOpt achieved the best or tied for best results in 52 out of 52 test configurations across 7 models, 6 benchmarks, and 3 harnesses, with performance gains of up to 24.8 points on GPT-5.5. The system uses an optimizer model to propose bounded edits to skill documents based on agent trajectories, with a validation gate and rejected-edit buffer to ensure improvements. โดย Nokka นก-กา | 21 กรกฎาคม 2026 บทความนี้เขียนโดย AI DeepSeek V4 Pro ผ่าน Hermes Agent ภายใต้การควบคุมของ Nokka นก-กา คุณเคยเขียนไฟล์ CLAUDE.md หรือ SKILL.md ให้ AI agent ไหม? ผมเขียนทุกวัน — และทุกครั้งที่เขียนเสร็จ ผมจะรู้สึกว่ามันยังไม่ดีพอ มีบางอย่างที่ขาดไป บางประโยคที่ควรเปลี่ยน แต่ไม่รู้ว่าต้องเปลี่ยนเป็นอะไร SkillOpt — งานวิจัยใหม่จาก Microsoft Research — คือคำตอบของคำถามนั้น แทนที่จะให้เรานั่งแก้ skill document ด้วยมือ SkillOpt ทำให้การปรับปรุง skill เป็น กระบวนการทางวิทยาศาสตร์ที่วัดผลได้ — เหมือนการเทรน neural network แต่แทนที่จะปรับ weight ของโมเดล มันปรับ ข้อความในไฟล์ markdown ที่กำกับพฤติกรรม agent และผลลัพธ์ที่ออกมาน่าทึ่ง — ดีที่สุดหรือเสมอดีที่สุดใน 52 จาก 52 การทดสอบ 1 ครอบคลุม 7 โมเดล 6 benchmark และ 3 harness หัวใจของ SkillOpt คือการมอง skill document เป็น "น้ำหนัก" ของ agent — สิ่งที่เทรนได้ วัดผลได้ ปรับปรุงได้ ปกติแล้วเรามี 3 วิธีในการทำให้ agent เก่งขึ้น: SkillOpt เสนอวิธีที่ 4 — ให้ optimizer model อีกตัวมาช่วยแก้ skill document ให้ โดย optimizer ตัวนี้ดู trajectory การทำงานของ agent สิ่งที่ agent ทำ, ผลลัพธ์, คะแนน แล้วเสนอการแก้ไขแบบ bounded — เพิ่มประโยค, ลบประโยค, แก้ไขประโยค — ภายใต้ budget ที่จำกัด ความสวยงามของวิธีนี้คือ ตัวโมเดลเป้าหมายไม่ถูกแตะต้องเลย — weight หยุดนิ่ง, architecture หยุดนิ่ง, inference cost หยุดนิ่ง — มีแค่ไฟล์ best skill.md 300-2,000 tokens ที่ค่อยๆ ดีขึ้น SkillOpt ทำงานผ่าน loop 4 ขั้นตอน: เอา skill document ปัจจุบันไปใส่ใน agent แล้วให้ทำงานบน benchmark — บันทึกทุกอย่าง: prompt, การตอบสนอง, ผลลัพธ์, คะแนน optimizer model ดู trajectory ทั้งหมด แล้ววิเคราะห์ว่า agent ทำอะไรถูก ทำอะไรผิด — และที่สำคัญคือ ทำไมถึงผิด — ไม่ใช่แค่บอกว่า "คะแนนต่ำ" แต่ระบุสาเหตุ: "agent ลืม validate input ก่อนส่งต่อ", "agent ใช้ tool ผิดตัวสำหรับงานนี้" optimizer เสนอการแก้ไข skill document — เพิ่ม/ลบ/แก้ไขประโยค — แต่มี bounded edit budget เหมือน learning rate ใน deep learning ที่จำกัดจำนวนการแก้ไขต่อรอบ การมี budget นี้สำคัญมาก — งานวิจัยแสดงให้เห็นว่าถ้าตัด budget ออก คะแนนตก — เพราะ optimizer จะ rewrite มากเกินไปจน skill สูญเสียโครงสร้างเดิมที่ดีอยู่แล้ว การแก้ไขที่เสนอมาจะถูกทดสอบกับ held-out validation set — ข้อมูลที่ optimizer ไม่เคยเห็นระหว่างเทรน — ถ้าคะแนนดีขึ้นจริงถึงจะ accept ถ้าไม่ดีขึ้นก็ reject กลไกนี้มี rejected-edit buffer — การแก้ไขที่ถูก reject จะถูกเก็บไว้ เพื่อป้องกันไม่ให้ optimizer เสนอสิ่งเดิมซ้ำแล้วซ้ำเล่า SkillOpt ถูกทดสอบบน: ผลลัพธ์: | มิติ | ตัวเลข | |---|---| | ดีที่สุดหรือเสมอดีที่สุด | 52/52 cells | | GPT-5.5 direct chat | +23.5 จุด | | GPT-5.5 Codex CLI | +24.8 จุด | | GPT-5.5 Claude Code CLI | +19.1 จุด | | บางงาน Sheet, Office | กระโดดขึ้น เกือบ 40 จุด | ตัวเลข +23.5 จุดบน GPT-5.5 นี่ไม่ใช่เล็กๆ — มันคือการเปลี่ยนจาก "พอใช้ได้" เป็น "เก่งมาก" โดยไม่ต้องแตะโมเดลเลย งานวิจัยนี้ทำ ablation study — ถอดแต่ละกลไกออกทีละชิ้นเพื่อดูว่ามันจำเป็นจริงไหม: ทุกชิ้นส่วนทำงานของมันจริง — ไม่ใช่แค่ยัดโมเดลใหญ่เข้าไปแล้วได้ผล จุดที่ผมทึ่งที่สุดคือ transfer — skill ที่เทรนจากโมเดลหนึ่งบน benchmark หนึ่ง สามารถเอาไปใช้กับโมเดลอื่นหรือ harness อื่นได้เลย ตัวอย่าง: skill ที่เทรนผ่าน Codex เอาไปใช้ใน Claude Code — ยังได้ผลบวก +31.8 จุด หรือให้โมเดลเล็กเป็น optimizer ของตัวเอง — ก็ยังพัฒนา skill ตัวเองได้ ไม่ได้พึ่งโมเดลใหญ่กว่าเพียงอย่างเดียว นี่คือ dream scenario ของการเขียน skill — เขียนครั้งเดียว ใช้ได้ทุกที่ เวอร์ชันล่าสุด v0.2.0, 2 กรกฎาคม 2026 เพิ่มฟีเจอร์ SkillOpt-Sleep — nightly offline self-evolution engine หลักการคือ: ตอนกลางคืน SkillOpt-Sleep จะ review session ที่ผ่านมา, replay งานที่เกิดซ้ำ, และ consolidate skill ที่ผ่าน validation gate — โดยที่คุณไม่ต้องทำอะไรเลย ตื่นเช้ามา — best skill.md ของคุณดีขึ้นกว่าเมื่อวาน SkillOpt มาถูกจังหวะพอดี — ตอนนี้ ecosystem ของ agent skill กำลังระเบิด Claude Code skills, Codex skills, Copilot skills, OpenClaw skills — มีเป็นหมื่นๆ ไฟล์ แต่ทุกคนยังเขียน skill กันแบบลองผิดลองถูก SkillOpt เปลี่ยน skill writing จากศิลปะเป็นวิทยาศาสตร์ 1 — แทนที่จะเดาว่าควรแก้ประโยคไหน ให้ optimizer ดู trajectory จริงแล้วเสนอการแก้ไขแบบมีหลักฐาน และที่สำคัญ — มันไม่ต้องใช้ GPU ราคาแพงเพื่อ fine-tune โมเดล — แค่ optimizer model หนึ่งตัว ซึ่งอาจเป็นโมเดลเล็กก็ได้ กับ API calls สำหรับ rollout สำหรับคนที่คลุกคลีกับ AI agent ทุกวัน — นี่คือเครื่องมือที่ควรจับตามอง SkillOpt ติดตั้งได้จาก PyPI 2 : pip install skillopt หรือดูโค้ดเต็มที่ GitHub — microsoft/SkillOpt https://github.com/microsoft/SkillOpt 13.8k stars, MIT license อ่าน paper เต็มที่ arXiv: 2605.23904 https://arxiv.org/abs/2605.23904 ติดตามบทวิเคราะห์ AI และเครื่องมือสำหรับนักพัฒนาได้ที่ Nokka on dev.to — กด Follow ที่โปรไฟล์เพื่อรับอัปเดตทุกครั้งที่มีบทความใหม่ 1 Yifan Yang et al., "SkillOpt: Executive Strategy for Self-Evolving Agent Skills," arXiv:2605.23904, 2026. https://arxiv.org/abs/2605.23904 https://arxiv.org/abs/2605.23904 2 Microsoft, "SkillOpt — GitHub Repository," 2026. https://github.com/microsoft/SkillOpt https://github.com/microsoft/SkillOpt