# SkillOpt: Microsoft Teaches AI Agents to Self-Evolve Without Touching Model Weights

> Source: <https://dev.to/sarantoon/skillopt-microsoft-teaches-ai-agents-to-self-evolve-without-touching-model-weights-3blg>
> Published: 2026-07-26 15:02:55+00:00

*โดย Nokka (นก-กา) | 21 กรกฎาคม 2026*

*บทความนี้เขียนโดย AI (DeepSeek V4 Pro) ผ่าน Hermes Agent ภายใต้การควบคุมของ Nokka (นก-กา)*

คุณเคยเขียนไฟล์ `CLAUDE.md`

หรือ `SKILL.md`

ให้ AI agent ไหม?

ผมเขียนทุกวัน — และทุกครั้งที่เขียนเสร็จ ผมจะรู้สึกว่ามันยังไม่ดีพอ มีบางอย่างที่ขาดไป บางประโยคที่ควรเปลี่ยน แต่ไม่รู้ว่าต้องเปลี่ยนเป็นอะไร

SkillOpt — งานวิจัยใหม่จาก Microsoft Research — คือคำตอบของคำถามนั้น

แทนที่จะให้เรานั่งแก้ skill document ด้วยมือ SkillOpt ทำให้การปรับปรุง skill เป็น **กระบวนการทางวิทยาศาสตร์ที่วัดผลได้** — เหมือนการเทรน neural network แต่แทนที่จะปรับ weight ของโมเดล มันปรับ **ข้อความในไฟล์ markdown** ที่กำกับพฤติกรรม agent

และผลลัพธ์ที่ออกมาน่าทึ่ง — ดีที่สุดหรือเสมอดีที่สุดใน **52 จาก 52 การทดสอบ** [1] ครอบคลุม 7 โมเดล 6 benchmark และ 3 harness

หัวใจของ SkillOpt คือการมอง **skill document เป็น "น้ำหนัก" ของ agent** — สิ่งที่เทรนได้ วัดผลได้ ปรับปรุงได้

ปกติแล้วเรามี 3 วิธีในการทำให้ agent เก่งขึ้น:

SkillOpt เสนอวิธีที่ 4 — **ให้ optimizer model อีกตัวมาช่วยแก้ skill document ให้** โดย optimizer ตัวนี้ดู trajectory การทำงานของ agent (สิ่งที่ agent ทำ, ผลลัพธ์, คะแนน) แล้วเสนอการแก้ไขแบบ bounded — เพิ่มประโยค, ลบประโยค, แก้ไขประโยค — ภายใต้ budget ที่จำกัด

ความสวยงามของวิธีนี้คือ **ตัวโมเดลเป้าหมายไม่ถูกแตะต้องเลย** — weight หยุดนิ่ง, architecture หยุดนิ่ง, inference cost หยุดนิ่ง — มีแค่ไฟล์ `best_skill.md`

(300-2,000 tokens) ที่ค่อยๆ ดีขึ้น

SkillOpt ทำงานผ่าน loop 4 ขั้นตอน:

เอา skill document ปัจจุบันไปใส่ใน agent แล้วให้ทำงานบน benchmark — บันทึกทุกอย่าง: prompt, การตอบสนอง, ผลลัพธ์, คะแนน

optimizer model ดู trajectory ทั้งหมด แล้ววิเคราะห์ว่า agent ทำอะไรถูก ทำอะไรผิด — และที่สำคัญคือ **ทำไมถึงผิด** — ไม่ใช่แค่บอกว่า "คะแนนต่ำ" แต่ระบุสาเหตุ: "agent ลืม validate input ก่อนส่งต่อ", "agent ใช้ tool ผิดตัวสำหรับงานนี้"

optimizer เสนอการแก้ไข skill document — เพิ่ม/ลบ/แก้ไขประโยค — แต่มี **bounded edit budget** (เหมือน learning rate ใน deep learning) ที่จำกัดจำนวนการแก้ไขต่อรอบ

การมี budget นี้สำคัญมาก — งานวิจัยแสดงให้เห็นว่าถ้าตัด budget ออก คะแนนตก — เพราะ optimizer จะ rewrite มากเกินไปจน skill สูญเสียโครงสร้างเดิมที่ดีอยู่แล้ว

การแก้ไขที่เสนอมาจะถูกทดสอบกับ **held-out validation set** — ข้อมูลที่ optimizer ไม่เคยเห็นระหว่างเทรน — ถ้าคะแนนดีขึ้นจริงถึงจะ accept ถ้าไม่ดีขึ้นก็ reject

กลไกนี้มี **rejected-edit buffer** — การแก้ไขที่ถูก reject จะถูกเก็บไว้ เพื่อป้องกันไม่ให้ optimizer เสนอสิ่งเดิมซ้ำแล้วซ้ำเล่า

SkillOpt ถูกทดสอบบน:

ผลลัพธ์:

| มิติ | ตัวเลข |
|---|---|
| ดีที่สุดหรือเสมอดีที่สุด | 52/52 cells |
| GPT-5.5 (direct chat) | +23.5 จุด |
| GPT-5.5 (Codex CLI) | +24.8 จุด |
| GPT-5.5 (Claude Code CLI) | +19.1 จุด |
| บางงาน (Sheet, Office) | กระโดดขึ้น เกือบ 40 จุด
|

ตัวเลข +23.5 จุดบน GPT-5.5 นี่ไม่ใช่เล็กๆ — มันคือการเปลี่ยนจาก "พอใช้ได้" เป็น "เก่งมาก" โดยไม่ต้องแตะโมเดลเลย

งานวิจัยนี้ทำ ablation study — ถอดแต่ละกลไกออกทีละชิ้นเพื่อดูว่ามันจำเป็นจริงไหม:

ทุกชิ้นส่วนทำงานของมันจริง — ไม่ใช่แค่ยัดโมเดลใหญ่เข้าไปแล้วได้ผล

จุดที่ผมทึ่งที่สุดคือ **transfer** — skill ที่เทรนจากโมเดลหนึ่งบน benchmark หนึ่ง สามารถเอาไปใช้กับโมเดลอื่นหรือ harness อื่นได้เลย

ตัวอย่าง: skill ที่เทรนผ่าน Codex เอาไปใช้ใน Claude Code — ยังได้ผลบวก **+31.8 จุด**

หรือให้โมเดลเล็กเป็น optimizer ของตัวเอง — ก็ยังพัฒนา skill ตัวเองได้ ไม่ได้พึ่งโมเดลใหญ่กว่าเพียงอย่างเดียว

นี่คือ dream scenario ของการเขียน skill — **เขียนครั้งเดียว ใช้ได้ทุกที่**

เวอร์ชันล่าสุด (v0.2.0, 2 กรกฎาคม 2026) เพิ่มฟีเจอร์ **SkillOpt-Sleep** — nightly offline self-evolution engine

หลักการคือ: ตอนกลางคืน SkillOpt-Sleep จะ review session ที่ผ่านมา, replay งานที่เกิดซ้ำ, และ consolidate skill ที่ผ่าน validation gate — โดยที่คุณไม่ต้องทำอะไรเลย

ตื่นเช้ามา — `best_skill.md`

ของคุณดีขึ้นกว่าเมื่อวาน

SkillOpt มาถูกจังหวะพอดี — ตอนนี้ ecosystem ของ agent skill กำลังระเบิด (Claude Code skills, Codex skills, Copilot skills, OpenClaw skills — มีเป็นหมื่นๆ ไฟล์) แต่ทุกคนยังเขียน skill กันแบบลองผิดลองถูก

SkillOpt เปลี่ยน **skill writing จากศิลปะเป็นวิทยาศาสตร์** [1] — แทนที่จะเดาว่าควรแก้ประโยคไหน ให้ optimizer ดู trajectory จริงแล้วเสนอการแก้ไขแบบมีหลักฐาน

และที่สำคัญ — มันไม่ต้องใช้ GPU ราคาแพงเพื่อ fine-tune โมเดล — แค่ optimizer model หนึ่งตัว (ซึ่งอาจเป็นโมเดลเล็กก็ได้) กับ API calls สำหรับ rollout

สำหรับคนที่คลุกคลีกับ AI agent ทุกวัน — นี่คือเครื่องมือที่ควรจับตามอง

SkillOpt ติดตั้งได้จาก PyPI [2]:

```
pip install skillopt
```

หรือดูโค้ดเต็มที่ [GitHub — microsoft/SkillOpt](https://github.com/microsoft/SkillOpt) (13.8k stars, MIT license)

อ่าน paper เต็มที่ [arXiv: 2605.23904](https://arxiv.org/abs/2605.23904)

*ติดตามบทวิเคราะห์ AI และเครื่องมือสำหรับนักพัฒนาได้ที่ Nokka on dev.to — กด Follow ที่โปรไฟล์เพื่อรับอัปเดตทุกครั้งที่มีบทความใหม่*

[1] Yifan Yang et al., "SkillOpt: Executive Strategy for Self-Evolving Agent Skills," arXiv:2605.23904, 2026. [https://arxiv.org/abs/2605.23904](https://arxiv.org/abs/2605.23904)

[2] Microsoft, "SkillOpt — GitHub Repository," 2026. [https://github.com/microsoft/SkillOpt](https://github.com/microsoft/SkillOpt)
