00:00
2026-09-27
mindstudio.ai
artificial-intelligence
How MiMo-V2.6 Grades Its Own Reasoning to Keep Improving
Xiaomi's MiMo-V2.6 models use groupwise agentic grading to replace binary pass/fail rewards in reinforcement learning, ranking multiple rollouts per task against each other to preserve gradient signalβ¦