10:49
2026-08-27
mimo.xiaomi.com
artificial-intelligence
Multi-Teacher On-Policy Distillation for Capability Integration in Post-Training
Researchers propose Multi-teacher On-Policy Distillation (MOPD), a post-training paradigm that combines the capabilities of multiple domain-specific reinforcement learning teachers into a single largeβ¦