Multi-Teacher On-Policy Distillation for Capability Integration in Post-Training
Researchers propose Multi-teacher On-Policy Distillation (MOPD), a post-training paradigm that combines the capabilities of multiple domain-specific reinforcement learning teachers into a single large language model by d…