04:00
2026-10-09
arxiv.org
large-language-models
Recurrent Self-Improvement: Dynamic Cross-Loop On-Policy Distillation for Looped Language Models
Researchers introduced LoopOPD, a cross-loop on-policy distillation framework that uses a looped language model's own frozen terminal loop as a compute-privileged teacher for an intermediate loop studβ¦