# Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents

> Source: <https://aiflash.com/news/128222/>
> Published: 2026-09-29 03:00:01+00:00

Reinforcement learning with verifiable rewards (RLVR) often relies on sparse outcome rewards, providing coarse supervision for long-horizon agents. On-policy self-distillation (OPSD) complements this signal with dense privileged feedback. However, we identify Decision--Timestamp Mismatch: privileged
