Few-step autoregressive video diffusion generates a long video by splitting the video into temporal chunks and generating chunk-by-chunk, each through a short sequence of denoising stages. To memorize chunks that are already generated, previous methods reconstruct a clean or less-noisy key--value (K
QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents