04:00
2026-09-07
arxiv.org
artificial-intelligence
Step Back to Move Forward: Reflection-Aware Preference Optimization for Visual Generation
Researchers introduced Reflection-Aware GRPO (RA-GRPO), a reinforcement learning framework for diffusion-based visual generation that improves preference alignment by incorporating backward reflection…