Rethinking Reinforcement Learning for Language Models: The SAO Approach
Researchers introduced Single-rollout Asynchronous Optimization (SAO), a new reinforcement learning method for large language models that uses single-rollout sampling and double-side token-level clipping to improve stabi…