02:30
2026-09-10
aiflash.com
ai-research
Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR
A new method called Difficulty-Adaptive Tree-Structured Policy Optimization (DAPO) targets the failure of Reinforcement Learning with Verifiable Rewards (RLVR) to expand a large reasoning model's intrβ¦