PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs
Researchers propose PlanPO, a group planning-aware policy optimization method that improves multi-turn agentic large language models by distinguishing advantages among successful trajectories based on…