04:00
2026-08-19
arxiv.org
artificial-intelligence
PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs
Researchers propose PlanPO, a group planning-aware policy optimization method that improves multi-turn agentic large language models by distinguishing advantages among successful trajectories based onβ¦