04:00
2026-07-21
arxiv.org
artificial-intelligence
CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents
Researchers at arXiv propose Contextual Information-Gain Policy Optimization (CIGPO) to fix a zero-advantage lock-in failure in outcome-only reinforcement learning for multi-turn evidence-reading agenβ¦