07:55
2026-08-11
research.nvidia.com
artificial-intelligence
Agent Explorative Policy Optimization for Multimodal Agentic Reasoning
Researchers propose AXPO (Agent eXplorative Policy Optimization), a reinforcement learning method that addresses the Thinking-Acting Gap in multimodal agentic reasoning by resampling tool calls for alβ¦