04:00
2026-10-07
arxiv.org
artificial-intelligence
When Does External Guidance Help LLM Reasoning? A Bias-Variance Theory of Guidance-Augmented GRPO
A new arXiv paper (2610.06861v1) introduces Guidance-Augmented GRPO (GA-GRPO), a theoretical framework that treats external guidance in reinforcement learning with verifiable rewards as a stochastic gā¦