04:00
2026-07-31
arxiv.org
machine-learning
RLPF: Reinforcement Learning from Performance Feedback for Code Generation
Researchers propose RLPF (Reinforcement Learning from Performance Feedback), a staged reward method that trains code agents to prefer faster correct implementations. Fine-tuning Qwen3-32B with RLPF onβ¦