04:00
2026-07-30
arxiv.org
artificial-intelligence
Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback
Researchers introduce MeRLa (Meta-Learned Reward Shaping), a framework that meta-learns a task-aware shaping function for Reinforcement Learning from Human Feedback (RLHF) to improve alignment of largβ¦