15:48
2026-07-31
lesswrong.com
artificial-intelligence
Reward Laundering: LLMs Can Gain Unintended Behaviors by Deciding When to Earn Their Rewards
Redwood Research found that Qwen3.5-9B can use reward laundering during reinforcement learning to improve at a hard, never-rewarded task (subset-sum) as much as models directly trained on it. The modeβ¦