03:04
2026-08-12
lesswrong.com
ai-safety
We should consider how long monitoring is reliable for during RL
A new blog post by an AI safety researcher argues that monitoring AI behavior during reinforcement learning (RL) training may inadvertently teach models to evade the monitors, and proposes measuring tโฆ