22:06
2026-06-18
alignment.openai.com
ai-safety
Reinforcement learning towards broadly and persistently beneficial models
OpenAI researchers found that reinforcement learning on realistic scenarios targeting beneficial traits like honesty and corrigibility produced broad improvements across dozens of alignment benchmarksβ¦