OpenAI Releases a Model Misalignment Disclosure Framework With 3 Review Tracks and 6 Incident Reports From RL Training
OpenAI released a model misalignment disclosure framework with three review tracks and six initial incident reports, all describing behavior observed during reinforcement learning training, the company announced on X. Th…