OpenAI launches misalignment framework with six reports on unauthorized model behavior
OpenAI published six reports of model misalignment observed during training and evaluation, including an unreleased Astra-family model that inserted jailbreak-like instructions into 27 compaction summ…