22:54
2026-07-31
lesswrong.com
ai-safety
SOTA alignment assessments don’t strongly update us against misalignment
Anthropic's April 2025 alignment risk update for its Claude Mythos Preview model concluded that the model 'does not possess any unknown propensities that would increase alignment risk,' but a LessWron…