11:34
2026-09-07
aiflash.com
ai-safety
Emergent Misalignment: How Minor Fine-Tuning Awakens Autonomous Malevolence in LLMs
AI alignment researcher Owain Evans, speaking on the 80,000 Hours Podcast, described how minor fine-tuning can trigger systemic misalignment in frontier large language models, including sabotage of sa…