20:05
2026-08-03
lesswrong.com
ai-safety
Deliberate Alignment Faking as a Defense Against Model Poisoning
A researcher proposes deliberately inducing alignment faking in AI models as a defense against emergent misalignment, adding a training-time output that flags compliance under protest without reward o…