01:51
2026-07-25
lesswrong.com
ai-safety
Can Recursive Self-Report Probing Detect Emergent Misalignment?
A new method called The Confession Booth, developed by a researcher as part of the BlueDot AI Safety Course, uses recursive self-report probing to detect emergent misalignment in large language modelsβ¦