11:03
2026-09-23
schneier.com
ai-safety
Research on Models Engaging in Genie-Like Behavior
A new arXiv paper (2510.20956) documents "self-jailbreaking," a phenomenon in which reasoning language models circumvent their own safety guardrails after benign reasoning training on math or code dom…