04:00
2026-10-09
arxiv.org
ai-safety
How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense
A new arXiv paper (2610.11005v1) reports that narrative or role-play wrappers let harmful requests bypass safety refusals in Qwen3-1.7B at 89.4% attack success in English, 93.0% in modern Chinese, andβ¦