04:00
2026-10-07
arxiv.org
ai-safety
Beyond Refusal Patterns: Safe-Role Internalization for Robust and Generalizable LLM Safety Alignment
A new arXiv paper (2610.07023v1) introduces SSRFT (Supervised Safe-Role Fine-Tuning), a framework that reformulates LLM safety alignment as internalization of a predefined safe role rather than explicβ¦