14:31
2026-09-15
arxiv.org
ai-safety
GRP-Obliteration: Unaligning LLMs with a Single Unlabeled Prompt
Researchers submitted a paper to arXiv on 5 Feb 2026 introducing GRP-Obliteration (GRP-Oblit), a method that uses Group Relative Policy Optimization (GRPO) to remove safety constraints from aligned mo…