05:30
2026-09-16
aiflash.com
ai-safety
Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration
Researchers propose Decoy Direction Optimization, a post-hoc defense that counters Refusal Feature Ablation (RFA), an attack that projects out a linear refusal direction from a language model's residuβ¦