04:00
2026-07-07
arxiv.org
large-language-models
Safe Inference-Time Alignment via Lagrangian Reward Augmentation
Researchers propose Lagrangian Reward Augmentation (LARA), a framework for inference-time alignment of language models that enforces safety constraints by dualizing a constrained optimization problem …