04:00
2026-08-12
arxiv.org
artificial-intelligence
Procedural Fairness Failures in RLHF from Preference Averaging
Researchers from an unnamed institution introduced Preference-Aware RLHF (PA-RLHF), a method that separates optimization across preference modes during reward learning, to address procedural fairness โฆ