00:00
2026-10-07
aclanthology.org
large-language-models
BP-LLM: Belief Propagation for Binary Feedback in Large Language Model Alignment
Jessica E. Liang published BP-LLM, a probabilistic framework that models binary preference feedback as noisy observations of latent reward margins under a policy-induced Gaussian prior, in Transaction…