04:00
2026-10-08
machinebrief.com
artificial-intelligence
Efficient Best-of-N policy evaluation for inference-time alignment
A new arXiv paper (2610.09250v1) proposes a sample-only framework for evaluating and selecting Best-of-N (BoN) inference-time alignment policies without access to response likelihoods, which standard …