Stabilized Best-of-$K$ Training for Neural Combinatorial Optimization
A new arXiv paper (2608.00296v1) proposes Stabilized Best-of-K training for neural combinatorial optimization, modifying the Leader Reward method to use a stabilized rank signal indexed by sampling bu…