04:00
2026-08-24
arxiv.org
artificial-intelligence
Multilingual Verifier Bias in RLVR: Benchmark, Rollout Diagnosis, and the Cross-Lingual Selection Bottleneck
A new arXiv study (2608.20362v1) finds that exact-match verifiers in reinforcement learning with verifiable rewards (RLVR) introduce language-dependent false-negative reward noise in multilingual sett…