04:00
2026-10-09
arxiv.org
artificial-intelligence
SPLIT-RL: Staged Perception-Language Reasoning Training with Claim-Level Advantages
SPLIT-RL, a staged post-training approach that trains visual reasoning and language reasoning in disjoint phases, improves average accuracy over GRPO by 1.4 to 6.1 points across Qwen3-VL models from 2…