SPLIT-RL: Staged Perception-Language Reasoning Training with Claim-Level Advantages
SPLIT-RL, a staged post-training approach that trains visual reasoning and language reasoning in disjoint phases, improves average accuracy over GRPO by 1.4 to 6.1 points across Qwen3-VL models from 2…