Extremely Sparse Supervision Incentivizes Reasoning Ability
A new arXiv paper (2609.04565v1) reports that large language models can be effectively trained for reasoning with as few as one or two tokens per trajectory, just 0.05% of all generated tokens, challe…