Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning
Researchers have developed Aryabhata 2, a reasoning-focused language model for competitive STEM examinations, trained via reinforcement learning on PhysicsWallah's internal question banks. The model outperforms its base …