# FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

> Source: <https://aiflash.com/news/115394/>
> Published: 2026-09-08 06:30:02+00:00

A reasoning model can improve from its own on-policy experience, but this inner loop is fragile: terminal verifiers provide reliable yet sparse supervision, while dense same-model guidance can reinforce false confidence or overconcentrate learning on a narrow solution mode. We introduce FlowBalance,
