Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective
A new arXiv preprint (2609.04489v1) finds that pause-token methods improve large language model reasoning by reshaping fine-tuning dynamics, with masked boundary pauses overwriting previously learned …