04:00
2026-07-17
arxiv.org
large-language-models
Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs
Polestar, a training-free inference framework for diffusion large language models (dLLMs), achieves up to 10.73% accuracy improvement, up to 3.7x higher throughput, and 3.67 tokens per forward pass de…