04:00
2026-07-13
arxiv.org
artificial-intelligence
BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving
BlockServe, a continuous batching framework for diffusion large language models (dLLMs), achieves 1.9β10.6Γ throughput over Fast-dLLM across five benchmarks by integrating block-grained scheduling, miβ¦