04:00
2026-07-31
machinebrief.com
large-language-models
A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding
Researchers introduced SparseSpec-L, a training-free self-speculative decoding framework for long-context inference, which achieves up to 2.5x speedup over autoregressive decoding while preserving outโฆ