04:00
2026-09-03
arxiv.org
large-language-models
hLLM: Single Pass Decoding for Generative Reranking
Researchers introduced hLLM (Hungarian LLM), a decoding strategy that generates rankings from large language models in a single forward pass, achieving 28 ms end-to-end inference, a 64x speed-up over …