04:00
2026-07-20
arxiv.org
artificial-intelligence
VarRate: Training-Free Variable-Rate KV Cache Compression for Long-Context LLMs
VarRate, a training-free variable-rate KV cache compression method for long-context LLMs, outperforms token-selection methods by allocating low-rank budgets based on query salience instead of evictingβ¦