Lightbits Inferra KV Cache Engine Claims 16x Session Density and 10M-Token Contexts
Lightbits Labs unveiled Inferra, a KV cache orchestration engine it says delivers up to 16x more concurrent inference sessions on existing GPUs, over 100x latency improvement versus recomputing attent…