04:00
2026-07-29
arxiv.org
artificial-intelligence
CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention
Researchers propose CoSA, a training-free sparse attention method that couples a Kernel-Aware Proxy with an Ordered-Skipping Kernel to accelerate long-context inference. CoSA achieves a 4.93Γ attentioβ¦