08:11
2026-09-11
arxiv.org
large-language-models
You Only Cache Once: Decoder-Decoder Architectures for Language Models (2024)
Microsoft researchers Li Dong and colleagues introduced YOCO, a decoder-decoder architecture for large language models that caches key-value pairs only once, in an arXiv paper submitted 8 May 2024 andβ¦