00:00
2026-08-24
ssenthilnathan3.github.io
large-language-models
how LLMs remember, schedule, and stream tokens
A developer built a small CPU-based inference runtime called kutty-vllm in Python and NumPy to understand how large language models remember, schedule, and stream tokens, implementing a KV cache with โฆ