20:07
2026-09-08
github.com
large-language-models
Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs
Argonaut Labs AI's Deltafin fork runs the full, never-pruned 2.8-trillion-parameter Kimi K3 model on a MacBook Pro at 0.2901 tokens per second (3.447 seconds per token), streaming from four SSDs, achiβ¦