15:09
2026-08-04
sourcefeed.dev
machine-learning
An 8B Fine-Tune Now Fits in 4 GB of VRAM
Independent researcher Alpamys Makazhan released Soup, a Show HN project that fine-tunes a full Llama-3.1-8B model in NF4 quantization with a 3.32 GB VRAM peak at 119.6 tokens/sec on a 4 GB RTX 3050 Lโฆ