07:02
2026-09-14
dev.to
large-language-models
Trying "DFlash," a Diffusion-Model Approach to Parallel Draft-Token Generation, on Gemma
A developer benchmarked DFlash, a diffusion-model-based speculative decoding drafter from Z-Lab, against Gemma-4-12B-it's native Assistant MTP model on an RTX 3060 with 12GB VRAM using llama.cpp. DFlaβ¦