Mercury 2.5 Diffusion LLM: 1,107 t/s in Production Now
Inception Labs released Mercury 2.5, a diffusion-based large language model, on September 8, achieving 1,107 tokens per second on commodity NVIDIA GPUs at $0.04 per million input tokens. Unlike autore…