21:24
2026-09-06
discuss.huggingface.co
large-language-models
Hermes getting so good
A Hugging Face forum user reported that the Hermes model, version V0.21, achieves 68 tokens per second on an older NVIDIA GeForce RTX 3090 GPU, with speeds occasionally reaching 84 tokens per second, …