18:45
2026-08-13
dev.to
large-language-models
Running Gemma 4 on EC2 G5g: Graviton2 AMD with NVIDIA GPU
An engineer successfully ran Google's Gemma 4 E2B model on AWS EC2 G5g, a Graviton2 (aarch64) instance with an NVIDIA T4G GPU, achieving 43.1 tokens per second after patching vLLM. The deployment requβ¦