16:12
2026-09-17
decagon.ai
ai-infrastructure
How we made one of our largest inference workloads 4.7× more GPU-efficient
DecagonAI achieved a 4.7× improvement in fleet-level GPU efficiency on one of its largest scheduled inference workloads by pairing higher-memory GPUs with three serving changes: disaggregating prompt …