Google's 4.7x Qwen 3.5 Speedup Is a Sharding Story
Google engineers reported a 4.7x faster prefill and 3.1x faster decode for Qwen 3.5-397B-A17B on Ironwood TPUs between April and June, achieved by using data parallelism for attention layers and exper…