{"slug": "the-programming-language-speed-balls-but-for-inference-tokens-per-second", "title": "The programming language speed balls, but for inference (tokens per second)", "summary": "Cerebras' gpt-oss-120B (low) leads a new inference speed benchmark at 1,538.0 tokens per second, outpacing Groq's gpt-oss-20B (high) at 949.5 t/s and Cerebras' GPT-5.6 Sol (ultrafast preview) at up to 750 t/s, according to a live leaderboard tracking tokens per second for major AI models. The ranking includes 18 models from providers such as Google AI Studio, OpenAI, Anthropic, and Alibaba Cloud, with speeds ranging from 1,538.0 t/s down to 47.0 t/s for Qwen3.8 Max.", "body_md": "See the balls\nSee the actual tokens\nⅡ\nPause\n↻\nReset\n1,000 output tokens\nOne trip to the other side = 1,000 output tokens · A round trip = 2,000\ngpt-oss-120B (low)\nCerebras · 1,538.0 t/s\n120B\nparams\n↗\ngpt-oss-20B (high)\nGroq · 949.5 t/s\n20B\nparams\n↗\nGPT-5.6 Sol (ultrafast preview)\nCerebras · up to 750 t/s\nUndisclosed\nparams\n↗\nNemotron 3.5 Lightning\nDeepInfra (NVFP4) · 516.2 t/s\n31.6B / 3.6B\nparams\n↗\nGemini 3.7 Flash (high)\nGoogle AI Studio · 340.1 t/s\nUndisclosed\nparams\n↗\nDeepSeek V4 Flash (Non-reasoning)\nMakora · 274.1 t/s\n284B / 13B\nparams\n↗\nMiniMax-M3\nModular · 231.5 t/s\n428B / 23B\nparams\n↗\nMuse Spark 1.2 (xhigh)\nMeta · ~217.2 t/s\nUndisclosed\nparams\n↗\nGLM-5.2 (max)\nBaseten (FAST) · 195.5 t/s\n744B\nparams\n↗\nGemini 3.5 Flash (high)\nGoogle AI Studio · 172.9 t/s\nUndisclosed\nparams\n↗\nGPT-5.6 Luna (max)\nOpenAI · 150.2 t/s\nUndisclosed\nparams\n↗\nClaude Sonnet 5 (Adaptive Reasoning, Max Effort)\nGoogle · 81.8 t/s\nUndisclosed\nparams\n↗\nGrok 4.6 (high)\nSpaceXAI · 65.5 t/s\nUndisclosed\nparams\n↗\nClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)\nAnthropic · 63.2 t/s\nUndisclosed\nparams\n↗\nGPT-5.6 Sol (max)\nOpenAI · 61.7 t/s\nUndisclosed\nparams\n↗\nClaude Opus 5 (Adaptive Reasoning, Max Effort)\nAnthropic · 54.1 t/s\nUndisclosed\nparams\n↗\nKimi K3 (max)\nFireworks · 48.9 t/s\n2.8T\nparams\n↗\nQwen3.8 Max\nAlibaba Cloud · 47.0 t/s\nUndisclosed\nparams\n↗", "url": "https://wpnews.pro/news/the-programming-language-speed-balls-but-for-inference-tokens-per-second", "canonical_source": "https://kylejeong.com/inference-balls", "published_at": "2026-08-14 00:36:21+00:00", "updated_at": "2026-08-14 00:42:12.974182+00:00", "lang": "en", "topics": ["artificial-intelligence", "large-language-models", "ai-infrastructure", "ai-products"], "entities": ["Cerebras", "Groq", "OpenAI", "Google AI Studio", "Anthropic", "Alibaba Cloud", "DeepInfra", "Meta"], "alternates": {"html": "https://wpnews.pro/news/the-programming-language-speed-balls-but-for-inference-tokens-per-second", "markdown": "https://wpnews.pro/news/the-programming-language-speed-balls-but-for-inference-tokens-per-second.md", "text": "https://wpnews.pro/news/the-programming-language-speed-balls-but-for-inference-tokens-per-second.txt", "jsonld": "https://wpnews.pro/news/the-programming-language-speed-balls-but-for-inference-tokens-per-second.jsonld"}}