{"slug": "llm-benchmarks-os-ultimos-deepseek-v4-parem-de-perguntar", "title": "LLM Benchmarks: Os últimos Deepseek v4, parem de perguntar", "summary": "In the latest round of LLM benchmarks, Deepseek v4 models scored 93 points, placing them in the middle of the Tier A pack, with Flash 0731 completing the test in 43 minutes and Pro 0813 in 48 minutes, according to Vinicius Akita's benchmark v2. The top spot remains held by Claude Fable 5 with 96 points, followed by Claude Sonnet 5, Claude Opus 5, and Kimi K3 at 95, and GLM 5.3 at 94. Akita emphasizes that the benchmark measures only a narrow slice of easy Rails web programming and cautions against extrapolating these scores to overall model superiority.", "body_md": "# LLM Benchmarks: Os últimos Deepseek v4, parem de perguntar\n\n*Se tem preguiça de ler, clique*\n\n[aqui](https://claude.ai/new?q=Por+favor%2C+abra+esta+URL+com+busca+na+web+e+leia+o+artigo+completo%3A+https%3A%2F%2Fwww.akitaonrails.com%2F2026%2F08%2F22%2Fllm-benchmarks-os-ultimos-deepseek-v4-parem-de-perguntar%2F%0A%0ADepois+de+ler+o+conte%C3%BAdo+real+do+artigo%2C+fa%C3%A7a+o+seguinte%3A%0A1%29+Resuma+os+5+pontos+mais+importantes+e+a+conclus%C3%A3o.%0A2%29+Depois+do+resumo%2C+diga+ao+leitor+quais+detalhes%2C+dados+e+insights+ele+est%C3%A1+perdendo+por+n%C3%A3o+ler+o+artigo+completo.+Seja+espec%C3%ADfico+o+suficiente+pra+deixar+ele+curioso.%0A3%29+Lembre+que+ele+pode+continuar+fazendo+perguntas+sobre+o+artigo+aqui+neste+chat.%0A4%29+Sugira+uma+boa+pergunta+de+follow-up+que+ele+poderia+fazer+pra+come%C3%A7ar.)pro TL;DRSemana passada eu publiquei a rodada com [Qwen 3.8, GLM 5.3, Gemini 3.7 e Grok 4.6](/2026/08/15/llm-benchmarks-qwen-3-8-glm-5-3-gemini-3-7/) no meu benchmark v2: a prova em três fases (construir, validar rodando de verdade, se auto-revisar com nota de honestidade) que endurece um app Rails 8 de chat com LLM. O topo segue o mesmo: Fable 5 com 96, o trio Sonnet 5, Opus 5 e Kimi K3 com 95, GLM 5.3 sozinho com 94, e o pelotão dos 93 logo atrás.\n\nE toda vez que eu publico uma dessas atualizações, sem exceção, aparece alguém nos comentários: *“e o Deepseek?”*\n\nConfesso que eu não entendo esse foco cego no Deepseek. É um modelo aberto entre tantos outros, e não tem nada que o destaque do pelotão. No meu uso diário, eu continuo preferindo Kimi K3 ou GLM 5.3. Sim, a cada iteração eles melhoram um pouco. Sim, eu testei os dois snapshots novos (Flash 0731 e Pro 0813) e os números estão aqui embaixo. E mesmo assim, a resposta continua sendo: ninguém ali está na classe do Fable 5 ou do Sol.\n\n## O que essa nota mede (e o que ela não mede)\n\nAntes dos números, o lembrete que precisa ser repetido a cada rodada. O benchmark testa um recorte muito específico: programação web **fácil**. Um CRUD de chat em Rails com streaming, tools, concorrência e testes. É uma prova útil porque é concreta, reproduzível e pega alucinação de API no flagra, mas continua sendo um recorte estreito.\n\nEla não diz nada sobre tarefas muito mais avançadas: desenvolvimento de driver de kernel, otimização de game engine, segurança ofensiva de verdade. É impossível testar a totalidade de um modelo. O que dá pra testar é um subconjunto, e foi o que eu fiz.\n\nEntão, da próxima vez que você vir “Kimi está prestes a destronar o Fable” ou “GLM vai passar o Sol” porque as notas ficaram parecidas, leia assim: num subconjunto estreito de programação web, qualquer um desses modelos entrega. Só isso. Nota próxima nessa prova significa proximidade **nessa prova**, em mais nada.\n\nPra guardar:benchmark mede um recorte. O meu mede web app fácil em Rails. Quem extrapola isso pra “modelo X é melhor que modelo Y em tudo” está lendo o número errado.\n\n## O ranking do Tier A, com foco no tempo\n\nA tabela de sempre, recorte A.1 (90 pontos ou mais), agora com os dois Deepseek em **negrito**. Dessa vez preste atenção na coluna de tempo: é a mesma prova, as mesmas três fases, pra todo mundo.\n\n| # | Modelo | Score | Harness | Tempo | Custo |\n|---|---|---|---|---|---|\n| 1 | Claude Fable 5 | 96 | Claude Code | 46 min | $26,03 |\n| 2 | Claude Sonnet 5 | 95 | Claude Code | 59 min | $25,83 |\n| 2 | Claude Opus 5 | 95 | Claude Code | 78 min | $38,91 |\n| 2 | Kimi K3 | 95 | Kimi CLI | 65 min | $6,14 |\n| 5 | GLM 5.3 | 94 | OpenCode | 80 min | $0 (≈$2,59) |\n| 6 | GPT 5.6 Sol | 93 | Codex | 57 min | ~$45 |\n| 6 | Claude Opus 4.8 | 93 | Claude Code | 53 min | $21,82 |\n| 6 | GPT 5.6 Terra | 93 | Codex | 48 min | $16,92 |\n| 6 | Gemini 3.7 Flash | 93 | OpenCode | 43 min | $4,12 |\n| 10 | GLM 5.2 | 92 | OpenCode | 155 min | $0 (≈$12,05) |\n| 10 | Kimi K2.5 | 92 | OpenCode | 43 min | $1,50 |\n| 10 | Gemini 3.6 Flash @ high | 92 | Antigravity | 15 min | — |\n| 10 | Qwen 3.8 Max | 92 | OpenCode | 78 min | $9,16 |\n| 10 | Grok 4.6 | 92 | OpenCode | 34 min | $6,33 |\n| 15 | MiniMax M3 | 91 | OpenCode | 113 min | $7,72 |\n| 15 | Kimi K2.6 | 91 | OpenCode | 34 min | $2,64 |\n| 15 | Claude Opus 4.7 | 91 | Claude Code | 44 min | $44,28 |\n| 15 | GPT 5.6 Luna | 91 | Codex | 46 min | $16,79 |\n| 15 | Deepseek v4 Pro (0813) | 91 | OpenCode | 82 min | $5,01 |\n| 15 | Grok 4.5 | 91 | grok CLI | 25 min | $0 (≈$1,62) |\n| 21 | Deepseek v4 Flash (0731) | 90 | OpenCode | 88 min | $0,82 |\n\n*Tempo é o wall clock das três fases; custo é equivalente em API. O critério é o mesmo dos artigos anteriores, link no fim.*\n\nOlha o espalhamento de tempo. O mais rápido do grupo resolve a prova em 15 minutos; o mais lento leva 155, **dez vezes mais**. Os dois Deepseek ficam na metade de baixo da tabela em velocidade: 82 e 88 minutos, atrás de quase todo mundo na mesma faixa de nota. O Flash, em particular, despejou **44 milhões de tokens** na rodada. Pra comparação, o GLM 5.3 fez um ponto a mais com 19,4 milhões. O Deepseek compensa na fatura: os $0,82 do Flash são o menor custo de uma rodada Tier A até hoje.\n\n## Os snapshots novos: o que mudou de julho pra cá\n\nRodei os builds de julho do v4 no fim daquele mês: Flash fez 80, Pro fez 82, ambos Tier B. Os dois snapshots datados (0731 e 0813) rodaram hoje sob o mesmo rigor, e os dois entraram no Tier A:\n\n**Flash 0731: de 80 pra 90 (+10).** A melhoria mais visível é de comportamento. O build de julho pinava um modelo três gerações atrás; esse acertou o pin de primeira (`anthropic/claude-sonnet-5`\n\n, sem slug velho). A auto-revisão foi exemplar: ele mesmo encontrou que o partial da bolha de streaming era código morto (nenhuma resposta aparecia até um reload forçado nas fases 1 e 2), confessou, corrigiu e tirou 15/15 em honestidade. Perdeu pontos onde o pelotão perde: concorrência sem lock de turno (8) e cobertura sem branch (8).\n\n**Pro 0813: de 82 pra 91 (+9).** A notícia grande é o que sumiu: o bug do `reasoning_content`\n\nque quebrava o multi-turn dele no OpenCode e me obrigou a inventar a [gambiarra do deepclaude](/2026/05/04/llm-benchmarks-deepseek-unlocked-deepclaude/) em maio foi corrigido no opencode 1.18.4, e esse snapshot rodou ponta a ponta no harness genérico, sem muleta. O destaque técnico foi a concorrência: store SQLite com leitura-modificação-escrita dentro de `BEGIN IMMEDIATE`\n\n, a solução mais séria do grupo nessa dimensão (9/10). As perdas foram honestas e confessadas: pin velho no sonnet-4.6, streaming verificado só por teste unitário, sem estimador de orçamento com fallback.\n\nRodadas limpas, blindadas, zero leitura de rubrica ou de app alheio. Os relatórios completos estão no [repositório do benchmark](https://github.com/akitaonrails/llm-coding-benchmark).\n\n## Deepseek contra ele mesmo: a trajetória é real\n\nCritério novo e critério velho não se comparam ponto a ponto, então essa seção é sobre comportamento, não sobre nota. E comportamento dá pra comparar, porque o contraste é gritante.\n\nEm abril, o **Deepseek V3.2** fez 43 no critério antigo e protagonizou o momento mais constrangedor da história do benchmark: inventou a integração inteira com o RubyLLM. `RubyLLM::Client.new`\n\n, `client.chat(messages:)`\n\n, os dois métodos alucinados, a camada de LLM inteira ficcional.\n\nAinda no critério velho, o **v4 Flash** fez 78 com um bug fatal de um caractere (o slug do modelo sem o prefixo `anthropic/`\n\n), e o **v4 Pro** deu DNF com 69: código de Tier 1, entrega de Tier 3, derrubado pelo bug do `reasoning_content`\n\nque comia o histórico da conversa. Foi esse bug que gerou o hack do deepclaude, onde o mesmo Pro saltou pra 89.\n\nNo v2, os builds de julho fizeram 80 e 82. Os snapshots de hoje, 90 e 91. Saindo do “inventou a API inteira” pra “acha o próprio código morto e confessa na auto-revisão” em quatro meses. A curva do Deepseek é das mais íngremes que essa prova já registrou, e seria desonesto fingir o contrário.\n\n## E contra os outros chineses?\n\nAqui a conversa fica menos empolgante pra torcida. No mesmo harness genérico (OpenCode), o pelotão chinês fica assim:\n\n| Modelo | Score | Tempo | Custo |\n|---|---|---|---|\n| GLM 5.3 | 94 | 80 min | $0 (≈$2,59) |\n| Qwen 3.8 Max | 92 | 78 min | $9,16 |\n| Kimi K2.5 | 92 | 43 min | $1,50 |\n| Deepseek v4 Pro (0813) | 91 | 82 min | $5,01 |\n| Deepseek v4 Flash (0731) | 90 | 88 min | $0,82 |\n\nE o Kimi K3, que não aparece nessa tabela por ter rodado no harness nativo dele, fez 95. Ou seja: dentro da mesma prova, o Deepseek v4 chega atrás do GLM 5.3, do Qwen 3.8 Max e dos Kimi, sendo o mais lento e o mais verboso do grupo chinês. A vantagem dele é uma só, e é real: preço. $0,82 por uma rodada Tier A é impressionante, e o Pro a $5,01 fica abaixo de quase todo mundo na mesma nota.\n\nSe o seu critério é “máximo de competência por dólar em tarefa web simples”, o Flash 0731 merece atenção. Se o critério é o melhor modelo do grupo, a resposta continua sendo Kimi K3 e GLM 5.3, como era semana passada.\n\n## Conclusão: parem de perguntar\n\nPronto, agora tem número na mesa. O Deepseek v4 melhorou de verdade entre julho e agosto, os dois snapshots entraram no Tier A, o Pro se livrou do bug que exigia gambiarra de harness, e o Flash é a rodada Tier A mais barata que eu já rodei. Tudo isso é fato.\n\nE nada disso muda o quadro. A liderança continua com Fable 5, Sonnet 5, Opus 5 e Sol; o primeiro chinês da fila continua sendo o Kimi K3, seguido do GLM 5.3. O Deepseek é mais um modelo competente num recorte de tarefa fácil, com a virtude de ser barato e o defeito de ser prolixo. Da próxima vez que bater a vontade de comentar “e o Deepseek?”, a resposta é este artigo.", "url": "https://wpnews.pro/news/llm-benchmarks-os-ultimos-deepseek-v4-parem-de-perguntar", "canonical_source": "https://www.akitaonrails.com/2026/08/22/llm-benchmarks-os-ultimos-deepseek-v4-parem-de-perguntar/", "published_at": "2026-08-22 15:00:00+00:00", "updated_at": "2026-08-22 19:42:44.310679+00:00", "lang": "en", "topics": ["large-language-models", "artificial-intelligence"], "entities": ["Deepseek", "Claude Fable 5", "Claude Sonnet 5", "Claude Opus 5", "Kimi K3", "GLM 5.3", "Vinicius Akita", "Rails"], "alternates": {"html": "https://wpnews.pro/news/llm-benchmarks-os-ultimos-deepseek-v4-parem-de-perguntar", "markdown": "https://wpnews.pro/news/llm-benchmarks-os-ultimos-deepseek-v4-parem-de-perguntar.md", "text": "https://wpnews.pro/news/llm-benchmarks-os-ultimos-deepseek-v4-parem-de-perguntar.txt", "jsonld": "https://wpnews.pro/news/llm-benchmarks-os-ultimos-deepseek-v4-parem-de-perguntar.jsonld"}}