LLM Benchmark: Opus 5 é bom? Anthropic released Claude Opus 5 yesterday, which scored 95/100 (Tier A) in the author's benchmark, the highest score seen so far. However, the author cautions that this does not prove it is the best LLM overall, citing a previous article explaining why a higher score does not mean the best model. A Anthropic lançou o Claude Opus 5 ontem. A pergunta óbvia é: “É bom?” Resposta curta: sim, é muito bom . No meu benchmark fez 95/100, Tier A, com a engenharia mais completa que apareceu até agora em qualquer um dos harnesses que testei. Agora a resposta que interessa: não, isso não prova que virou “o melhor LLM do mundo”. Nem prova que é melhor que Fable 5, Opus 4.8, GPT 5.6 Sol ou Kimi K3 em qualquer trabalho que você jogar neles. Semana passada publiquei um artigo inteiro explicando por que a maior nota não significa o melhor modelo https://www.akitaonrails.com/2026/07/19/llm-benchmark-devo-usar-o-que-tem-nota-maior/ . O Opus 5 chegou a tempo de produzir um belo estudo de caso praquele texto.