# Parâmetro de Esforço do Claude Opus 5: Trocando Custo por Capacidade

> Source: <https://dev.to/lucas_ferreira/parametro-de-esforco-do-claude-opus-5-trocando-custo-por-capacidade-411l>
> Published: 2026-07-25 03:20:28+00:00

Todo artigo principal sobre o [lançamento do Claude Opus 5](https://www.anthropic.com/news/claude-opus-5) em 24 de julho de 2026 destacou a mesma funcionalidade: uma forma de alternar entre custo e capacidade. Mas poucos explicaram o que ela controla, quais níveis existem, como afeta a requisição ou o impacto na conta.

Essa funcionalidade é o parâmetro `effort`

. No Opus 5, ele tem cinco níveis e o padrão é `high`

. A Anthropic recalibrou esses níveis para o modelo, então configurações ajustadas no Opus 4.8 não devem ser reutilizadas sem avaliação. Além disso, uma combinação específica de parâmetros gera erro `400`

durante migrações.

💡 Para comparar os cinco níveis contra um endpoint real, envie a mesma requisição com valores diferentes de

`effort`

e registre custo, latência e qualidade da resposta.

`effort`

realmente faz
O `effort`

fica dentro de `output_config`

em uma requisição para a API de Mensagens:

```
{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "output_config": {
    "effort": "high"
  },
  "messages": [
    {
      "role": "user",
      "content": "Refatorar este módulo e explicar os trade-offs."
    }
  ]
}
```

Ele controla quanto raciocínio interno o modelo executa antes de responder.

No Opus 5, o pensamento adaptativo está ativado por padrão. O valor de `effort`

define o orçamento usado nesse raciocínio:

`effort`

mais alto: mais tokens de raciocínio, maior custo e maior latência.`effort`

mais baixo: menos tokens de raciocínio, menor custo e menor latência.Nas interfaces de consumidor, a mesma opção pode aparecer como um seletor entre custo e capacidade. Na API, o controle efetivo é o campo `output_config.effort`

.

Consulte o formato completo da requisição no [guia da API do Opus 5](https://apidog.com/pt/blog/claude-opus-5-api?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) e a documentação da Anthropic na [visão geral de modelos](https://platform.claude.com/docs/en/about-claude/models/overview).

`effort`

não controla verbosidade
`effort`

não é um controle de tamanho da resposta.

Segundo o [guia de prompting da Anthropic para o Opus 5](https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5), reduzir o `effort`

diminui o raciocínio interno, não o comprimento do texto visível.

Se você precisa de respostas curtas, inclua essa restrição no prompt:

```
Responda em no máximo 5 bullets. Não inclua introdução, justificativas longas ou exemplos adicionais.
```

Não espere que usar `low`

reduza automaticamente a saída textual.

`effort`

| Nível | O que faz | Aplicação típica |
|---|---|---|
`low` |
Raciocínio mínimo antes de responder | Classificação de alto volume, extração, roteamento e resumos curtos |
`medium` |
Raciocínio moderado | Perguntas e respostas sobre contexto recuperado, edições de arquivo único e transformações estruturadas |
`high` |
Padrão. Raciocínio substancial |
Trabalho de propósito geral quando você ainda não mediu resultados |
`xhigh` |
Raciocínio estendido | Codificação e loops agênticos; ponto de partida recomendado pela Anthropic |
`max` |
Orçamento máximo de raciocínio | Problemas difíceis de uma única tentativa, quando errar custa mais que os tokens |

Dois detalhes são especialmente importantes:

**O padrão é high.**

`output_config`

, a requisição usa `high`

. Isso afeta previsões de custo: uma requisição sem configuração explícita no Opus 5 realiza trabalho de raciocínio e cobra por ele.**Para código e agentes, comece em xhigh, não em max.**

`xhigh`

como ponto de partida para essas cargas. Use `max`

apenas quando suas avaliações mostrarem ganho mensurável que justifique o custo adicional.A mudança do comportamento padrão é uma das alterações relevantes na [migração do Opus 4.8 para o Opus 5](https://apidog.com/pt/blog/claude-opus-5-migration-opus-4-8?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).

O rótulo de cada nível não representa necessariamente o mesmo orçamento entre modelos.

No Opus 5, `medium`

não corresponde à mesma quantidade de raciocínio que `medium`

no Opus 4.8. A recomendação da Anthropic é executar uma nova varredura de `effort`

em vez de migrar a configuração anterior diretamente.

Na prática, isso pode abrir espaço para redução de custo:

`low`

e `medium`

frequentemente apresentavam queda perceptível de qualidade em tarefas complexas.`low`

e `medium`

opções viáveis para tarefas de produção que não precisam de raciocínio extenso.O Opus 5 custa US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída, os mesmos valores do Opus 4.8. Tokens de raciocínio entram na cobrança de saída.

Por isso, usar `high`

em um pipeline de classificação onde `low`

já atende aos critérios pode aumentar significativamente o gasto sem melhorar a precisão.

Veja a tabela completa de preços no [detalhamento de preços do Opus 5](https://apidog.com/pt/blog/claude-opus-5-pricing?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation), incluindo desconto de 50% para lote e o mínimo de cache de 512 tokens.

Para otimizações adicionais, consulte [como cortar sua conta da API Claude](https://apidog.com/pt/blog/cut-claude-api-bill?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).

`xhigh`

e `max`

interagem com `max_tokens`

`max_tokens`

limita os tokens de raciocínio **e** os tokens da resposta visível.

Em outras palavras, ele é um teto para toda a saída gerada pela requisição:

```
tokens de raciocínio + tokens de resposta <= max_tokens
```

Ao aumentar o `effort`

, o modelo pode gastar mais do orçamento em raciocínio antes de começar a gerar a resposta. Se `max_tokens`

estiver dimensionado para um modelo sem esse comportamento, a resposta pode ser truncada.

Exemplo recomendado para `xhigh`

:

```
{
  "model": "claude-opus-5",
  "max_tokens": 64000,
  "output_config": {
    "effort": "xhigh"
  },
  "messages": [
    {
      "role": "user",
      "content": "Corrigir o teste de integração com falha e explicar a causa raiz."
    }
  ]
}
```

A orientação da Anthropic é começar com `max_tokens: 64000`

ao usar `xhigh`

ou `max`

.

Um valor alto de `max_tokens`

é um teto, não uma compra antecipada. Você é cobrado pelos tokens realmente produzidos. Portanto, definir `64000`

não significa pagar por `64000`

; significa evitar que o modelo interrompa o raciocínio ou a resposta cedo demais.

`thinking`

desativado com `xhigh`

ou `max`

Há uma combinação inválida que deve ser verificada durante a migração.

Desabilitar o pensamento e solicitar um `effort`

alto são instruções contraditórias. Esta requisição falha:

```
{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "thinking": {
    "type": "disabled"
  },
  "output_config": {
    "effort": "xhigh"
  }
}
```

O Opus 5 retorna `400`

quando `thinking: { "type": "disabled" }`

é usado com `effort: "xhigh"`

ou `effort: "max"`

.

As combinações válidas são:

`low`

, `medium`

ou `high`

.Um caminho comum para esse erro é:

`thinking: { "type": "disabled" }`

de uma configuração do Opus 4.8.`effort`

para `xhigh`

, seguindo a recomendação para codificação.`400`

porque os dois ajustes são incompatíveis.A recomendação da Anthropic é não desabilitar o pensamento no Opus 5. Com ele desativado, dois problemas podem aparecer:

Em loops agênticos, esse texto vazado pode contaminar interações posteriores. Para controlar custo, prefira reduzir `effort`

em vez de desabilitar o pensamento.

Veja mais detalhes no [guia de prompt do Opus 5](https://apidog.com/pt/blog/prompting-claude-opus-5?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).

`effort`

nas suas avaliações
A forma prática de escolher um nível é avaliar sua carga de trabalho real.

Separe de 30 a 50 prompts dos logs de produção. Evite exemplos exclusivamente sintéticos.

Inclua casos difíceis, falhas conhecidas e tarefas com impacto real. Diferenças entre níveis de `effort`

tendem a desaparecer em tarefas simples.

Defina métricas objetivas antes de ler as saídas. Por exemplo:

Evite critérios vagos como “parece melhor”.

Com 40 prompts e 5 níveis, você terá 200 chamadas:

```
40 prompts × 5 níveis = 200 execuções
```

Como essa avaliação não é sensível à latência, você pode usar a API Batch para reduzir o custo.

Para cada execução, capture pelo menos:

`usage.output_tokens`

;O campo `usage`

é importante porque mostra o consumo real de tokens de saída, incluindo os tokens de raciocínio.

Um registro simples pode ter este formato:

```
{
  "prompt_id": "integration-test-17",
  "effort": "medium",
  "passed": true,
  "output_tokens": 1842,
  "latency_ms": 3280
}
```

Compare a taxa de aprovação com custo e latência. Escolha o nível mais barato que atinge seus requisitos e valide a decisão em um conjunto separado, que não foi usado para ajustar a configuração.

A razão para executar essa varredura é justamente a recalibração entre Opus 4.8 e Opus 5. Não assuma que os rótulos terão o mesmo comportamento no próximo modelo.

A parte mecânica da varredura consiste em enviar o mesmo corpo de requisição cinco vezes, alterando apenas `output_config.effort`

.

Uma configuração prática no [Apidog](https://apidog.com/?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation):

`output_config.effort`

em cada cópia.`usage.output_tokens`

, latência e resultado funcional.`cache_read_input_tokens`

quando estiver validando o cache.`low`

e `xhigh`

.`stop_reason`

exista e não seja `max_tokens`

.A última verificação evita que uma resposta truncada pareça uma resposta curta válida.

Exemplo de condição que sua coleção deve verificar:

```
stop_reason existe AND stop_reason != "max_tokens"
```

Se a requisição terminar com `stop_reason: "max_tokens"`

, aumente `max_tokens`

antes de concluir que aquele nível de `effort`

teve desempenho ruim.

Você pode [baixar o Apidog](https://apidog.com/download?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) para montar essa coleção. Não é obrigatório: o mesmo processo pode ser automatizado com scripts, mas uma coleção facilita comparar as cinco variações.

`effort`

pode tornar o Opus 5 mais eficiente para rodar bem, mas não altera a posição do modelo na linha Claude.

Os números de lançamento divulgados pela Anthropic para o Opus 5 incluem:

Esses números foram publicados pela Anthropic e não haviam sido reproduzidos independentemente até 25 de julho de 2026. Trate-os como afirmações do fornecedor, não como medições neutras.

Consulte o [detalhamento de benchmarks do Opus 5](https://apidog.com/pt/blog/claude-opus-5-benchmarks?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) para as ressalvas de cada benchmark.

Acima do Opus 5, o [Fable 5](https://apidog.com/pt/blog/what-is-claude-fable-5?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) continua sendo o modelo mais capaz amplamente lançado da Anthropic, a US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída.

O Opus 5 também fica atrás do [Mythos 5](https://apidog.com/pt/blog/mythos-class-model-explained?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) em exploração de segurança cibernética e pesquisa biológica autônoma, conforme declarado pela Anthropic.

Usar `effort: "max"`

não elimina essas diferenças de capacidade. O ganho prático está em encontrar o menor nível que atende às exigências da sua carga de trabalho.

Para comparar custo e capacidade entre os modelos, veja [Opus 5 vs Fable 5](https://apidog.com/pt/blog/claude-opus-5-vs-fable-5?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).

`effort`

padrão no Claude Opus 5?
`high`

.

Uma requisição sem `output_config`

usa `effort: "high"`

com pensamento adaptativo ativado.

`effort`

?
`low`

, `medium`

, `high`

, `xhigh`

e `max`

.

A Anthropic recomenda começar em `xhigh`

para codificação e trabalho agêntico e, então, avaliar níveis menores com sua própria suíte de testes.

`effort: "xhigh"`

?
Provavelmente porque você também enviou:

```
{
  "thinking": {
    "type": "disabled"
  }
}
```

Com pensamento desativado, o `effort`

fica limitado a `high`

. Remova a desativação do pensamento ou reduza o nível para `high`

, `medium`

ou `low`

.

`effort`

do Opus 4.8 no Opus 5?
Não.

Os níveis foram recalibrados, então o mesmo rótulo representa uma quantidade diferente de raciocínio. Execute uma nova varredura de avaliação antes de definir a configuração de produção.

Consulte o [guia de migração](https://apidog.com/pt/blog/claude-opus-5-migration-opus-4-8?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) para a lista completa de mudanças.

`effort`

deixa as respostas mais curtas?
Não.

`effort`

controla o raciocínio interno, não o tamanho visível da resposta. Se você precisa de uma resposta curta, solicite explicitamente concisão no prompt.

`max_tokens`

devo usar com `xhigh`

ou `max`

?
Comece com `64000`

.

`max_tokens`

limita o raciocínio e a resposta juntos. Um teto baixo pode truncar a saída. Você só paga pelos tokens realmente produzidos, então um teto alto não gera custo por si só.

Para especificações, disponibilidade e preços, comece por [o que é o Claude Opus 5](https://apidog.com/pt/blog/what-is-claude-opus-5?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation).
