A Anthropic anunciou o Claude Opus 5.5, nova versão do modelo que reduz os preços de tokens de entrada e saída em 20% e corta em 60% o custo de leitura de dados armazenados em cache. Em um exemplo apresentado pela empresa, uma sessão que custava US$ 3,50 no Opus 5 passa a custar US$ 2,40 no Opus 5.5, uma redução de cerca de 31%.
O Opus 5.5 já está disponível pela API e no Claude Code. Para assinantes dos planos Pro, Max e Team, a redução de custos aparece na forma de limites de uso maiores. Segundo a Anthropic, o mesmo orçamento pode render cerca de 25% mais uso do modelo.
A nova versão também muda a forma como o Claude trabalha. O Opus 5.5 usa o recurso de thinking antes das respostas para analisar a tarefa e chegar ao resultado. A empresa também afirma que o modelo ficou mais eficiente no uso de tokens, o que ajuda a reduzir o custo de tarefas longas.
:quality(85)/29775db9-4492-4bdb-8689-9f442e3775af.jpg)
Quanto custa o Claude Opus 5.5?
O preço de entrada caiu de US$ 5 para US$ 4 por milhão de tokens, enquanto o custo dos tokens de saída passou de US$ 25 para US$ 20. A maior redução aparece nas leituras de cache, que baixaram de US$ 0,50 para US$ 0,20 por milhão de tokens, uma queda de 60%.
A mudança favorece principalmente sessões longas, nas quais o Claude reaproveita grandes volumes de informações armazenadas em cache. Como a leitura desses dados ficou mais barata, tarefas com muito contexto podem ter uma redução significativa no custo, mesmo quando trabalham com milhões de tokens.
Já tarefas concentradas na geração de respostas tendem a se beneficiar principalmente da redução de 20% no preço dos tokens de saída.
:quality(85)/08b6eb07-260d-484f-90de-afa3048ee876.jpg)
Como economizar tokens no Claude?
Além dos preços menores do Opus 5.5, algumas configurações do Claude Code ajudam a controlar o consumo de tokens, como:
-
Escolha o nível de esforço adequado
-
Use cada modelo para uma tarefa
-
Aproveite o cache
-
Faça auditoria dos prompts
-
Acompanhe o uso de tokens
Escolha o nível de esforço adequado
O nível de esforço determina quanto o modelo deve investir no processo de pensamento, na geração de texto e no uso de ferramentas. Para tarefas simples, níveis menores podem evitar gastos desnecessários.
O nível Low pode ser usado em trabalhos mecânicos, como renomear variáveis ou aplicar padrões conhecidos em vários arquivos. O Medium atende tarefas cotidianas com escopo bem definido, enquanto o High faz mais sentido em problemas que exigem uma análise maior do código.
Níveis mais altos devem ficar para tarefas complexas, nas quais o modelo precisa analisar várias partes do projeto antes de tomar uma decisão.
:quality(85)/4ef463f1-605c-4ee7-be94-35fafeebbf38.png)
Use cada modelo para uma tarefa
Outra forma de controlar o consumo é escolher o modelo de acordo com a dificuldade do trabalho. O Opus 5.5 pode ficar responsável pelas tarefas principais, como desenvolvimento de funcionalidades, revisão de código e trabalhos que exigem mais raciocínio, enquanto modelos, como Sonnet e Haiku, assumem atividades secundárias.
Para pesquisas, leitura de logs e execução de testes, a recomendação é configurar subagentes no Sonnet ou Haiku, deixando a edição principal do código a cargo do Opus 5.5. A divisão reduz a necessidade de usar o modelo mais caro em tarefas que não precisam do mesmo nível de capacidade.
Também é indicado manter o Opus 5.5 como modelo principal no dia a dia, mas alternar para o Fable 5.1 caso ele trave duas vezes no mesmo problema usando esforço High. O Fable 5.1 tem custo maior, de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, mas pode evitar ciclos repetidos de tentativa e erro em códigos complexos.
:quality(85)/1b35b984-2944-4b06-a04f-41c767024bd9.png)
Aproveite o cache
O cache é especialmente importante em sessões longas. No Opus 5.5, a leitura de informações armazenadas custa US$ 0,20 por milhão de tokens, o equivalente a apenas 5% do preço de uma entrada nova. A duração do cache varia conforme a forma de acesso ao modelo: nos planos Pro, Max e Team, ele dura uma hora e na API o período padrão é de cinco minutos.
Para aproveitar melhor esse mecanismo, vale evitar mudanças constantes nas definições de ferramentas e no prompt do sistema durante uma tarefa, já que alterações podem invalidar partes do cache. Alterar o nível de esforço no meio da sessão por comando também invalida o cache da conversa, fazendo com que a próxima operação tenha de regravar o contexto.
Quando o cache expira ou é invalidado por uma mudança de configuração, a regravação custa entre 1,25 e 2 vezes o preço de um token de entrada comum. Em contextos grandes, uma única regravação pode custar o equivalente a até 25 leituras de cache.
:quality(85)/4c03a197-4217-4ac2-aba7-761c16cb8d12.png)
No Claude Code, o comando /compact ajuda a reduzir o histórico usado pela conversa e o /clear inicia uma tarefa sem carregar o contexto anterior. O tamanho do arquivo CLAUDE.md também merece atenção. A recomendação é mantê-lo abaixo de 200 linhas para evitar o carregamento de informações desnecessárias a cada requisição.
Os servidores MCP que não estão em uso também podem aumentar o volume de dados enviado ao modelo. Desativá-los com o comando /mcp reduz esse carregamento automático. No entanto, conectar ou desconectar servidores MCP durante uma sessão e alternar entre modelos são outras ações que podem reiniciar o cache da conversa.
Faça auditoria dos prompts
Prompts muito longos ou com instruções repetidas também podem aumentar o consumo. O comando /claude-api prompt-audit identifica problemas que podem fazer o modelo gastar tokens sem melhorar o resultado.
Entre os pontos analisados estão instruções contraditórias e regras de verificação que aumentam o número de etapas de uma tarefa. Em testes de migração, a Anthropic registrou redução adicional de até 9% nos custos após a limpeza dos prompts.
Acompanhe o uso de tokens
O acompanhamento do consumo ajuda a encontrar tarefas que gastam mais do que o esperado. O comando /usage mostra informações sobre o uso da sessão, incluindo o consumo de tokens e a participação do cache.
Sessões que fogem muito do padrão podem indicar loops de repetição, uso excessivo de ferramentas ou um nível de esforço maior do que o necessário para aquela tarefa. A análise desses casos ajuda a ajustar as configurações e evitar desperdícios nas próximas execuções.
Se você gostou do conteúdo, talvez também se interesse por conferir “O custo invisível dos tokens: por que a conta da IA não para de subir?”.
{{WHATSAPP_CHANNEL}}