Clawy / Guias / Reduzir seus custos de API de LLM

Como reduzir seus custos de API de LLM sem respostas mais burras

Seis alavancas que reduzem sua conta da OpenAI ou Claude — ordenadas por impacto. A maioria das equipes deixa as duas primeiras de lado.

As contas de LLM disparam por razões banais: o modelo errado em tarefas fáceis, output sem limite, o mesmo contexto reenviado sem cache a cada chamada. Nada disso exige aceitar respostas piores. É aqui que o dinheiro realmente vai, a maior alavanca primeiro.

1. Adeque o modelo à tarefa

Esta é, de longe, a maior alavanca, e é grátis. Modelos de ponta têm preço de trabalho de ponta; a maioria das chamadas em produção não é trabalho de ponta. As tarifas da Claude abrangem uma faixa de 5× em input e output:

ModeloInput / 1MOutput / 1MBom para
Haiku 4.5$1$5classificação, extração, roteamento, chat simples
Sonnet 4.6$3$15a maioria das cargas de produção, equilibrado
Opus 4.8$5$25raciocínio difícil, agentes, trabalho de longo horizonte

Rotear suas chamadas de alto volume e baixa dificuldade para o Haiku em vez do Opus é um corte de custo de 5× nessas chamadas sem perda de qualidade — porque elas nunca precisaram do Opus. Reserve o modelo caro para as requisições que de fato movem sua métrica de qualidade. (Não sabe qual escolher? Veja qual modelo Claude usar.)

2. Cacheie seu contexto repetido

Se cada requisição reenvia o mesmo system prompt grande, exemplos few-shot ou documento, você está pagando o preço cheio de input por tokens idênticos. O cache de prompts cobra o prefixo em cache a cerca de 10% do preço normal de input num hit. Para um agente com um preâmbulo fixo de 10k tokens, isso elimina a maior parte do seu custo de input.

O detalhe é que o cache é uma correspondência de prefixo: um byte alterado em qualquer ponto do prefixo invalida tudo o que vem depois. Assassinos silenciosos do cache para auditar: um datetime.now() ou UUID no system prompt, serialização JSON não ordenada, ou uma lista de ferramentas que muda por requisição. Verifique os hits com o campo cache_read_input_tokens na resposta — se for zero em chamadas de prefixo idêntico, algo está invalidando.

3. Limite seu output

O output custa 3–5× mais que o input por token, e um max_tokens sem limite deixa uma única resposta tagarela disparar a conta. Defina um max_tokens adequado ao trabalho — um classificador precisa de 50 tokens, não de 4.000. Se você ativou o pensamento estendido/adaptativo, lembre que esses tokens de raciocínio também são cobrados como output.

4. Envie menos contexto

Tokens de input são dinheiro de verdade, e "enfiar o documento inteiro" é o desperdício mais comum. Recupere e envie apenas os trechos relevantes em vez do corpus completo. Enxugue o histórico de conversa (ou resuma) quando ficar longo. Cada 10k tokens que você não envia ao Opus são $0,05 que você guarda, por chamada.

5. Agrupe o trabalho não urgente

Se uma carga não precisa de resposta instantânea — classificação noturna, sumarização em massa, evals — a Batch API roda as mesmas requisições com 50% de desconto, normalmente concluídas em uma hora. Tudo que tolera latência deveria passar por ela.

6. Por padrão, o modelo mais barato que funciona

Faça de "barato" o padrão e escale deliberadamente, não o contrário. Um roteador simples — tente o modelo barato, recorra a um mais forte só quando a tarefa precisar — captura a maior parte da alavanca 1 automaticamente.

→ Modele a economia. A calculadora de margem / custo grátis deixa você inserir modelo, tamanho de prompt e preço para ver o custo exato por chamada — compare Haiku vs Opus com seus números reais em segundos.

Nenhuma delas troca qualidade por custo — elas param de pagar preços de ponta por trabalho que não é de ponta e param de pagar duas vezes pelos mesmos tokens. Meça primeiro (conheça seu custo por chamada), depois puxe as alavancas em ordem.

→ Ou pague só por chamada. A Clawy serve GPT-5.5, Claude Opus 4.8 e um nível auto de $0,04 otimizado em custo via x402 — USDC por requisição, sem chaves de API, sem assinatura. Início rápido de 5 minutos → → Garanta o Kit de preços de API de IA (19 €). Um modelo de custo/margem em Excel, uma calculadora offline, código margin-guard pronto que limita prompts grandes demais antes que custem a você, e um início rápido — em pacote.