Clawy / Guias / Reduzir seus custos de API de LLM
Seis alavancas que reduzem sua conta da OpenAI ou Claude — ordenadas por impacto. A maioria das equipes deixa as duas primeiras de lado.
As contas de LLM disparam por razões banais: o modelo errado em tarefas fáceis, output sem limite, o mesmo contexto reenviado sem cache a cada chamada. Nada disso exige aceitar respostas piores. É aqui que o dinheiro realmente vai, a maior alavanca primeiro.
Esta é, de longe, a maior alavanca, e é grátis. Modelos de ponta têm preço de trabalho de ponta; a maioria das chamadas em produção não é trabalho de ponta. As tarifas da Claude abrangem uma faixa de 5× em input e output:
| Modelo | Input / 1M | Output / 1M | Bom para |
|---|---|---|---|
| Haiku 4.5 | $1 | $5 | classificação, extração, roteamento, chat simples |
| Sonnet 4.6 | $3 | $15 | a maioria das cargas de produção, equilibrado |
| Opus 4.8 | $5 | $25 | raciocínio difícil, agentes, trabalho de longo horizonte |
Rotear suas chamadas de alto volume e baixa dificuldade para o Haiku em vez do Opus é um corte de custo de 5× nessas chamadas sem perda de qualidade — porque elas nunca precisaram do Opus. Reserve o modelo caro para as requisições que de fato movem sua métrica de qualidade. (Não sabe qual escolher? Veja qual modelo Claude usar.)
Se cada requisição reenvia o mesmo system prompt grande, exemplos few-shot ou documento, você está pagando o preço cheio de input por tokens idênticos. O cache de prompts cobra o prefixo em cache a cerca de 10% do preço normal de input num hit. Para um agente com um preâmbulo fixo de 10k tokens, isso elimina a maior parte do seu custo de input.
O detalhe é que o cache é uma correspondência de prefixo: um byte alterado em qualquer ponto do prefixo invalida tudo o que vem depois. Assassinos silenciosos do cache para auditar: um datetime.now() ou UUID no system prompt, serialização JSON não ordenada, ou uma lista de ferramentas que muda por requisição. Verifique os hits com o campo cache_read_input_tokens na resposta — se for zero em chamadas de prefixo idêntico, algo está invalidando.
O output custa 3–5× mais que o input por token, e um max_tokens sem limite deixa uma única resposta tagarela disparar a conta. Defina um max_tokens adequado ao trabalho — um classificador precisa de 50 tokens, não de 4.000. Se você ativou o pensamento estendido/adaptativo, lembre que esses tokens de raciocínio também são cobrados como output.
Tokens de input são dinheiro de verdade, e "enfiar o documento inteiro" é o desperdício mais comum. Recupere e envie apenas os trechos relevantes em vez do corpus completo. Enxugue o histórico de conversa (ou resuma) quando ficar longo. Cada 10k tokens que você não envia ao Opus são $0,05 que você guarda, por chamada.
Se uma carga não precisa de resposta instantânea — classificação noturna, sumarização em massa, evals — a Batch API roda as mesmas requisições com 50% de desconto, normalmente concluídas em uma hora. Tudo que tolera latência deveria passar por ela.
Faça de "barato" o padrão e escale deliberadamente, não o contrário. Um roteador simples — tente o modelo barato, recorra a um mais forte só quando a tarefa precisar — captura a maior parte da alavanca 1 automaticamente.
→ Modele a economia. A calculadora de margem / custo grátis deixa você inserir modelo, tamanho de prompt e preço para ver o custo exato por chamada — compare Haiku vs Opus com seus números reais em segundos.Nenhuma delas troca qualidade por custo — elas param de pagar preços de ponta por trabalho que não é de ponta e param de pagar duas vezes pelos mesmos tokens. Meça primeiro (conheça seu custo por chamada), depois puxe as alavancas em ordem.
→ Ou pague só por chamada. A Clawy serve GPT-5.5, Claude Opus 4.8 e um nível auto de $0,04 otimizado em custo via x402 — USDC por requisição, sem chaves de API, sem assinatura. Início rápido de 5 minutos → → Garanta o Kit de preços de API de IA (19 €). Um modelo de custo/margem em Excel, uma calculadora offline, códigomargin-guard pronto que limita prompts grandes demais antes que custem a você, e um início rápido — em pacote.