Clawy / Guías / Reducir tus costes de API de LLM
Seis palancas que reducen tu factura de OpenAI o Claude — ordenadas por impacto. La mayoría de los equipos dejan las dos primeras sin usar.
Las facturas de LLM se disparan por razones aburridas: el modelo equivocado en tareas fáciles, output sin límite, el mismo contexto reenviado sin caché en cada llamada. Nada de esto exige aceptar peores respuestas. Aquí va a parar el dinero de verdad, la palanca más grande primero.
Esta es la palanca más grande con diferencia, y es gratis. Los modelos de vanguardia tienen precio de trabajo de vanguardia; la mayoría de las llamadas en producción no lo son. Las tarifas de Claude abarcan un rango de 5× en input y output:
| Modelo | Input / 1M | Output / 1M | Bueno para |
|---|---|---|---|
| Haiku 4.5 | $1 | $5 | clasificación, extracción, enrutamiento, chat simple |
| Sonnet 4.6 | $3 | $15 | la mayoría de las cargas de producción, equilibrado |
| Opus 4.8 | $5 | $25 | razonamiento difícil, agentes, trabajo de largo horizonte |
Enrutar tus llamadas de alto volumen y baja dificultad a Haiku en vez de Opus es un recorte de coste de 5× en esas llamadas sin pérdida de calidad — porque nunca necesitaron Opus. Reserva el modelo caro para las peticiones que de verdad mueven tu métrica de calidad. (¿No sabes cuál elegir? Mira qué modelo de Claude usar.)
Si cada petición reenvía el mismo system prompt grande, ejemplos few-shot o documento, estás pagando el precio completo de input por tokens idénticos. El caché de prompts cobra el prefijo cacheado a aproximadamente el 10% del precio normal de input en un acierto. Para un agente con un preámbulo fijo de 10k tokens, eso elimina la mayor parte de tu coste de input.
El truco es que el caché es una coincidencia de prefijo: un byte cambiado en cualquier parte del prefijo invalida todo lo que sigue. Asesinos silenciosos del caché que auditar: un datetime.now() o UUID en el system prompt, serialización JSON sin ordenar, o una lista de herramientas que cambia por petición. Verifica los aciertos con el campo cache_read_input_tokens de la respuesta — si es cero en llamadas con prefijo idéntico, algo lo está invalidando.
El output cuesta 3–5× más que el input por token, y un max_tokens sin límite deja que una sola respuesta parlanchina dispare la factura. Pon un max_tokens acorde al trabajo — un clasificador necesita 50 tokens, no 4.000. Si activaste el pensamiento extendido/adaptativo, recuerda que esos tokens de razonamiento también se facturan como output.
Los tokens de input son dinero real, y "meter el documento entero" es el desperdicio más común. Recupera y envía solo los fragmentos relevantes en vez de todo el corpus. Recorta el historial de conversación (o resúmelo) cuando se alargue. Cada 10k tokens que no envías a Opus son $0,05 que te quedas, por llamada.
Si una carga no necesita respuesta instantánea — clasificación nocturna, resumen masivo, evals — la Batch API ejecuta las mismas peticiones con 50% de descuento, normalmente completadas en una hora. Todo lo que tolere latencia debería pasar por ahí.
Haz que "barato" sea el valor por defecto y escala de forma deliberada, no al revés. Un router simple — prueba el modelo barato, recurre a uno más fuerte solo cuando la tarea lo necesite — captura la mayor parte de la palanca 1 automáticamente.
→ Modela el ahorro. La calculadora de margen / coste gratis te deja meter modelo, tamaño de prompt y precio para ver el coste exacto por llamada — compara Haiku vs Opus con tus números reales en segundos.Ninguna de estas cambia calidad por coste — dejan de pagar precios de vanguardia por trabajo que no lo es y dejan de pagar dos veces por los mismos tokens. Mide primero (conoce tu coste por llamada), luego acciona las palancas en orden.
→ O paga solo por llamada. Clawy sirve GPT-5.5, Claude Opus 4.8 y un nivel auto de $0,04 optimizado en coste sobre x402 — USDC por petición, sin claves API, sin suscripción. Inicio rápido de 5 minutos → → Consigue el Kit de precios de API de IA (19 €). Un modelo de coste/margen en Excel, una calculadora offline, códigomargin-guard listo que limita prompts demasiado grandes antes de que te cuesten, y un inicio rápido — todo junto.