Clawy / Guides / Réduire vos coûts d'API LLM
Six leviers qui réduisent votre facture OpenAI ou Claude — classés par impact. La plupart des équipes laissent les deux premiers de côté.
Les factures LLM explosent pour des raisons banales : le mauvais modèle sur des tâches faciles, une sortie sans plafond, le même contexte renvoyé sans cache à chaque appel. Rien de tout cela n'exige d'accepter de moins bonnes réponses. Voici où va vraiment l'argent, le plus grand levier d'abord.
C'est de loin le plus grand levier, et il est gratuit. Les modèles de pointe sont tarifés pour du travail de pointe ; la plupart des appels en production n'en sont pas. Les tarifs de Claude couvrent une plage de 5× en entrée et en sortie :
| Modèle | Entrée / 1M | Sortie / 1M | Idéal pour |
|---|---|---|---|
| Haiku 4.5 | $1 | $5 | classification, extraction, routage, chat simple |
| Sonnet 4.6 | $3 | $15 | la plupart des charges de production, équilibré |
| Opus 4.8 | $5 | $25 | raisonnement difficile, agents, travail à long horizon |
Router vos appels à fort volume et faible difficulté vers Haiku plutôt qu'Opus, c'est une réduction de coût de 5× sur ces appels sans perte de qualité — car ils n'ont jamais eu besoin d'Opus. Réservez le modèle coûteux aux requêtes qui font réellement bouger votre métrique de qualité. (Pas sûr du choix ? Voir quel modèle Claude utiliser.)
Si chaque requête renvoie le même gros system prompt, les mêmes exemples few-shot ou le même document, vous payez le plein tarif d'entrée pour des tokens identiques. La mise en cache des prompts facture le préfixe en cache à environ 10 % du prix d'entrée normal sur un hit. Pour un agent avec un préambule fixe de 10k tokens, c'est l'essentiel de votre coût d'entrée qui disparaît.
Le hic, c'est que le cache est une correspondance de préfixe : un octet modifié n'importe où dans le préfixe invalide tout ce qui suit. Tueurs de cache silencieux à auditer : un datetime.now() ou un UUID dans le system prompt, une sérialisation JSON non triée, ou une liste d'outils qui change à chaque requête. Vérifiez les hits avec le champ cache_read_input_tokens de la réponse — s'il est à zéro sur des appels à préfixe identique, quelque chose l'invalide.
La sortie coûte 3–5× plus que l'entrée par token, et un max_tokens sans limite laisse une seule réponse bavarde faire grimper la facture. Réglez un max_tokens adapté à la tâche — un classifieur a besoin de 50 tokens, pas de 4 000. Si vous avez activé la réflexion étendue/adaptative, rappelez-vous que ces tokens de raisonnement sont aussi facturés comme sortie.
Les tokens d'entrée, c'est de l'argent réel, et "fourrer tout le document dedans" est le gaspillage le plus courant. Récupérez et envoyez seulement les morceaux pertinents plutôt que tout le corpus. Élaguez l'historique de conversation (ou résumez-le) une fois long. Chaque 10k tokens que vous n'envoyez pas à Opus, c'est $0,05 que vous gardez, par appel.
Si une charge n'a pas besoin de réponse instantanée — classification de nuit, résumé en masse, évaluations — la Batch API exécute les mêmes requêtes avec 50 % de remise, généralement terminées en une heure. Tout ce qui tolère la latence devrait passer par là.
Faites de "bon marché" la valeur par défaut et escaladez délibérément, pas l'inverse. Un routeur simple — essayer le modèle bon marché, ne basculer vers un plus puissant que si la tâche l'exige — capte automatiquement l'essentiel du levier 1.
→ Modélisez les économies. Le calculateur de marge / coût gratuit vous laisse saisir un modèle, une taille de prompt et un prix pour voir le coût exact par appel — comparez Haiku vs Opus sur vos vrais chiffres en quelques secondes.Aucun de ces leviers ne troque la qualité contre le coût — ils arrêtent de payer des prix de pointe pour du travail qui ne l'est pas et de payer deux fois les mêmes tokens. Mesurez d'abord (connaissez votre coût par appel), puis actionnez les leviers dans l'ordre.
→ Ou payez seulement à l'appel. Clawy sert GPT-5.5, Claude Opus 4.8 et un niveau auto à $0,04 optimisé en coût via x402 — USDC par requête, sans clé API, sans abonnement. Démarrage rapide de 5 minutes → → Obtenez le Kit de tarification d'API d'IA (19 €). Un modèle coût/marge Excel, un calculateur hors ligne, du codemargin-guard prêt à l'emploi qui plafonne les prompts trop gros avant qu'ils ne vous coûtent, et un démarrage rapide — en bundle.