Clawy / Guides / LLM-API-Kosten senken
Sechs Hebel, die deine OpenAI- oder Claude-Rechnung senken — nach Wirkung geordnet. Die meisten Teams lassen die ersten beiden liegen.
LLM-Rechnungen explodieren aus banalen Gründen: das falsche Modell für einfache Aufgaben, unbegrenzter Output, derselbe Kontext bei jedem Call uncached neu gesendet. Nichts davon erfordert schlechtere Antworten. Hier geht das Geld wirklich hin, der größte Hebel zuerst.
Das ist der mit Abstand größte Hebel, und er ist gratis. Frontier-Modelle sind für Frontier-Arbeit bepreist; die meisten Produktiv-Calls sind keine Frontier-Arbeit. Claudes Listenpreise umfassen eine 5×-Spanne bei Input und Output:
| Modell | Input / 1 Mio. | Output / 1 Mio. | Gut für |
|---|---|---|---|
| Haiku 4.5 | $1 | $5 | Klassifizierung, Extraktion, Routing, einfacher Chat |
| Sonnet 4.6 | $3 | $15 | die meisten Produktiv-Workloads, ausgewogen |
| Opus 4.8 | $5 | $25 | schweres Reasoning, Agenten, Long-Horizon-Arbeit |
Deine hochvolumigen, einfachen Calls auf Haiku statt Opus zu routen, ist eine 5×-Kostensenkung bei diesen Calls ohne Qualitätsverlust — weil sie Opus nie gebraucht haben. Reserviere das teure Modell für die Anfragen, die deine Qualitätsmetrik tatsächlich bewegen. (Unsicher, welches? Siehe welches Claude-Modell du nutzen solltest.)
Wenn jede Anfrage denselben großen System-Prompt, dieselben Few-Shot-Beispiele oder dasselbe Dokument neu sendet, zahlst du den vollen Input-Preis für identische Tokens. Prompt-Caching berechnet das gecachte Präfix bei einem Treffer mit rund 10 % des normalen Input-Preises. Für einen Agenten mit 10k-Token-Fixpräambel ist das der Großteil deiner Input-Kosten weg.
Der Haken: Caching ist ein Präfix-Match: Eine Byte-Änderung irgendwo im Präfix macht alles danach ungültig. Stille Cache-Killer zum Prüfen: ein datetime.now() oder eine UUID im System-Prompt, unsortierte JSON-Serialisierung oder eine Tool-Liste, die sich pro Anfrage ändert. Prüfe Treffer mit dem Feld cache_read_input_tokens in der Antwort — ist es bei präfix-gleichen Calls null, invalidiert etwas den Cache.
Output kostet pro Token 3–5× mehr als Input, und ein unbegrenztes max_tokens lässt eine einzige geschwätzige Antwort die Rechnung hochtreiben. Setze ein max_tokens, das zur Aufgabe passt — ein Klassifizierer braucht 50 Tokens, nicht 4.000. Wenn du Extended/Adaptive Thinking aktiviert hast, denk daran, dass diese Reasoning-Tokens auch als Output abgerechnet werden.
Input-Tokens sind echtes Geld, und "das ganze Dokument reinstopfen" ist die häufigste Verschwendung. Hol und sende nur die relevanten Chunks statt des ganzen Korpus. Kürze den Gesprächsverlauf (oder fasse ihn zusammen), sobald er lang wird. Jede 10k Tokens, die du nicht an Opus sendest, sind $0,05, die du behältst — pro Call.
Wenn ein Workload keine sofortige Antwort braucht — nächtliche Klassifizierung, Massen-Zusammenfassung, Evals — führt die Batch-API dieselben Anfragen mit 50 % Rabatt aus, typischerweise innerhalb einer Stunde fertig. Alles, was Latenz verträgt, sollte darüber laufen.
Mach "günstig" zum Standard und eskaliere bewusst, nicht umgekehrt. Ein einfacher Router — das günstige Modell versuchen, nur bei Bedarf auf ein stärkeres zurückfallen — fängt den Großteil von Hebel 1 automatisch ein.
→ Modelliere die Ersparnis. Mit dem kostenlosen Margen-/Kosten-Rechner gibst du Modell, Promptgröße und Preis ein und siehst die exakten Kosten pro Call — vergleiche Haiku vs. Opus mit deinen echten Zahlen in Sekunden.Keiner dieser Hebel tauscht Qualität gegen Kosten — sie hören auf, Frontier-Preise für Nicht-Frontier-Arbeit zu zahlen, und hören auf, zweimal für dieselben Tokens zu zahlen. Miss zuerst (kenne deine Kosten pro Call), dann zieh die Hebel der Reihe nach.
→ Oder zahl nur pro Call. Clawy bietet GPT-5.5, Claude Opus 4.8 und eine kostenoptimierte $0,04-Auto-Stufe über x402 — USDC pro Anfrage, keine API-Keys, kein Abo. 5-Minuten-Schnellstart → → Hol dir das AI-API-Pricing-Kit (19 €). Ein Excel-Kosten-/Margen-Modell, ein Offline-Rechner, einsetzbarermargin-guard-Code, der übergroße Prompts begrenzt, bevor sie dich kosten, und ein Schnellstart — als Bundle.