Clawy / 指南 / 削减 LLM API 成本
六个能降低你 OpenAI 或 Claude 账单的杠杆——按影响排序。大多数团队都没用上前两个。
LLM 账单暴涨的原因都很无聊:简单任务用错模型、输出没设上限、同样的上下文每次调用都不走缓存重发。这些都不需要你接受更差的回答。钱到底花在哪——最大的杠杆放在最前。
这是迄今最大的杠杆,而且免费。前沿模型的定价对应前沿工作;而大多数生产调用并非前沿工作。Claude 的标价在输入和输出上跨越 5× 的区间:
| 模型 | 输入 / 100万 | 输出 / 100万 | 适合 |
|---|---|---|---|
| Haiku 4.5 | $1 | $5 | 分类、抽取、路由、简单聊天 |
| Sonnet 4.6 | $3 | $15 | 大多数生产负载,均衡 |
| Opus 4.8 | $5 | $25 | 困难推理、智能体、长程任务 |
把你高频、低难度的调用路由到 Haiku 而非 Opus,对这些调用就是 5× 的成本削减且无质量损失——因为它们本就不需要 Opus。把贵模型留给真正影响你质量指标的请求。(不确定选哪个?见该用哪个 Claude 模型。)
如果每个请求都重发同样的大 system prompt、few-shot 示例或文档,你就在为相同的 token 付全额输入价。命中时,prompt 缓存对缓存前缀只收约 正常输入价的 10%。对一个有 1 万 token 固定前导的智能体来说,这能省掉你大部分输入成本。
陷阱在于缓存是前缀匹配:前缀中任何一处改动一个字节,其后的一切都会失效。需要排查的隐形缓存杀手:system prompt 里的 datetime.now() 或 UUID、未排序的 JSON 序列化,或每次请求都变的工具列表。用响应里的 cache_read_input_tokens 字段确认命中——如果在前缀相同的调用上它为零,就是有东西在让缓存失效。
按 token 算,输出比输入贵 3–5×,而不设上限的 max_tokens 会让一个话痨回答把账单拉高。设一个与任务匹配的 max_tokens——分类器需要 50 个 token,而不是 4,000。如果你启用了扩展/自适应思考,记住那些推理 token 也按输出计费。
输入 token 是真金白银,而"把整篇文档塞进去"是最常见的浪费。检索并只发送相关片段,而不是整个语料。对话历史一长就裁剪(或摘要)。每 1 万个你没发给 Opus 的 token,每次调用你就省下 $0.05。
如果某个工作负载不需要即时回答——夜间分类、批量摘要、评测——Batch API 以 5 折运行相同请求,通常一小时内完成。凡是能容忍延迟的都应该走它。
把"便宜"设为默认,再有意识地升级,而不是反过来。一个简单的路由器——先试便宜模型,只有任务需要时才回退到更强的——会自动拿下杠杆 1 的大部分收益。
→ 算一算能省多少。免费的利润率 / 成本计算器让你输入模型、prompt 大小和价格,看到每次调用的精确成本——几秒内用你的真实数字对比 Haiku 与 Opus。这些没有一个是用质量换成本——它们只是不再为非前沿工作付前沿价格、不再为同样的 token 付两次。先测量(知道你的单次成本),再按顺序拉动这些杠杆。
→ 或者只按次付费。Clawy 通过 x402 提供 GPT-5.5、Claude Opus 4.8,以及成本优化的 $0.04 auto 层——按请求用 USDC 付费,无需 API 密钥、无订阅。5 分钟快速开始 → → 获取 AI API 定价工具包(€19)。Excel 成本/利润率模型、离线计算器、即插即用的margin-guard 代码(在超大 prompt 让你花钱前就设上限),以及快速开始——打包提供。