LLM API 费用计算器
选择预设并调整流量,所有模型的月度费用会按各自真实的缓存、Batch 和长上下文费率即时更新。勾选模型即可对比,分享链接可复现相同结果。
| 对比 | 模型 | 每月费用 | 节省 | 每 1K 次请求 | 输入 /1M | 输出 /1M | 缓存输入 /1M | 提供商 | 备注 |
|---|
基于公开的 Token 单价估算;做预算前请核对官方价格。 数据于 2026-10-07 从 LiteLLM 价格表同步.
在卖订阅?看看扣除 AI API 成本后的利润。
估算方法
每次请求 = 未缓存输入 × 输入价 + 缓存读取 × 缓存读取价 + 缓存写入 × 缓存写入价(自动缓存的提供商按常规输入价)+ 输出 × 输出价。提示超过模型的长上下文阈值时,整个请求按长上下文费率计费。Batch 请求使用公布的 Batch 费率。结果为估算:缓存时长(TTL)、推理 Token 和工具调用都会影响实际账单。
常见问题
缓存输入更便宜吗?
是的。从提示缓存读取的输入 Token 只按常规输入价格的一小部分计费,通常为 10%。Anthropic 等部分提供商还会对写入缓存单独收费;若模型公布了 cache-write 价格,本计算器会将其计入估算。
Batch 开关有什么作用?
Batch 比例是通过 Batch API(异步,通常 24 小时内)发送的请求占比。这些请求使用各模型公布的 Batch 输入、输出和缓存费率。没有 Batch 价格的模型按常规价格计算,并标注“无 Batch”。
为什么实际账单不同?
推理模型会把隐藏的思考 Token 按输出计费,长提示可能触发更高的长上下文价格,工具调用也会增加 Token。请将结果视为估算。