Gemini API 费用计算器
Gemini 会隐式缓存重复的提示前缀。我们的数据中没有缓存写入费:首次请求按普通输入计费,之后的命中按输入价的 10% 计费。缓存只在提示超过最小长度后才生效(数据中有该值的模型为 4,096 Token),短提示拿不到折扣,也无法强制命中。Google 还提供按小时收存储费的显式缓存,这里未计入。
Batch API 输入减 50%、输出减 50%,但 Batch 中的缓存 Token 因模型不同为常规缓存价的 50%–100%,所以 Batch 与缓存折扣并不总能叠加。长上下文费率适用于 Gemini 3.1 Pro Preview 等另外 2 个模型 超过 200K 时(输入 2×,输出 1.5×),且作用于整个请求;未列出的模型在任何提示长度下价格相同。
下表按同一工作负载计算各模型费用:每天 10,000 次请求,每次输入 6,000 Token、输出 500 Token。三列依次为:不使用缓存;70% 的输入从缓存读取、5% 写入缓存;全部请求走 Batch API。同样的流量下,Gemini 3.1 Pro Preview 的费用是 Gemini 3.1 Flash Lite 的 8 倍。
| 模型 | 标准 每天 10,000 次 · 输入 6,000 · 输出 500 用你的数据计算 → | 使用提示缓存 每天 10,000 次 · 输入 6,000 · 输出 500 · 缓存 70% 用你的数据计算 → | Batch API 每天 10,000 次 · 输入 6,000 · 输出 500 · batch 用你的数据计算 → |
|---|---|---|---|
| Gemini 3.5 Flash | $4,050/月 | $2,349/月 | $2,025/月 |
| Gemini 3.1 Pro Preview | $5,400/月 | $3,132/月 | $2,700/月 |
| Gemini 3.8 Flash | $1,912/月 | $1,062/月 | $956/月 |
| Gemini 3.5 Flash Lite | $915/月 | $575/月 | $458/月 |
| Gemini 3.1 Flash Lite | $675/月 | $392/月 | $338/月 |
基于公开的 Token 单价估算;做预算前请核对官方价格。 数据于 2026-10-08 从 LiteLLM 价格表同步.
常见问题
写入 Gemini 隐式缓存要付费吗?
在我们的数据中不需要:未命中按普通输入计费,命中按缓存价计费。把共享部分放在提示开头,并让相似请求集中发送,可以提高命中率。
哪些 Gemini 模型对长提示加价?
只有上文长上下文说明中列出的模型;在我们的数据中,其余模型在任何提示长度下价格相同。超过阈值后,整个请求按更高的输入和输出价格计费。
Gemini 的 Batch 比缓存更便宜吗?
对于各不相同的提示,Batch 更省钱;对于共享长前缀的提示,缓存在输入上更省钱。能同时用就同时用,但要核对 Batch 内的缓存价格,并非每个模型都会再打折。