Gemini API 费用计算器

Gemini 会隐式缓存重复的提示前缀。我们的数据中没有缓存写入费:首次请求按普通输入计费,之后的命中按输入价的 10% 计费。缓存只在提示超过最小长度后才生效(数据中有该值的模型为 4,096 Token),短提示拿不到折扣,也无法强制命中。Google 还提供按小时收存储费的显式缓存,这里未计入。

Batch API 输入减 50%、输出减 50%,但 Batch 中的缓存 Token 因模型不同为常规缓存价的 50%–100%,所以 Batch 与缓存折扣并不总能叠加。长上下文费率适用于 Gemini 3.1 Pro Preview 等另外 2 个模型 超过 200K 时(输入 2×,输出 1.5×),且作用于整个请求;未列出的模型在任何提示长度下价格相同。

下表按同一工作负载计算各模型费用:每天 10,000 次请求,每次输入 6,000 Token、输出 500 Token。三列依次为:不使用缓存;70% 的输入从缓存读取、5% 写入缓存;全部请求走 Batch API。同样的流量下,Gemini 3.1 Pro Preview 的费用是 Gemini 3.1 Flash Lite 的 8 倍。

模型标准
每天 10,000 次 · 输入 6,000 · 输出 500
用你的数据计算 →
使用提示缓存
每天 10,000 次 · 输入 6,000 · 输出 500 · 缓存 70%
用你的数据计算 →
Batch API
每天 10,000 次 · 输入 6,000 · 输出 500 · batch
用你的数据计算 →
Gemini 3.5 Flash$4,050/月$2,349/月$2,025/月
Gemini 3.1 Pro Preview$5,400/月$3,132/月$2,700/月
Gemini 3.8 Flash$1,912/月$1,062/月$956/月
Gemini 3.5 Flash Lite$915/月$575/月$458/月
Gemini 3.1 Flash Lite$675/月$392/月$338/月

基于公开的 Token 单价估算;做预算前请核对官方价格。 数据于 2026-10-08 从 LiteLLM 价格表同步.

你的流量下缓存何时划算?试试提示缓存计算器 →

常见问题

写入 Gemini 隐式缓存要付费吗?

在我们的数据中不需要:未命中按普通输入计费,命中按缓存价计费。把共享部分放在提示开头,并让相似请求集中发送,可以提高命中率。

哪些 Gemini 模型对长提示加价?

只有上文长上下文说明中列出的模型;在我们的数据中,其余模型在任何提示长度下价格相同。超过阈值后,整个请求按更高的输入和输出价格计费。

Gemini 的 Batch 比缓存更便宜吗?

对于各不相同的提示,Batch 更省钱;对于共享长前缀的提示,缓存在输入上更省钱。能同时用就同时用,但要核对 Batch 内的缓存价格,并非每个模型都会再打折。