Calculadora de costes de la API de Gemini
Gemini cachea de forma implícita los prefijos de prompt repetidos. En nuestros datos no hay tarifa de escritura en caché: la primera solicitud paga la entrada normal y los aciertos posteriores se cobran a 10% del precio de entrada. La caché solo actúa por encima de una longitud mínima (4,096 tokens donde nuestros datos la indican), así que los prompts cortos nunca tienen descuento, y no se puede forzar un acierto. Google también vende cachés explícitas con una tarifa de almacenamiento por hora; aquí no se calculan.
La Batch API quita 50% a la entrada y 50% a la salida, pero los tokens en caché dentro de un batch cuestan 50%–100% de la tarifa normal en caché según el modelo, así que Batch y caché no siempre se suman. Las tarifas de contexto largo se aplican por encima de 200K en Gemini 3.1 Pro Preview y 2 más (entrada 2×, salida 1.5×), a toda la solicitud; los modelos que no aparecen ahí cobran igual a cualquier longitud.
La tabla calcula una misma carga en cada modelo: 10,000 solicitudes al día con 6,000 tokens de entrada y 500 de salida por solicitud. Columnas: sin caché; 70% de la entrada leída de la caché y 5% escrita en ella; todas las solicitudes por la Batch API. Con el mismo tráfico, Gemini 3.1 Pro Preview cuesta 8× lo que Gemini 3.1 Flash Lite.
| Modelo | Estándar 10,000 sol./día · 6,000 entrada · 500 salida Calcula con tus cifras → | Con prompt caching 10,000 sol./día · 6,000 entrada · 500 salida · caché 70% Calcula con tus cifras → | Batch API 10,000 sol./día · 6,000 entrada · 500 salida · batch Calcula con tus cifras → |
|---|---|---|---|
| Gemini 3.5 Flash | $4,050/mes | $2,349/mes | $2,025/mes |
| Gemini 3.1 Pro Preview | $5,400/mes | $3,132/mes | $2,700/mes |
| Gemini 3.8 Flash | $1,912/mes | $1,062/mes | $956/mes |
| Gemini 3.5 Flash Lite | $915/mes | $575/mes | $458/mes |
| Gemini 3.1 Flash Lite | $675/mes | $392/mes | $338/mes |
Estimaciones con tarifas por token publicadas; verifica los precios oficiales antes de presupuestar. Datos sincronizados de la lista de precios de LiteLLM el 2026-10-08.
¿Cuándo compensa la caché con tu tráfico? Usa la calculadora de caché →
Preguntas frecuentes
¿Pago por escribir en la caché implícita de Gemini?
No según nuestros datos: un fallo se cobra como entrada normal y los aciertos a la tarifa en caché. Pon la parte común al principio del prompt y envía las solicitudes parecidas juntas para subir la tasa de aciertos.
¿Qué modelos Gemini cobran más por prompts largos?
Solo los modelos citados arriba en la frase de contexto largo; en nuestros datos el resto cobra igual a cualquier longitud. Por encima del umbral, toda la solicitud usa las tarifas altas de entrada y salida.
¿Batch sale más barato que la caché en Gemini?
Con prompts únicos, Batch ahorra más. Con prompts que comparten un prefijo largo, la caché ahorra más en la entrada. Usa ambos cuando puedas, pero revisa la tarifa en caché dentro del batch, que no tiene descuento extra en todos los modelos.