Calculadora de costes de APIs LLM

Elige un preset, ajusta tu tráfico y el coste mensual de cada modelo se actualiza al instante con sus tarifas reales de caché, batch y contexto largo. Marca modelos para compararlos o comparte el enlace para reproducir el resultado.

CompararModelo Coste mensualAhorroPor 1K solicitudes Entrada /1MSalida /1MEntrada en caché /1M ProveedorNotas

Estimaciones con tarifas por token publicadas; verifica los precios oficiales antes de presupuestar. Datos sincronizados de la lista de precios de LiteLLM el 2026-10-07.

¿Vendes una suscripción? Mira tu margen tras el coste de la API de IA.

Cómo se calcula

Por solicitud: entrada sin caché × precio de entrada + lecturas de caché × precio de lectura + escrituras en caché × precio de escritura (precio de entrada normal en proveedores con caché automática) + salida × precio de salida. Si el prompt supera el umbral de contexto largo, toda la solicitud usa esas tarifas. Las solicitudes batch usan tarifas batch publicadas. Son estimaciones: la duración de la caché (TTL), los tokens de razonamiento y las herramientas cambian la factura real.

Preguntas frecuentes

¿La entrada en caché cuesta menos?

Sí. Los tokens leídos de la caché se cobran a una fracción del precio normal, a menudo el 10%. Algunos proveedores, como Anthropic, también cobran aparte por escribir en caché. Si el modelo tiene una tarifa de cache-write publicada, esta calculadora la incluye en la estimación.

¿Qué hace la opción batch?

La proporción batch es el porcentaje de solicitudes que envías por una Batch API (asíncrona, normalmente en 24 horas). Esas solicitudes usan las tarifas batch publicadas de cada modelo. Los modelos sin precio batch mantienen el precio normal y se marcan como "sin batch".

¿Por qué mi factura real es distinta?

Los modelos de razonamiento cobran tokens de pensamiento ocultos como salida, los prompts largos pueden activar tarifas de contexto largo y las llamadas a herramientas añaden tokens. Tómalo como estimación.