Coste mensual de API de un chatbot de IA

Un asistente de chat reenvía el prompt de sistema y la conversación previa en cada mensaje, así que la entrada se acumula aunque cada respuesta sea corta. Suponemos 4 mensajes por conversación, cada uno una solicitud con 1,200 tokens de entrada y 400 de salida, donde el 60% de la entrada es un prefijo en caché (instrucciones, fragmentos del centro de ayuda, turnos anteriores) y el 5% se escribe en la caché. Hay personas esperando la respuesta, así que la Batch API no sirve aquí.

El coste crece en línea recta con el tráfico. Con 100,000 conversaciones al día, MiMo V2.6 Flash sale a $2,175 al mes, unos $0.72 por cada 1.000 conversaciones: esa cifra por conversación es la que debes comparar con tu coste por ticket de soporte o tu precio de suscripción. Un prompt de sistema más largo o más artículos recuperados añaden entrada a cada mensaje, no una vez por conversación.

La tabla muestra los modelos actuales más baratos para esta carga. Cambia cualquier cifra en la calculadora o revisa tu margen por suscriptor.

Modelo1,000 conversaciones/día
4,000 sol./día · 1,200 entrada · 400 salida · caché 60%
Calcula con tus cifras →
10,000 conversaciones/día
40,000 sol./día · 1,200 entrada · 400 salida · caché 60%
Calcula con tus cifras →
100,000 conversaciones/día
400,000 sol./día · 1,200 entrada · 400 salida · caché 60%
Calcula con tus cifras →
MiMo V2.6 Flash$21.75/mes$217/mes$2,175/mes
Claude Haiku 5.5$30.80/mes$308/mes$3,080/mes
GPT-6 Luna$30.80/mes$308/mes$3,080/mes
Qwen3.8 Flash$32.94/mes$329/mes$3,294/mes
GLM-5.3 Flash$35.23/mes$352/mes$3,523/mes
Mistral Small (latest)$38.74/mes$387/mes$3,874/mes

Estimaciones con tarifas por token publicadas; verifica los precios oficiales antes de presupuestar. Datos sincronizados de la lista de precios de LiteLLM el 2026-10-08.

Preguntas frecuentes

¿Cuántos tokens tiene un mensaje de chat?

Una pregunta y respuesta cortas son unos cientos de tokens, pero la solicitud también lleva el prompt de sistema, artículos de ayuda recuperados y turnos anteriores. Registra el uso que devuelve tu API durante un día de tráfico real y pon las medias en la calculadora.

¿Cómo reduzco el coste de API de un chatbot?

Mantén fijos el prompt de sistema y las definiciones de herramientas al principio para que se cacheen, recorta o resume los turnos antiguos y envía las preguntas fáciles a un modelo pequeño, pasando solo las difíciles a uno grande.