Coste de API de una app RAG

En una app RAG casi todos los tokens son de entrada: cada pregunta lleva los fragmentos recuperados, así que en nuestro ejemplo una solicitud tiene 8,000 tokens de entrada y solo 600 de salida, con 2,000 preguntas al día. Solo la parte estable (instrucciones y pasajes recuperados a menudo) se puede cachear; suponemos un 30% leído de la caché. Convertir tus documentos en vectores es un coste aparte y casi siempre puntual: mira los precios de embeddings.

Enviar documentos enteros en vez de fragmentos top-k cambia la factura por completo. Con prompts de 300,000 tokens, Claude Haiku 5.5 pasa de $66.00 a $9,090 al mes, porque por encima de 100K tokens toda la solicitud se cobra a su tarifa de contexto largo; cachear el 80% del documento, como en una app de chat con tus archivos donde se hacen varias preguntas sobre el mismo archivo, lo deja en $2,722. Con documentos enteros, el modelo más barato aquí pasa a ser MiMo V2.6 Flash, con $2,530.

La tabla muestra los modelos actuales más baratos en cada escenario; los modelos con ventana de contexto demasiado pequeña quedan fuera de las columnas de documento entero. Umbrales por modelo: precios de contexto largo.

ModeloRecuperación top-k
2,000 sol./día · 8,000 entrada · 600 salida
Calcula con tus cifras →
Top-k + caché
2,000 sol./día · 8,000 entrada · 600 salida · caché 30%
Calcula con tus cifras →
Documento entero
2,000 sol./día · 300,000 entrada · 600 salida
Calcula con tus cifras →
Documento entero + caché
2,000 sol./día · 300,000 entrada · 600 salida · caché 80%
Calcula con tus cifras →
Claude Haiku 5.5$66.00/mes$53.64/mes$9,090/mes
tarifa contexto largo
$2,722/mes
tarifa contexto largo
GPT-6 Luna$66.00/mes$53.64/mes$3,627/mes
tarifa contexto largo
$1,080/mes
tarifa contexto largo
MiMo V2.6 Flash$77.28/mes$57.52/mes$2,530/mes$554/mes
Qwen3.8 Flash$88.92/mes$70.82/mes$2,717/mes$832/mes
GLM-5.3 Flash$90.00/mes$72.72/mes$2,718/mes$990/mes

Estimaciones con tarifas por token publicadas; verifica los precios oficiales antes de presupuestar. Datos sincronizados de la lista de precios de LiteLLM el 2026-10-08.

Preguntas frecuentes

¿Cuántos fragmentos debo recuperar?

Los menos que mantengan las respuestas correctas. Cada fragmento extra se cobra en cada pregunta, así que cuatro veces más fragmentos es más o menos cuatro veces la parte recuperada de la entrada. Mide la calidad con varios valores de k antes de decidir.

¿Un modelo de contexto largo sale más barato que RAG?

Pocas veces a escala. Enviar un documento entero cuesta mucha más entrada por pregunta que unos pocos fragmentos, y algunos modelos cobran más por encima de un umbral de tamaño. Puede tener sentido con poco tráfico o cuando el mismo documento se cachea y se consulta muchas veces.