Coste de API de una app RAG
En una app RAG casi todos los tokens son de entrada: cada pregunta lleva los fragmentos recuperados, así que en nuestro ejemplo una solicitud tiene 8,000 tokens de entrada y solo 600 de salida, con 2,000 preguntas al día. Solo la parte estable (instrucciones y pasajes recuperados a menudo) se puede cachear; suponemos un 30% leído de la caché. Convertir tus documentos en vectores es un coste aparte y casi siempre puntual: mira los precios de embeddings.
Enviar documentos enteros en vez de fragmentos top-k cambia la factura por completo. Con prompts de 300,000 tokens, Claude Haiku 5.5 pasa de $66.00 a $9,090 al mes, porque por encima de 100K tokens toda la solicitud se cobra a su tarifa de contexto largo; cachear el 80% del documento, como en una app de chat con tus archivos donde se hacen varias preguntas sobre el mismo archivo, lo deja en $2,722. Con documentos enteros, el modelo más barato aquí pasa a ser MiMo V2.6 Flash, con $2,530.
La tabla muestra los modelos actuales más baratos en cada escenario; los modelos con ventana de contexto demasiado pequeña quedan fuera de las columnas de documento entero. Umbrales por modelo: precios de contexto largo.
| Modelo | Recuperación top-k 2,000 sol./día · 8,000 entrada · 600 salida Calcula con tus cifras → | Top-k + caché 2,000 sol./día · 8,000 entrada · 600 salida · caché 30% Calcula con tus cifras → | Documento entero 2,000 sol./día · 300,000 entrada · 600 salida Calcula con tus cifras → | Documento entero + caché 2,000 sol./día · 300,000 entrada · 600 salida · caché 80% Calcula con tus cifras → |
|---|---|---|---|---|
| Claude Haiku 5.5 | $66.00/mes | $53.64/mes | $9,090/mes tarifa contexto largo | $2,722/mes tarifa contexto largo |
| GPT-6 Luna | $66.00/mes | $53.64/mes | $3,627/mes tarifa contexto largo | $1,080/mes tarifa contexto largo |
| MiMo V2.6 Flash | $77.28/mes | $57.52/mes | $2,530/mes | $554/mes |
| Qwen3.8 Flash | $88.92/mes | $70.82/mes | $2,717/mes | $832/mes |
| GLM-5.3 Flash | $90.00/mes | $72.72/mes | $2,718/mes | $990/mes |
Estimaciones con tarifas por token publicadas; verifica los precios oficiales antes de presupuestar. Datos sincronizados de la lista de precios de LiteLLM el 2026-10-08.
Preguntas frecuentes
¿Cuántos fragmentos debo recuperar?
Los menos que mantengan las respuestas correctas. Cada fragmento extra se cobra en cada pregunta, así que cuatro veces más fragmentos es más o menos cuatro veces la parte recuperada de la entrada. Mide la calidad con varios valores de k antes de decidir.
¿Un modelo de contexto largo sale más barato que RAG?
Pocas veces a escala. Enviar un documento entero cuesta mucha más entrada por pregunta que unos pocos fragmentos, y algunos modelos cobran más por encima de un umbral de tamaño. Puede tener sentido con poco tráfico o cuando el mismo documento se cachea y se consulta muchas veces.