RAG 앱 API 비용
RAG 앱의 토큰은 거의 모두 입력입니다. 질문마다 검색한 청크가 함께 가므로, 예시에서는 하루 2,000건의 질문에 요청당 입력 8,000 토큰, 출력은 600 토큰뿐입니다. 캐시할 수 있는 것은 바뀌지 않는 부분(지침, 자주 검색되는 구절)뿐이라 캐시 읽기를 30%로 가정했습니다. 문서를 벡터로 바꾸는 비용은 대부분 한 번만 드는 별도 비용입니다. 임베딩 가격을 참고하세요.
상위 k개 청크 대신 문서 전체를 보내면 비용이 완전히 달라집니다. 프롬프트가 300,000 토큰이면 Claude Haiku 5.5의 비용은 월 $66.00에서 $9,090로 늘어납니다 (요청이 100K 토큰을 넘어 전체가 롱컨텍스트 요율로 청구되기 때문입니다). 사용자가 같은 파일에 여러 번 질문하는 '파일과 대화' 앱처럼 문서의 80%를 캐시하면 $2,722로 줄어듭니다. 문서 전체를 보낼 때 여기서 가장 싼 모델은 MiMo V2.6 Flash($2,530)입니다.
표는 시나리오별로 가장 저렴한 현행 모델입니다. 컨텍스트 창이 작은 모델은 문서 전체 열에서 제외했습니다. 모델별 기준은 롱컨텍스트 가격에서 확인하세요.
| 모델 | 상위 k개 검색 하루 2,000건 · 입력 8,000 · 출력 600 내 수치로 계산하기 → | 상위 k개 + 캐싱 하루 2,000건 · 입력 8,000 · 출력 600 · 캐시 30% 내 수치로 계산하기 → | 문서 전체 하루 2,000건 · 입력 300,000 · 출력 600 내 수치로 계산하기 → | 문서 전체 + 캐싱 하루 2,000건 · 입력 300,000 · 출력 600 · 캐시 80% 내 수치로 계산하기 → |
|---|---|---|---|---|
| Claude Haiku 5.5 | $66.00/월 | $53.64/월 | $9,090/월 롱컨텍스트 요율 | $2,722/월 롱컨텍스트 요율 |
| GPT-6 Luna | $66.00/월 | $53.64/월 | $3,627/월 롱컨텍스트 요율 | $1,080/월 롱컨텍스트 요율 |
| MiMo V2.6 Flash | $77.28/월 | $57.52/월 | $2,530/월 | $554/월 |
| Qwen3.8 Flash | $88.92/월 | $70.82/월 | $2,717/월 | $832/월 |
| GLM-5.3 Flash | $90.00/월 | $72.72/월 | $2,718/월 | $990/월 |
공개된 토큰 단가 기반 추정치입니다. 예산을 세우기 전에 공식 가격을 확인하세요. LiteLLM 가격 목록 동기화 2026-10-08.
자주 묻는 질문
청크는 몇 개를 가져와야 하나요?
답이 정확한 범위에서 최소한으로 가져오세요. 청크가 늘면 모든 질문마다 그만큼 청구되므로, 청크를 4배로 늘리면 입력 중 검색 부분도 약 4배가 됩니다. 몇 가지 k 값으로 답변 품질을 재 보고 정하세요.
롱컨텍스트 모델이 RAG보다 싼가요?
규모가 크면 거의 그렇지 않습니다. 문서 전체를 보내면 질문마다 검색 청크 몇 개보다 훨씬 많은 입력을 내야 하고, 일부 모델은 일정 길이를 넘으면 더 높은 요율을 받습니다. 트래픽이 적거나 같은 문서를 캐시해 두고 여러 번 질문할 때는 맞을 수 있습니다.