RAG 앱 API 비용

RAG 앱의 토큰은 거의 모두 입력입니다. 질문마다 검색한 청크가 함께 가므로, 예시에서는 하루 2,000건의 질문에 요청당 입력 8,000 토큰, 출력은 600 토큰뿐입니다. 캐시할 수 있는 것은 바뀌지 않는 부분(지침, 자주 검색되는 구절)뿐이라 캐시 읽기를 30%로 가정했습니다. 문서를 벡터로 바꾸는 비용은 대부분 한 번만 드는 별도 비용입니다. 임베딩 가격을 참고하세요.

상위 k개 청크 대신 문서 전체를 보내면 비용이 완전히 달라집니다. 프롬프트가 300,000 토큰이면 Claude Haiku 5.5의 비용은 월 $66.00에서 $9,090로 늘어납니다 (요청이 100K 토큰을 넘어 전체가 롱컨텍스트 요율로 청구되기 때문입니다). 사용자가 같은 파일에 여러 번 질문하는 '파일과 대화' 앱처럼 문서의 80%를 캐시하면 $2,722로 줄어듭니다. 문서 전체를 보낼 때 여기서 가장 싼 모델은 MiMo V2.6 Flash($2,530)입니다.

표는 시나리오별로 가장 저렴한 현행 모델입니다. 컨텍스트 창이 작은 모델은 문서 전체 열에서 제외했습니다. 모델별 기준은 롱컨텍스트 가격에서 확인하세요.

모델상위 k개 검색
하루 2,000건 · 입력 8,000 · 출력 600
내 수치로 계산하기 →
상위 k개 + 캐싱
하루 2,000건 · 입력 8,000 · 출력 600 · 캐시 30%
내 수치로 계산하기 →
문서 전체
하루 2,000건 · 입력 300,000 · 출력 600
내 수치로 계산하기 →
문서 전체 + 캐싱
하루 2,000건 · 입력 300,000 · 출력 600 · 캐시 80%
내 수치로 계산하기 →
Claude Haiku 5.5$66.00/월$53.64/월$9,090/월
롱컨텍스트 요율
$2,722/월
롱컨텍스트 요율
GPT-6 Luna$66.00/월$53.64/월$3,627/월
롱컨텍스트 요율
$1,080/월
롱컨텍스트 요율
MiMo V2.6 Flash$77.28/월$57.52/월$2,530/월$554/월
Qwen3.8 Flash$88.92/월$70.82/월$2,717/월$832/월
GLM-5.3 Flash$90.00/월$72.72/월$2,718/월$990/월

공개된 토큰 단가 기반 추정치입니다. 예산을 세우기 전에 공식 가격을 확인하세요. LiteLLM 가격 목록 동기화 2026-10-08.

자주 묻는 질문

청크는 몇 개를 가져와야 하나요?

답이 정확한 범위에서 최소한으로 가져오세요. 청크가 늘면 모든 질문마다 그만큼 청구되므로, 청크를 4배로 늘리면 입력 중 검색 부분도 약 4배가 됩니다. 몇 가지 k 값으로 답변 품질을 재 보고 정하세요.

롱컨텍스트 모델이 RAG보다 싼가요?

규모가 크면 거의 그렇지 않습니다. 문서 전체를 보내면 질문마다 검색 청크 몇 개보다 훨씬 많은 입력을 내야 하고, 일부 모델은 일정 길이를 넘으면 더 높은 요율을 받습니다. 트래픽이 적거나 같은 문서를 캐시해 두고 여러 번 질문할 때는 맞을 수 있습니다.