LLM API 비용 계산기
프리셋을 고르고 트래픽을 조정하면 각 모델의 실제 캐시·Batch·롱컨텍스트 요율로 월 비용이 즉시 다시 계산됩니다. 모델을 체크해 비교하거나 링크를 공유하면 같은 결과를 그대로 재현할 수 있습니다.
| 비교 | 모델 | 월 비용 | 절감액 | 요청 1천 건당 | 입력 /1M | 출력 /1M | 캐시 입력 /1M | 제공사 | 참고 |
|---|
공개된 토큰 단가 기반 추정치입니다. 예산을 세우기 전에 공식 가격을 확인하세요. LiteLLM 가격 목록 동기화 2026-10-07.
구독 서비스라면 AI API 비용 차감 후 마진도 확인해 보세요.
계산 방식
요청 1건 = 캐시 안 된 입력 × 입력 가격 + 캐시 읽기 × 캐시 읽기 가격 + 캐시 쓰기 × 캐시 쓰기 가격(자동 캐싱 제공사는 일반 입력 가격) + 출력 × 출력 가격. 프롬프트가 모델의 롱컨텍스트 기준을 넘으면 요청 전체에 롱컨텍스트 요율을 적용합니다. Batch 요청은 공개된 Batch 요율을 씁니다. 캐시 유지 시간(TTL), 추론 토큰, 도구 호출에 따라 실제 청구액이 달라지므로 추정치로 보세요.
자주 묻는 질문
캐시 입력은 더 저렴한가요?
네. 프롬프트 캐시에서 읽은 입력 토큰은 일반 입력 가격의 일부(보통 10%)만 청구됩니다. Anthropic 등 일부 공급자는 캐시 생성(write)에 별도 요금을 부과합니다. 해당 모델에 공개된 cache-write 요율이 있으면 이 계산기는 이를 예상 비용에 반영합니다.
Batch 옵션은 무엇인가요?
Batch 비율은 Batch API(비동기, 보통 24시간 이내)로 보내는 요청의 비율입니다. 해당 요청에는 모델별로 공개된 Batch 입력·출력·캐시 요율이 적용됩니다. Batch 가격이 없는 모델은 일반 가격으로 계산하고 "Batch 없음"으로 표시합니다.
실제 청구액이 다른 이유는?
추론 모델은 보이지 않는 사고 토큰을 출력으로 청구하고, 긴 프롬프트는 롱컨텍스트 할증이 붙을 수 있으며, 도구 호출도 토큰을 추가합니다. 결과는 추정치로 보세요.