프롬프트 캐싱 가격과 절감액
여러 요청이 같은 긴 앞부분(시스템 프롬프트, 도구 정의, 공통 문서)으로 시작하면 제공사가 이를 캐시하고 훨씬 낮은 캐시 입력 가격으로 청구합니다. 매 턴마다 같은 컨텍스트를 다시 보내는 챗봇과 에이전트가 가장 큰 효과를 봅니다.
자주 묻는 질문
캐시 쓰기에 추가 비용이 있나요?
Anthropic을 중심으로 일부 모델은 앞부분을 처음 캐시할 때 할증(모델 페이지의 캐시 쓰기)을 받습니다. 공개된 cache-write 요율이 없는 모델은 자동으로 캐시하며, 계산기는 이 쓰기를 일반 입력 가격으로 계산합니다.
캐시는 얼마나 유지되나요?
새 요청으로 갱신되지 않으면 보통 몇 분(대개 5분 안팎)입니다. 더 긴 캐시 유지 시간을 유료로 제공하는 곳도 있습니다.
현실적인 캐시 적중률은?
에이전트 루프와 여러 턴의 대화는 입력 토큰의 50~80%에 이르기도 하고, 매번 다른 문서를 보내는 단발 요청은 0%에 가깝습니다.