提示缓存价格与节省
当大量请求以相同的长前缀开头(系统提示、工具定义、共享文档)时,提供商可以缓存它,并按低得多的缓存输入价格计费。聊天机器人和 Agent 循环每轮都会重发相同上下文,因此受益最大。
常见问题
写入缓存要额外收费吗?
部分模型(以 Anthropic 为主)在首次缓存前缀时收取溢价(模型页面中的“缓存写入”)。未公布 cache-write 价格的模型会自动缓存,计算器按常规输入价计算这些写入。
缓存的提示能保留多久?
通常几分钟(常见约 5 分钟),除非被新请求刷新;部分提供商出售更长的缓存时长。
现实的缓存命中率是多少?
Agent 循环和多轮对话常能达到输入 Token 的 50–80%;每次文档都不同的一次性请求接近 0%。