RAG 应用 API 费用

RAG 应用中几乎所有 Token 都是输入:每个问题都带着检索到的片段,所以在示例中每天 2,000 个问题,每次请求输入 8,000 Token,输出只有 600 Token。只有稳定的部分(指令和经常被检索的段落)能缓存,我们假设 30% 从缓存读取。把文档转成向量是另一笔、基本是一次性的费用:见 Embedding 价格。

改为发送整篇文档而不是 top-k 片段,账单会完全不同。提示为 300,000 Token 时,Claude Haiku 5.5 每月从 $66.00 涨到 $9,090(因为超过 100K Token 后整个请求按长上下文费率计费);像“和文件对话”这类用户针对同一文件多次提问的应用,缓存文档的 80% 后降到 $2,722。发送整篇文档时,这里最便宜的模型变成 MiMo V2.6 Flash($2,530)。

下表列出每个场景下当前最便宜的模型;上下文窗口不够大的模型不参与整篇文档两列。各模型阈值见长上下文价格。

模型Top-k 检索
每天 2,000 次 · 输入 8,000 · 输出 600
用你的数据计算 →
Top-k + 缓存
每天 2,000 次 · 输入 8,000 · 输出 600 · 缓存 30%
用你的数据计算 →
整篇文档
每天 2,000 次 · 输入 300,000 · 输出 600
用你的数据计算 →
整篇文档 + 缓存
每天 2,000 次 · 输入 300,000 · 输出 600 · 缓存 80%
用你的数据计算 →
Claude Haiku 5.5$66.00/月$53.64/月$9,090/月
长上下文费率
$2,722/月
长上下文费率
GPT-6 Luna$66.00/月$53.64/月$3,627/月
长上下文费率
$1,080/月
长上下文费率
MiMo V2.6 Flash$77.28/月$57.52/月$2,530/月$554/月
Qwen3.8 Flash$88.92/月$70.82/月$2,717/月$832/月
GLM-5.3 Flash$90.00/月$72.72/月$2,718/月$990/月

基于公开的 Token 单价估算;做预算前请核对官方价格。 数据于 2026-10-08 从 LiteLLM 价格表同步.

常见问题

应该检索多少个片段?

在保证答案正确的前提下越少越好。每多一个片段,每个问题都要为它付费,片段数变为 4 倍,输入中的检索部分也大约变为 4 倍。先用几个不同的 k 值测量答案质量再做决定。

长上下文模型比 RAG 便宜吗?

规模大时很少如此。发送整篇文档时,每个问题的输入远多于几个检索片段,部分模型超过长度阈值后还会提高费率。流量小,或同一文档被缓存后反复提问时,才可能划算。