RAG 应用 API 费用
RAG 应用中几乎所有 Token 都是输入:每个问题都带着检索到的片段,所以在示例中每天 2,000 个问题,每次请求输入 8,000 Token,输出只有 600 Token。只有稳定的部分(指令和经常被检索的段落)能缓存,我们假设 30% 从缓存读取。把文档转成向量是另一笔、基本是一次性的费用:见 Embedding 价格。
改为发送整篇文档而不是 top-k 片段,账单会完全不同。提示为 300,000 Token 时,Claude Haiku 5.5 每月从 $66.00 涨到 $9,090(因为超过 100K Token 后整个请求按长上下文费率计费);像“和文件对话”这类用户针对同一文件多次提问的应用,缓存文档的 80% 后降到 $2,722。发送整篇文档时,这里最便宜的模型变成 MiMo V2.6 Flash($2,530)。
下表列出每个场景下当前最便宜的模型;上下文窗口不够大的模型不参与整篇文档两列。各模型阈值见长上下文价格。
| 模型 | Top-k 检索 每天 2,000 次 · 输入 8,000 · 输出 600 用你的数据计算 → | Top-k + 缓存 每天 2,000 次 · 输入 8,000 · 输出 600 · 缓存 30% 用你的数据计算 → | 整篇文档 每天 2,000 次 · 输入 300,000 · 输出 600 用你的数据计算 → | 整篇文档 + 缓存 每天 2,000 次 · 输入 300,000 · 输出 600 · 缓存 80% 用你的数据计算 → |
|---|---|---|---|---|
| Claude Haiku 5.5 | $66.00/月 | $53.64/月 | $9,090/月 长上下文费率 | $2,722/月 长上下文费率 |
| GPT-6 Luna | $66.00/月 | $53.64/月 | $3,627/月 长上下文费率 | $1,080/月 长上下文费率 |
| MiMo V2.6 Flash | $77.28/月 | $57.52/月 | $2,530/月 | $554/月 |
| Qwen3.8 Flash | $88.92/月 | $70.82/月 | $2,717/月 | $832/月 |
| GLM-5.3 Flash | $90.00/月 | $72.72/月 | $2,718/月 | $990/月 |
基于公开的 Token 单价估算;做预算前请核对官方价格。 数据于 2026-10-08 从 LiteLLM 价格表同步.
常见问题
应该检索多少个片段?
在保证答案正确的前提下越少越好。每多一个片段,每个问题都要为它付费,片段数变为 4 倍,输入中的检索部分也大约变为 4 倍。先用几个不同的 k 值测量答案质量再做决定。
长上下文模型比 RAG 便宜吗?
规模大时很少如此。发送整篇文档时,每个问题的输入远多于几个检索片段,部分模型超过长度阈值后还会提高费率。流量小,或同一文档被缓存后反复提问时,才可能划算。