AI 聊天机器人每月 API 费用
聊天助手每条消息都会重发系统提示和此前的对话,所以回答虽短,输入却不断累积。我们假设每次对话 4 条消息,每条消息是一次请求,输入 1,200 Token、输出 400 Token,其中 60% 的输入是缓存前缀(指令、帮助中心片段、之前的对话),5% 写入缓存。用户在等待回复,因此不能使用 Batch API。
费用与流量成正比。每天 100,000 次对话时,MiMo V2.6 Flash 每月约 $2,175,约合每 1,000 次对话 $0.72。拿这个单次对话成本去和每张客服工单的成本或订阅价格比较即可。系统提示变长或检索文章变多,会让每条消息的输入都增加,而不只是每次对话增加一次。
下表列出此负载下当前最便宜的模型。可在计算器中修改任意数值,或查看每位订阅用户的利润。
| 模型 | 每天 1,000 次对话 每天 4,000 次 · 输入 1,200 · 输出 400 · 缓存 60% 用你的数据计算 → | 每天 10,000 次对话 每天 40,000 次 · 输入 1,200 · 输出 400 · 缓存 60% 用你的数据计算 → | 每天 100,000 次对话 每天 400,000 次 · 输入 1,200 · 输出 400 · 缓存 60% 用你的数据计算 → |
|---|---|---|---|
| MiMo V2.6 Flash | $21.75/月 | $217/月 | $2,175/月 |
| Claude Haiku 5.5 | $30.80/月 | $308/月 | $3,080/月 |
| GPT-6 Luna | $30.80/月 | $308/月 | $3,080/月 |
| Qwen3.8 Flash | $32.94/月 | $329/月 | $3,294/月 |
| GLM-5.3 Flash | $35.23/月 | $352/月 | $3,523/月 |
| Mistral Small (latest) | $38.74/月 | $387/月 | $3,874/月 |
基于公开的 Token 单价估算;做预算前请核对官方价格。 数据于 2026-10-08 从 LiteLLM 价格表同步.
常见问题
一条聊天消息有多少 Token?
简短的问答只有几百 Token,但请求里还带着系统提示、检索到的帮助文章和之前的对话。记录一天真实流量中 API 返回的用量,把平均值填进计算器。
如何降低聊天机器人的 API 费用?
让系统提示和工具定义保持固定并放在开头以便缓存,裁剪或总结旧对话,把简单问题交给小模型,只把难题升级给大模型。