AI 聊天机器人每月 API 费用

聊天助手每条消息都会重发系统提示和此前的对话,所以回答虽短,输入却不断累积。我们假设每次对话 4 条消息,每条消息是一次请求,输入 1,200 Token、输出 400 Token,其中 60% 的输入是缓存前缀(指令、帮助中心片段、之前的对话),5% 写入缓存。用户在等待回复,因此不能使用 Batch API。

费用与流量成正比。每天 100,000 次对话时,MiMo V2.6 Flash 每月约 $2,175,约合每 1,000 次对话 $0.72。拿这个单次对话成本去和每张客服工单的成本或订阅价格比较即可。系统提示变长或检索文章变多,会让每条消息的输入都增加,而不只是每次对话增加一次。

下表列出此负载下当前最便宜的模型。可在计算器中修改任意数值,或查看每位订阅用户的利润。

模型每天 1,000 次对话
每天 4,000 次 · 输入 1,200 · 输出 400 · 缓存 60%
用你的数据计算 →
每天 10,000 次对话
每天 40,000 次 · 输入 1,200 · 输出 400 · 缓存 60%
用你的数据计算 →
每天 100,000 次对话
每天 400,000 次 · 输入 1,200 · 输出 400 · 缓存 60%
用你的数据计算 →
MiMo V2.6 Flash$21.75/月$217/月$2,175/月
Claude Haiku 5.5$30.80/月$308/月$3,080/月
GPT-6 Luna$30.80/月$308/月$3,080/月
Qwen3.8 Flash$32.94/月$329/月$3,294/月
GLM-5.3 Flash$35.23/月$352/月$3,523/月
Mistral Small (latest)$38.74/月$387/月$3,874/月

基于公开的 Token 单价估算;做预算前请核对官方价格。 数据于 2026-10-08 从 LiteLLM 价格表同步.

常见问题

一条聊天消息有多少 Token?

简短的问答只有几百 Token,但请求里还带着系统提示、检索到的帮助文章和之前的对话。记录一天真实流量中 API 返回的用量,把平均值填进计算器。

如何降低聊天机器人的 API 费用?

让系统提示和工具定义保持固定并放在开头以便缓存,裁剪或总结旧对话,把简单问题交给小模型,只把难题升级给大模型。