LLM 成本测算
LLM 成本测算
"一次调用几分钱,一天十万次就是几百块"——AI 产品的成本随用量线性增长,不先算清楚,定价、预算、模型选型都是拍脑袋。本页给出一套从"单次调用"到"月成本"的估算方法,以及常用降本手段与成本决策原则。
先记住一个心智模型:AI 产品的成本 = 单次成本 × 调用量。模型能力再强,算不清这两项,产品越大亏得越多。
计费模型
不同供应商的计费方式差异很大,先看懂常见的几种:
- Token 计价(主流):输入、输出分开计价,输出单价通常高于输入;报价单位一般是"每百万 token",写作
$X/M(如$3/M表示每 100 万输入 token 收 3 美元)。 - 缓存折扣:系统提示、知识库前缀等稳定内容会命中 prompt 缓存,命中部分按折扣价计费。把固定内容放到 prompt 前缀并保持格式不变,就能持续吃折扣(提示词精简与结构技巧见 提示词工程)。
- 批处理折扣:非实时任务(批量摘要、离线分类)走批处理队列,通常 5 折左右,代价是延迟从秒级变为小时级。
- 其他模式:订阅/按席位(按人头包月)、多模态按图折算 token(见 多模态)、推理平台按用量分钟计费——结构各不相同,不要用一套公式套所有供应商。
报价以官方文档为准
不同供应商、不同型号的价格差异可达数倍,且频繁调整。签约和算账前务必查官方价格页;供应商怎么选见 LLM API 与供应商。
成本估算三步法
第一步:算单次调用成本
单次成本 = 输入 tokens ÷ 1,000,000 × 输入单价 + 输出 tokens ÷ 1,000,000 × 输出单价
示例:每次调用输入 2,000 tokens、输出 500 tokens,模型报价输入 $3/M、输出 $15/M:
- 输入:2,000 ÷ 1,000,000 × $3 = $0.006
- 输出:500 ÷ 1,000,000 × $15 = $0.0075
- 单次成本 ≈ $0.0135(约 1.4 美分)
单次成本是后面一切计算的地基,务必按"你真实会发的 prompt"估算,而不是厂商示例。
输入输出 token 怎么估
- 中文约 1 字 ≈ 1~2 个 token,英文约 1 个词 ≈ 1.3 个 token,图片按供应商规则折算
- 别靠心算:开发时用官方 tokenizer 数一遍真实 prompt;系统提示、工具定义也要计入输入
- 输出长度按
max_tokens上限估算,并按"最坏情况"留余量
第二步:算业务量
日成本 = 日调用次数 × 单次成本;月成本 ≈ 日成本 × 30 天。
以上面的 $0.0135/次 为例:
| 日调用量 | 日成本 | 月成本(30 天) |
|---|---|---|
| 1 万次 | $135 | $4,050 |
| 10 万次 | $1,350 | $40,500 |
| 100 万次 | $13,500 | $405,000 |
单次"几分钱"不吓人,乘以调用量才是成本的大头:10 万日调用就是每年数十万美元的支出,这个数必须在写 PRD 前就算清楚。
日调用量本身也要估出来:日调用数 ≈ 日活用户(DAU) × 人均调用次数。人均次数来自产品设计——每个核心功能一次请求、Agent 每步一次请求,把这些列进功能清单逐个累加,比拍脑袋准得多。
第三步:加工程系数
真实账单永远高于理论值——重试、日志与评测跑分、多路调用(Agent 多步)、灰度测试都会额外消耗。建议在理论成本上乘 1.2~1.5 倍作为工程系数:
沿用上例:日 1 万调用、单次 $0.0135,月成本 $4,050 × 1.3 ≈ $5,265。
系数取多少取决于业务形态:请求波动大、依赖外部评测、Agent 多步调用多的产品取 1.5,反之可取下限 1.2;上线后按月回填真实账单,持续校准这个系数。
另外还有非模型成本要在预算里单列:存储、向量库、评测与标注人工、人工兜底(如客服升级转人工)。模型 token 费通常只占总成本的一半上下。
一个判断输入/输出占比的小技巧:AI 客服(上下文 + 知识库长输入、短回复)输入占大头,优化重点是压上下文与缓存;写作工具(长输出)输出占大头,优化重点是控制输出长度。
估算结果自检清单
- 单次成本是否基于真实 prompt 与
max_tokens上限,而不是厂商示例? - 日调用量是否按 DAU × 人均次数推导过,而不是拍脑袋?
- 工程系数是否覆盖重试、评测、多路调用?
- 非模型成本(存储、向量库、人工)是否已单列?
降本策略
按杠杆大小排序,从最省事的开始:
- Prompt 压缩与缓存:减输入 token——精简系统提示、按需携带知识库片段、利用缓存折扣(见 提示词工程)
- 模型分级路由:简单请求(分类、抽取、改写)走小模型/低成本模型,复杂请求才调旗舰——头部 AI 应用的标准做法(分层思路见 LLM API 与供应商)
- 控制输出长度:
max_tokens上限 + 输出格式约束(JSON/模板)。输出单价高于输入,压输出往往比压输入见效更快 - 批处理 + 小模型替代:非实时任务走批处理折扣;高频固定场景用蒸馏/微调小模型替代大模型(基础概念见 LLM 基础)
- 工程侧兜底:应用层缓存(相同请求直接复用结果)、失败重试上限、单用户限额——防止意外用量把成本打穿
降本的前提是不牺牲效果:先量化当前成本构成(输入/输出各占多少),再按杠杆排序逐项做 A/B 对照,每项优化都盯住效果指标不下降。
成本护栏与 ROI
护栏(防止成本失控):
- 单用户/单租户日限额,超限降级或限流(风控与合规思路见 出海与合规)
- 成本看板:按产品、功能、用户维度拆分每日成本
- 异常告警:单日成本环比突增(如 >50%)立即告警排查
ROI 对照:成本永远要放在"省了什么、赚了什么"里看:
| 场景类型 | 对照基准 | 例子 |
|---|---|---|
| 省人力 | 替代岗位的月薪 | AI 客服月成本 3 万 vs 2 名客服月薪 1.5 万 × 2 = 3 万,还 7×24 在线——划算 |
| 增效 | 客单价与转化提升 | AI 导购每月多 100 单,客单价 500 元,增收 5 万 vs 成本 1 万——划算 |
| 体验 | 留存/口碑的间接收益 | 答疑等待从 2 小时变 10 秒,减少流失,难以直接量化但要纳入判断 |
一句话原则:成本不是越低越好,"单位收益成本"(成本 ÷ 带来的收益)才是决策指标。
练习:AI 简历筛选工具成本测算
假设:每天筛选 5,000 份简历;每份简历输入 8,000 tokens(简历全文 + 岗位要求),输出 300 tokens(评分 + 理由);模型报价输入 $1/M、输出 $6/M;工程系数按 1.3。
请算出:单次成本、日成本、月成本(30 天)、含工程系数的月预算。
进阶思考:如果简历改为图片/PDF 扫描件走多模态识别,成本结构会怎么变?提示:图片按张折算 token,见 多模态。
参考答案
- 单次成本 = 8,000 ÷ 1,000,000 × $1 + 300 ÷ 1,000,000 × $6 = $0.0098
- 日成本 = 5,000 × $0.0098 = $49
- 月成本 = $49 × 30 ≈ $1,470
- 含工程系数预算 = $1,470 × 1.3 ≈ $1,911
注意:若日调用量涨到 5 万,月成本直接翻 10 倍到 $14,700——再次印证成本随用量线性增长,上线前就要想好放大后的账单。
做完这道题,你就掌握了完整的成本测算流程:单次成本 → 业务量 → 工程系数 → 月预算,以及每条降本杠杆该往哪使劲。
来源:主题参考 AIPM Wiki(archlizheng/AIPM-Wiki,CC BY-NC-SA 4.0)的「LLM 成本测算入门」专题;本文内容由本站自行撰写。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用