跳转至

LLM 成本测算

LLM 成本测算

"一次调用几分钱,一天十万次就是几百块"——AI 产品的成本随用量线性增长,不先算清楚,定价、预算、模型选型都是拍脑袋。本页给出一套从"单次调用"到"月成本"的估算方法,以及常用降本手段与成本决策原则。

先记住一个心智模型:AI 产品的成本 = 单次成本 × 调用量。模型能力再强,算不清这两项,产品越大亏得越多。

计费模型

不同供应商的计费方式差异很大,先看懂常见的几种:

  • Token 计价(主流):输入、输出分开计价,输出单价通常高于输入;报价单位一般是"每百万 token",写作 $X/M(如 $3/M 表示每 100 万输入 token 收 3 美元)。
  • 缓存折扣:系统提示、知识库前缀等稳定内容会命中 prompt 缓存,命中部分按折扣价计费。把固定内容放到 prompt 前缀并保持格式不变,就能持续吃折扣(提示词精简与结构技巧见 提示词工程)。
  • 批处理折扣:非实时任务(批量摘要、离线分类)走批处理队列,通常 5 折左右,代价是延迟从秒级变为小时级。
  • 其他模式:订阅/按席位(按人头包月)、多模态按图折算 token(见 多模态)、推理平台按用量分钟计费——结构各不相同,不要用一套公式套所有供应商。
报价以官方文档为准

不同供应商、不同型号的价格差异可达数倍,且频繁调整。签约和算账前务必查官方价格页;供应商怎么选见 LLM API 与供应商

成本估算三步法

第一步:算单次调用成本

单次成本 = 输入 tokens ÷ 1,000,000 × 输入单价 + 输出 tokens ÷ 1,000,000 × 输出单价

示例:每次调用输入 2,000 tokens、输出 500 tokens,模型报价输入 $3/M、输出 $15/M:

  • 输入:2,000 ÷ 1,000,000 × $3 = $0.006
  • 输出:500 ÷ 1,000,000 × $15 = $0.0075
  • 单次成本 ≈ $0.0135(约 1.4 美分)

单次成本是后面一切计算的地基,务必按"你真实会发的 prompt"估算,而不是厂商示例。

输入输出 token 怎么估
  • 中文约 1 字 ≈ 1~2 个 token,英文约 1 个词 ≈ 1.3 个 token,图片按供应商规则折算
  • 别靠心算:开发时用官方 tokenizer 数一遍真实 prompt;系统提示、工具定义也要计入输入
  • 输出长度按 max_tokens 上限估算,并按"最坏情况"留余量

第二步:算业务量

日成本 = 日调用次数 × 单次成本;月成本 ≈ 日成本 × 30 天。

以上面的 $0.0135/次 为例:

日调用量日成本月成本(30 天)
1 万次$135$4,050
10 万次$1,350$40,500
100 万次$13,500$405,000

单次"几分钱"不吓人,乘以调用量才是成本的大头:10 万日调用就是每年数十万美元的支出,这个数必须在写 PRD 前就算清楚。

日调用量本身也要估出来:日调用数 ≈ 日活用户(DAU) × 人均调用次数。人均次数来自产品设计——每个核心功能一次请求、Agent 每步一次请求,把这些列进功能清单逐个累加,比拍脑袋准得多。

第三步:加工程系数

真实账单永远高于理论值——重试、日志与评测跑分、多路调用(Agent 多步)、灰度测试都会额外消耗。建议在理论成本上乘 1.2~1.5 倍作为工程系数:

沿用上例:日 1 万调用、单次 $0.0135,月成本 $4,050 × 1.3 ≈ $5,265

系数取多少取决于业务形态:请求波动大、依赖外部评测、Agent 多步调用多的产品取 1.5,反之可取下限 1.2;上线后按月回填真实账单,持续校准这个系数。

另外还有非模型成本要在预算里单列:存储、向量库、评测与标注人工、人工兜底(如客服升级转人工)。模型 token 费通常只占总成本的一半上下。

一个判断输入/输出占比的小技巧:AI 客服(上下文 + 知识库长输入、短回复)输入占大头,优化重点是压上下文与缓存;写作工具(长输出)输出占大头,优化重点是控制输出长度。

估算结果自检清单
  • 单次成本是否基于真实 prompt 与 max_tokens 上限,而不是厂商示例?
  • 日调用量是否按 DAU × 人均次数推导过,而不是拍脑袋?
  • 工程系数是否覆盖重试、评测、多路调用?
  • 非模型成本(存储、向量库、人工)是否已单列?

降本策略

按杠杆大小排序,从最省事的开始:

  1. Prompt 压缩与缓存:减输入 token——精简系统提示、按需携带知识库片段、利用缓存折扣(见 提示词工程)
  2. 模型分级路由:简单请求(分类、抽取、改写)走小模型/低成本模型,复杂请求才调旗舰——头部 AI 应用的标准做法(分层思路见 LLM API 与供应商)
  3. 控制输出长度:max_tokens 上限 + 输出格式约束(JSON/模板)。输出单价高于输入,压输出往往比压输入见效更快
  4. 批处理 + 小模型替代:非实时任务走批处理折扣;高频固定场景用蒸馏/微调小模型替代大模型(基础概念见 LLM 基础)
  5. 工程侧兜底:应用层缓存(相同请求直接复用结果)、失败重试上限、单用户限额——防止意外用量把成本打穿

降本的前提是不牺牲效果:先量化当前成本构成(输入/输出各占多少),再按杠杆排序逐项做 A/B 对照,每项优化都盯住效果指标不下降。

成本护栏与 ROI

护栏(防止成本失控):

  • 单用户/单租户日限额,超限降级或限流(风控与合规思路见 出海与合规)
  • 成本看板:按产品、功能、用户维度拆分每日成本
  • 异常告警:单日成本环比突增(如 >50%)立即告警排查

ROI 对照:成本永远要放在"省了什么、赚了什么"里看:

场景类型对照基准例子
省人力替代岗位的月薪AI 客服月成本 3 万 vs 2 名客服月薪 1.5 万 × 2 = 3 万,还 7×24 在线——划算
增效客单价与转化提升AI 导购每月多 100 单,客单价 500 元,增收 5 万 vs 成本 1 万——划算
体验留存/口碑的间接收益答疑等待从 2 小时变 10 秒,减少流失,难以直接量化但要纳入判断

一句话原则:成本不是越低越好,"单位收益成本"(成本 ÷ 带来的收益)才是决策指标。

练习:AI 简历筛选工具成本测算

假设:每天筛选 5,000 份简历;每份简历输入 8,000 tokens(简历全文 + 岗位要求),输出 300 tokens(评分 + 理由);模型报价输入 $1/M、输出 $6/M;工程系数按 1.3。

请算出:单次成本、日成本、月成本(30 天)、含工程系数的月预算。

进阶思考:如果简历改为图片/PDF 扫描件走多模态识别,成本结构会怎么变?提示:图片按张折算 token,见 多模态

参考答案
  • 单次成本 = 8,000 ÷ 1,000,000 × $1 + 300 ÷ 1,000,000 × $6 = $0.0098
  • 日成本 = 5,000 × $0.0098 = $49
  • 月成本 = $49 × 30 ≈ $1,470
  • 含工程系数预算 = $1,470 × 1.3 ≈ $1,911

注意:若日调用量涨到 5 万,月成本直接翻 10 倍到 $14,700——再次印证成本随用量线性增长,上线前就要想好放大后的账单。

做完这道题,你就掌握了完整的成本测算流程:单次成本 → 业务量 → 工程系数 → 月预算,以及每条降本杠杆该往哪使劲。


来源:主题参考 AIPM Wiki(archlizheng/AIPM-Wiki,CC BY-NC-SA 4.0)的「LLM 成本测算入门」专题;本文内容由本站自行撰写。