LLM API 与供应商
LLM API 与供应商
模型 API 是 AI 产品的"发动机"。本页整理选择和使用模型服务的关键视角:模型服务怎么选、怎么用,覆盖供应商全景、定价结构、能力维度、实测方法与风险控制,是 tools 区块的选型目录页。知识机制类内容(Transformer、Token、KV Cache、推理优化)见 大模型基础 与 模型推理与部署,本页不重复讲原理;具体算账方法见 LLM 成本测算;主流模型的能力与价格快照见 模型能力与边界;调用与免费试用的平台网址清单见 AI 平台汇总。
供应商维度
- 闭源 API(OpenAI、Anthropic、Google、阿里、字节、腾讯等):开箱即用、能力最强、按用量付费
- 开源模型(Llama、Qwen、DeepSeek 等):可私有化部署、数据可控、规模化成本低
- 国产 vs 海外:数据合规、网络延迟、定价策略差异大
三条线之外,还有一个常被忽略的维度:入口渠道。同一个模型的 API 可能从多条渠道购买:官方直连、云厂商转售(Azure OpenAI、Amazon Bedrock、Google Vertex AI)、国内云托管(阿里云百炼、火山方舟、华为云)与聚合网关。渠道不同,SLA、数据条款、账单与合规口径也不同:企业客户常因合规审计走云厂商渠道(拿统一账单、安全认证),个人与创业团队多走官方直连(最便宜、新功能最快);同模型在不同渠道的价格可能不同,签约前把渠道差异当定价维度一起比。
选择顺序建议:先定数据政策与合规边界(能不能出域、能不能关训练开关),再在边界内比能力,最后谈价格与条款:价格最透明,也最不该是首要决策项。
flowchart TD
policy[数据政策与合规边界] --> channel[确定可用渠道]
channel --> ability[用自有评测集验证能力]
ability --> load[压测速率、并发与延迟]
load --> terms[核对数据条款、SLA 与可观测性]
terms --> price[按真实用量测算价格与 TCO]
price --> pilot[灰度上线并持续监控]供应商选型不是先比单价,而是先过滤不可用边界,再用真实任务验证能力、工程表现与长期成本。
三条线的适用场景速判
- 闭源 API:快速上线、前沿能力、不想养 GPU 团队、用量弹性大:几乎任何产品起步期的最优解
- 开源模型:数据敏感、调用量大到 API 账单失控、需要完全掌控版本与行为:规模化后的主流路径
- 混合:本地开源扛常规量,API 旗舰兜底最难任务:大型产品的常见终态(见 模型推理与部署 的部署决策表)
选型评估清单
| 维度 | 关注点 |
|---|---|
| 能力 | 目标任务上的实测效果(用你自己的评测集) |
| 价格 | 输入/输出单价、缓存价、批量价 |
| 速率与并发 | RPM/TPM 限制是否满足峰值 |
| 延迟 | 首 token 时间、流式能力 |
| 数据政策 | 数据是否用于训练、是否留存、传输地域 |
| 稳定性 | SLA、限流与故障历史 |
| 生态 | SDK、工具调用、多模态支持 |
| 工具调用 | Agent 场景的 function calling 正确率与多轮稳定性 |
| 推理深度 | 是否需要思考模式 / effort 档位,思考 token 的计费方式 |
| 多模态 | 图像 / 音频 / 视频输入是否必需,按张 / 按秒折算后的成本 |
| 地域与合规 | 数据存储地域、是否可关闭训练、境内备案要求 |
| 可观测性 | 用量明细、成本拆分、日志与审计接口 |
清单的每一条都要落到可验证的动作,否则只是纸面检查:能力 → 跑评测集;价格 → 查官方定价页并做算账表;速率与延迟 → 压测脚本实测;数据政策 → 逐条读数据条款原文;稳定性 → 查状态页历史与 SLA 文档。评测怎么做见 实测方法论,算账见 LLM 成本测算。
成本优化三板斧
- 模型分层:简单任务用便宜小模型,难任务才上旗舰
- 缓存:相同请求命中缓存,显著降低成本
- 提示词精简:省 token 就是省钱(提示词压缩、上下文管理)
展开说:模型分层的落地做法(分几层、路由规则、降级链)见 多模型路由与分层,成本测算与杠杆排序见 LLM 成本测算;缓存要求 prompt 前缀字节级稳定(系统提示、知识库片段放前缀,别在开头插时间戳),命中部分按折扣价计费、通常比原价低一个量级(以官方页面为准),机制见 模型推理与部署 的提示词缓存节;提示词精简的收益是双重的:输入省 token 直接省成本,输出端设 max_tokens 上限压话痨,输出单价通常高于输入,压输出往往比压输入见效更快(技巧见 提示词工程)。
三板斧之外还有补充杠杆:批处理折扣(离线任务通常 5 折左右)、错峰时段折扣、蒸馏 / 微调小模型替代大模型:具体测算与适用条件见 LLM 成本测算。
实操建议
- 与供应商签合同前先跑你自己数据的压测
- 关键路径不要单点依赖一家:抽象一层接口,保留切换能力
- 用量告警:设置每日/每月成本上限,防止失控
- 主流供应商定价对比与模型能力速览:见 模型能力与边界(含 2026-08-23 定价表)
再补几条上线前后高频踩坑的经验:
- 密钥管理:每环境独立 key(开发 / 测试 / 生产分开),生产 key 设额度上限与告警,定期轮换;密钥进密钥管理服务,不进代码仓库(仓库泄漏扫描 CI 常抓这个)
- 灰度切换:换模型或换供应商先在 5%-10% 流量灰度,对比质量、延迟、成本指标再放量;模型升级会悄悄改变行为(话术、边界、格式),不灰度直接全量有风险(回归方法见 评估与评测)
- 线上监控:错误率、延迟分位数(P95/P99)、token 消耗与成本占比上每日看板;错误率突增先看是不是限流(429)与模型端故障
- 合同条款:除价格外重点看 SLA 承诺、数据条款(是否用于训练、留存时长)、价格调整通知期与退出机制:供应商涨价或改条款时你要有"转身"的时间
主流供应商与模型家族(2026 视角)
下表为 2026 年主流供应商全景,价格为量级参考,具体数字一律以各官方页面为准;模型能力与边界 有 2026-08-23 的能力与定价快照,两页配合看。
| 供应商 | 代表模型(2026) | 上下文量级 | 多模态 / 工具调用 | 价格带(量级) | 适合场景 |
|---|---|---|---|---|---|
| OpenAI | GPT-5.6 家族(sol / terra / luna)及 o 系列遗留 | 长上下文为主,以官方为准 | 文本 + 图像;工具调用成熟 | 三档拉开,旗舰输入 $4-20/M 量级 | 通用对话、Agent、代码,生态与文档最全 |
| Anthropic | Claude 5 家族:Fable 5 / Opus 5 / Sonnet 5 / Haiku 4.5 | 除 Haiku 4.5 外 1M | 文本 + 图像;工具调用与长时 Agent 强 | 四档梯度,$1-10/M 输入量级 | 长时 Agent、复杂编码、企业场景 |
| Gemini 3.x:3.1 Pro / 3.6-3.7 Flash | 百万级(以官方为准) | 文本 + 图像 / 视频;思考默认开启 | 快档有免费额度,付费档较低 | 多模态理解、搜索整合、Agent | |
| xAI | Grok 系列(旗舰 / 快档) | 以官方为准 | 以官方为准 | 以官方为准 | 实时信息、与 X 生态结合的场景 |
| Meta | Llama 4(Scout / Maverick) | Scout 宣称 10M,Maverick 1M | 文本 + 图像;权重开放(许可门控) | 权重免费,自付推理成本 | 私有化部署、数据敏感场景 |
| DeepSeek | V4-Pro / V4-Flash,R1 系列蒸馏小模型 | 1M | 文本为主,视觉实验型号;思考默认开启 | 国内定价极具竞争力,错峰半价 | 中文场景、性价比优先、推理任务 |
| 阿里 | Qwen 系列(0.6B-235B 开源)+ 通义 / 百炼托管 API | 百万级(以官方为准) | 文本 + 图像;全系开源 Apache 2.0 | 权重免费;托管 API 人民币计价 | 中文场景、开源私有化、与阿里云生态集成 |
| 智谱 | GLM 系列(开源 + 开放平台) | 以官方为准 | 文本 + 图像;Agent 场景强 | 人民币计价,以官方为准 | 中文对话、Agent、高校与政企 |
| Mistral | Mistral 系列(开源 + 平台 API) | 以官方为准 | 文本为主 | 以官方为准 | 欧洲合规要求、开源部署 |
| MiniMax | MiniMax 系列(文本 + 语音) | 以官方为准 | 语音能力突出 | 人民币计价,以官方为准 | 语音交互、角色对话、中文场景 |
| 字节 | 豆包 / Seed 系列(火山引擎) | 以官方为准 | 文本 + 图像 + 语音 | 人民币计价,以官方为准 | 中文场景、与抖音 / 飞书生态集成 |
海外厂商观察
- OpenAI:产品线最全的生态位:从旗舰到低价档位齐全,文档、SDK 与第三方集成最成熟,新能力(推理档位、实时语音)往往最先落地;「按需分配 effort」是官方推荐思路,而非手动切换模型(Reasoning Guide)
- Anthropic:四档定价梯度本身就是选型工具:Haiku 4.5 最快最便宜、Sonnet 5 速度智能兼顾、Opus 5 面向复杂编码与企业、Fable 5 为最强且面向长时运行 Agent;官方工程博客对 Agent 架构与路由原则的阐述最系统(Models Overview)
- Google:Gemini 3.x 全系默认思考,Pro 与 Flash 两条线定位清晰;与搜索、Android、Workspace 生态深度整合,多模态(视频理解)是其传统强项
- xAI:Grok 系列与 X 生态实时信息结合是其差异点;迭代速度快,适合关注实时信息类产品的团队纳入备选
- Mistral:欧洲厂商,开源与 API 双轨,对欧洲合规(GDPR)有天然优势;模型主打高效,适合欧洲市场产品
国内厂商观察
- DeepSeek:V4 系列 1M 上下文、思考默认开启,API 同时兼容 OpenAI 与 Anthropic 格式(换供应商成本最低),错峰时段半价;R1 系列蒸馏出 1.5B-70B 小模型,开源推理模型路线开创者(DeepSeek Pricing)
- 阿里(Qwen / 通义):Qwen 全系开源(Apache 2.0)且参数档位齐全(0.6B-235B),本地部署生态成熟;百炼平台提供托管 API,与阿里云企业生态打通,中文能力与合规口径清晰
- 智谱(GLM):中文对话与 Agent 场景表现稳定,开放平台面向政企与高校客户多,商务流程完整
- 字节(豆包 / Seed):火山引擎托管,与抖音、飞书等字节生态集成度高,中文语音与多模态场景可选
- 国内厂商共性:人民币计价、境内数据合规链路完整、中文优化好;对比时注意大额包、充值优惠与错峰折扣的玩法差异(以官方定价页为准),别只看单价表
国产 vs 海外:数据合规与网络差异
- 数据合规:海外 API 默认数据可能出境、留存并用于改进产品(多数可关训练开关);国内产品用海外 API 要评估生成式 AI 合规要求(境内提供服务的算法备案等,见 出海与合规);国产 API 数据留在境内,对国内合规与政企客户更友好,但出海产品反过来要考虑对方市场的合规(如 GDPR)
- 网络与访问:海外 API 在国内访问存在稳定性与延迟问题,企业通常走专线或云厂商海外节点中转;国内 API 在海外同理。网络差异要当功能问题测,不是"能通就行"
- 定价策略:海外按美元计价、随汇率波动;国内人民币计价、常有大额包与充值优惠;错峰、批处理、免费额度的玩法各家不同,具体以官方定价页为准
- 能力差异:2026 年国产旗舰在中文、代码、数学上已与海外旗舰接近(差距在收窄),但长尾能力、生态成熟度与文档仍有差异。用你自己的评测集下结论,别用国籍下结论
定价与计费结构对比
各供应商的计费结构大同小异(Token 计价是主流,输入 / 输出分价、输出更贵),差异在折扣玩法与免费额度。下表为结构对比,具体数字以官方页面为准;2026-08-23 的价格快照见 模型能力与边界。
| 供应商 | 输入 / 输出单价 | 缓存折扣 | 批处理折扣 | 免费额度 |
|---|---|---|---|---|
| OpenAI | 按型号分档(快 / 中 / 旗舰),以官方为准 | 命中缓存输入约为原价 1/10 | 批处理约 5 折 | 有限免费额度(以官方为准) |
| Anthropic | 四档梯度,以官方为准 | 有缓存价(以官方为准) | 有批处理价(以官方为准) | 视活动而定,以官方为准 |
| Pro / Flash 分档,以官方为准 | 有缓存价(以官方为准) | 有批处理价(以官方为准) | Flash 档有免费额度 | |
| DeepSeek | 人民币计价,以官方为准 | 以官方为准 | 以官方为准 | 错峰时段半价(非批处理,属时段折扣) |
| 国内厂商(阿里 / 智谱 / 字节等) | 人民币计价,以官方为准 | 部分提供,以官方为准 | 部分提供,以官方为准 | 多有新手免费额度 |
价格是变动项,不是静态事实
模型价格频繁调整,且同一供应商的不同渠道(官方直连 vs 云厂商转售)价格可能不同。任何"定价对比"都要标注日期与渠道,签约与算账前重查官方定价页。
本页表格只保证结构正确,不保证数字新鲜。
怎么看官方定价页(五步法)
- 先找对型号:定价页按型号 / 档位列价,别拿旗舰价当全系价;注意"预览版"与"正式版"可能同价不同命
- 看单价:输入 / 输出分开列,单位通常是美元 / 百万 token($X/M);思考模型要确认思考 token 是否计入输出价
- 看缓存价:prompt 缓存命中部分的单价,通常远低于原输入价;这决定你固定前缀策略的收益上限
- 看批处理价:离线任务走批处理队列的折扣价与延迟承诺(通常小时级)
- 看免费额度与限流:免费层的速率限制(RPM / RPD)与额度、付费层的配额、以及超出后的计费规则
多模态与特殊计费(图片按张折算、音频按秒、按座位订阅)在定价页的附加说明里,别漏看;全部看完后,用 LLM 成本测算 的公式套你的真实用量算账。
折扣都不是免费的,拿到折扣价的同时要看清代价:
- 缓存折扣要求 prompt 前缀字节级稳定:固定内容放前缀、别在开头插时间戳或随机串,否则命中率上不去
- 批处理折扣换的是延迟:小时级出结果,只适合离线任务(批量摘要、离线分类),不适合在线交互
- 错峰折扣(如 DeepSeek 深夜半价)限制时段,适合能接受延迟调度的批量任务
- 免费额度通常配严格限流(RPM / RPD),只够原型验证与评测跑分,不能当生产容量使用;正式上线前用付费 key 重新压测配额表现
能力维度深度
七个能力维度,每个给出"选型时怎么验证"。验证的总原则:在官方文档上确认能力存在,在自有评测集上确认能力可用:前者防"没有",后者防"有但用不好"。
能力维度的优先级按产品形态定
对话产品重延迟与稳定性,Agent 产品重工具调用与上下文,知识库产品重长上下文与数据政策,创作产品重多模态与输出质量。
先按产品形态排出前三维度,再逐项验证,不要七个维度平均用力。
上下文窗口与长上下文
- 标称窗口 ≠ 有效窗口:1M 窗口不代表 1M token 都能被稳定利用,长输入下中间位置信息利用率下降(lost in the middle),关键指令放开头或结尾(机制见 大模型基础)
- 上下文压缩是有代价的:长输入按 token 计费、注意力开销随长度增长、长上下文挤占并发:"全塞进去"是最贵的方案,长文档优先 RAG 检索 + 分段引用
- 选型时怎么验证:用你的真实长文档(合同、代码库、论文)测"信息提取准确率随输入长度的衰减曲线";对比长上下文模型 vs 小窗口 + RAG 的成本与效果,别只比窗口数字
Tool Calling 可靠性
- 工具调用(function calling)是 Agent 产品的命脉:模型要"选对函数 + 生成合法参数",多轮工具调用还要保持状态稳定(机制见 Agent 与工作流)
- 选型时怎么验证:用你自己的工具 schema 集(含边界输入、必填参数、枚举约束)测三项:正确选函数率、参数合法性(JSON Schema 校验)、多轮调用后的状态保持率;解析失败率是换模型最直接的信号,Agent 场景别只看问答类基准
多模态输入
- 图像按张折算 token(分辨率不同价格不同)、音频 / 视频按秒折算;多模态输入同样按 token 计费,折算规则以官方为准(见 多模态)
- 选型时怎么验证:用真实截图、PDF、扫描件、图表样例测 OCR 准确率与图表理解能力;注意"能看图"和"图里的数字读得对"是两回事
推理模型与普通模型
- 推理模型输出前先思考,思考 token 按输出计费,首 token 延迟显著更长;effort / thinking 档位可调(none → max),"思考默认开启"已成 2026 年旗舰标配(见 模型能力与边界)
- 选型时怎么验证:同一评测集跑"思考开 vs 关"两档,记录正确率提升与成本 / 延迟增加的比例;对"思考后仍错"的样本单独归类。那是最值得换模型或加护栏的信号;数学代码类任务用多次采样 + 验证器(pass@k)而非单次生成
延迟与吞吐
- 关键指标:首 token 时间(TTFT)、生成速率(TPOT)、RPM / TPM 配额;长输入拖慢 TTFT,长输出拖慢整体,流式输出改善体感(机制见 模型推理与部署)
- 选型时怎么验证:压测脚本按输入长度分段记录 P50 / P95 / P99 延迟;并发压到配额上限,看限流后的退避与重试行为;把延迟预算写进 SLA 再选型(延迟是设计出来的)
SLA 与限流
- 供应商的可用性承诺、限流策略(突发 vs 平滑)与错误码(429、5xx)各不相同;状态页是事故的第一现场
- 选型时怎么验证:读 SLA 文档与状态页历史;压测确认配额上限与恢复行为;客户端设计指数退避与降级,把供应商抖动当必然事件对待
数据政策
- 三个必查项:数据是否用于训练(能否关训练开关)、数据留存时长、传输与存储地域;敏感数据与高风险场景走私有化部署(见 模型推理与部署 与 出海与合规)
- 选型时怎么验证:逐条读数据条款原文(不是营销页);把关训练开关的操作在控制台实际执行一遍并留档;企业采购时要求对方提供数据处理协议(DPA)
实测方法论
选型结论必须来自自有评测集的实测,而不是榜单与厂商演示。完整方法论见 评估与评测,这里给选型压测的操作清单:
评测集怎么来
- 每个核心任务收集 20-50 条真实样本(不是模型生成的假样本),覆盖常规、边界与失败案例,人工标注期望结果
- 来源:线上日志抽样、竞品公开案例、用户反馈与投诉、历史 badcase;新功能没有日志就先用模拟数据,上线后回填
- 评测集是资产不是消耗品:随 badcase 持续扩充,模型与 prompt 变更后反复使用(评估与评测 的持续校准一节)
- 标注口径要可复现:什么算"对"、什么算"错"、错误分几类(幻觉 / 漏答 / 格式 / 推理错),写进标注规范,否则多人标注结果不可比
评测集样例:客服问答任务 30 条
- 常规 20 条:常见问题、带上下文的追问、多轮对话
- 边界 6 条:超长输入、空输入、表情与错别字、中英混杂
- 失败 4 条:知识库查不到的、需要拒答的、需要转人工的
- 每条标注:期望回答要点、可接受的最低标准、错误分类:跑完一个模型,先看错误分布再谈总分
对比什么
| 维度 | 指标 | 说明 |
|---|---|---|
| 质量 | 正确率、错误类型分布 | 幻觉、漏答、格式错误分开统计 |
| 延迟 | TTFT、端到端、P95/P99 | 按输入长度分段记录 |
| 成本 | 单次 token 消耗 × 单价 | 思考 token 计入输出 |
| 稳定性 | 多次采样方差、错误率、配额表现 | 单次结果不可信 |
多轮采样取均值
- temperature > 0 时单次输出有随机性:同一输入跑 3-5 次,质量取众数 / 均值,延迟取分位数
- 比较两个模型用同一评测集、同一采样参数、同一评测脚本,只改模型一个变量;换了参数等于换了实验
- 统计口径要写进记录:均值还是 P95?冷启动还是稳态?流式还是非流式?没有口径的数字不可比(压测口径八项见 模型推理与部署)
Playground 与生产差异
- Playground 无并发、无配额压力,结果不能外推生产容量;免费额度的速率限制与付费层不同
- 生产环境多了并发、限流、缓存、批处理与灰度流量:上线前用生产 key 与真实流量形态压测,把 Playground 当功能演示、把生产压测当选型依据
- 两处最容易踩的差异:缓存命中率(生产的前缀结构与 Playground 不同,缓存收益要按生产实测)与并发限流(Playground 单发看不出配额问题,并发压测才会暴露 429)
记录与回归
- 每次选型留一张记录表(存档三个月后做增量):
| 日期 | 模型 / 版本 | 评测集 | 质量 | P95 延迟 | 单次成本 | 结论 |
|---|---|---|---|---|---|---|
| (示例)2026-08-24 | 某旗舰 vs 某快模型 | 客服 50 条 | 92% vs 88% | 1.2s vs 0.4s | $0.004 vs $0.001 | 常规量走快模型,疑难升级旗舰 |
- 模型更新、prompt 变更、供应商改价后重跑评测集;"上次测过"会过期,三个月是合理的刷新周期
多模型路由与分层
模型分层
- 常规三层:简单任务(分类、抽取、改写、FAQ)走小模型 / 快模型 → 中等任务走中档 → 难题(复杂推理、长链规划)才上旗舰 / 推理模型
- 层的数量够用就好:大多数产品三层足够,层数越多,路由与维护成本越高(各档位价格梯度见 模型能力与边界 与 LLM 成本测算)
路由器设计
- 先模型内、后模型间:同一模型调 effort / thinking 档位是成本最低的路由(OpenAI none→max、Gemini minimal→high 各档均可映射为策略);评测证明不够再上模型间路由
- 规则路由优先:输入信号取任务类型(意图识别结果)、输入长度、用户付费层级、历史成功率;示例:客服首轮走快模型,连续追问两次或前一次低置信自动升级
- 语义路由:用 embedding 相似度把查询匹配到预定义任务模板,再按模板定档位;比规则灵活,但需要维护模板库
- 路由阈值用评测集校准,上线后监控各档位的请求占比、成本占比与升级率:升级率异常高说明阈值偏激进,成本占比异常高说明偏保守
flowchart TD
request[用户请求] --> signal{任务复杂度、长度、置信度}
signal -->|简单| fast[小模型 / 快模型]
signal -->|中等| mid[中档模型]
signal -->|复杂| flagship[旗舰 / 推理模型]
fast --> result{成功且置信度足够?}
mid --> result
flagship --> result
result -->|是| answer[返回结果]
result -->|否| fallback[升级、切备选或人工兜底]路由把大多数请求留在低成本档位,把复杂度和失败重试集中到少数需要旗舰能力的路径上。
降级策略
- 快模型失败或低置信 → 升级旗舰重试 → 仍失败进人工兜底或安全话术;这层逻辑放进产品架构,而不是靠模型自觉
- 供应商抖动(限流 / 故障)时切备选供应商或本地模型:降级链要预先演练,别在事故现场第一次跑
何时不路由
- 任务形态单一、调用量小、或评测证明两档无差异时,单模型更简单可靠;路由本身也有成本(复杂度、延迟、维护),只在评测证明值得时引入(官方原则见 Anthropic Building Effective Agents)
风险与锁定
单点依赖风险
- 依赖单一供应商的风险:故障与限流(业务中断)、涨价与改价(成本失控)、模型下架 / 改名 / 行为漂移(效果变化)、政策与合规变化(不可用)
- 缓解:关键路径保留备选供应商与本地部署选项(不一定要用,但要能切);接口抽象层让切换成本可控;模型变更走灰度
迁移成本
- 换供应商要搬的东西:接口调用(OpenAI 兼容格式已是事实标准,多数平台直接兼容)、prompt 与系统提示(要移植与回归)、工具定义与结构化约束、评测集与监控基线
- 缓解:第一天就抽象接口层(网关 / 适配器),prompt 与评测集版本化;"能换"本身就是议价筹码:不要让自己陷入"换不起所以接受涨价"的境地
数据出境与合规
- 数据出境、训练开关、留存时长是选型的第一道闸门;国内提供生成式 AI 服务有备案等合规要求,出海产品要满足目标市场法规(GDPR 等):完整清单见 出海与合规
- 敏感数据与高风险场景优先私有化部署;混合架构(本地扛量大、API 兜底最难)是常见折中(见 模型推理与部署)
供应商稳定性评估
- 评估项:状态页与历史故障记录、SLA 承诺与赔偿条款、安全认证(SOC 2 等)、社区与开发者生态活跃度、商务条款(用量承诺、价格保护期、退出与数据返还流程)
- 把供应商当外部团队管理:定期回顾其发布节奏、改价通知与路线图,任何重大变更触发你的选型复核
锁定是逐步形成的,别等到"换不动"才规划
接口耦合、prompt 依赖、评测基线绑定供应商、团队只会用一家的 SDK:每一样都在加深锁定。
锁定不可怕,不可逆的锁定才可怕:从第一天保留接口抽象、双供应商评测、评测集与 prompt 版本化,代价极小,却是事后迁移成本最高的部分。
来源说明
本文为原创整理,综合以下官方资料撰写,访问验证日期 2026-08-24;模型能力、价格与条款变动频繁,以各官方页面为准。
- OpenAI API Pricing:定价与计费结构
- OpenAI Reasoning Guide:思考模型与 effort 档位
- Anthropic Models Overview:Claude 5 家族能力与上下文
- Anthropic Pricing:四档定价梯度与批处理
- Anthropic Building Effective Agents:模型分层、路由与"先简单后复杂"原则
- Google Gemini API Pricing:Gemini 定价与免费额度
- DeepSeek Pricing:V4 定价、错峰折扣与上下文
- Qwen3 与 Meta llama-models:开源权重、许可证与部署生态
- 智谱开放平台、MiniMax 开放平台、火山引擎豆包大模型、阿里云百炼:国内厂商定价与模型页
- 站内关联:模型能力与边界(2026-08-23 定价表)、评估与评测、LLM 成本测算、出海与合规、多模态、AI 平台汇总(平台网址清单)
更新记录
| 日期 | 变更 | 说明 |
|---|---|---|
| 2026-08-25 | 补充 | 导语与站内关联指向新增的 AI 平台汇总(平台网址清单) |
| 2026-08-24 | 扩写 | 由清单式占位扩写为供应商全景 + 定价结构对比 + 能力维度深度 + 实测方法论 + 多模型路由分层 + 风险与锁定;兑现「待补充」中可落实项(定价结构、实测方法),具体数字留待实测回填 |
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用