跳转至

LLM API 与供应商

LLM API 与供应商

模型 API 是 AI 产品的"发动机"。本页整理选择和使用模型服务的关键视角:模型服务怎么选、怎么用,覆盖供应商全景、定价结构、能力维度、实测方法与风险控制,是 tools 区块的选型目录页。知识机制类内容(Transformer、Token、KV Cache、推理优化)见 大模型基础 与 模型推理与部署,本页不重复讲原理;具体算账方法见 LLM 成本测算;主流模型的能力与价格快照见 模型能力与边界;调用与免费试用的平台网址清单见 AI 平台汇总。

供应商维度

  • 闭源 API(OpenAI、Anthropic、Google、阿里、字节、腾讯等):开箱即用、能力最强、按用量付费
  • 开源模型(Llama、Qwen、DeepSeek 等):可私有化部署、数据可控、规模化成本低
  • 国产 vs 海外:数据合规、网络延迟、定价策略差异大

三条线之外,还有一个常被忽略的维度:入口渠道。同一个模型的 API 可能从多条渠道购买:官方直连、云厂商转售(Azure OpenAI、Amazon Bedrock、Google Vertex AI)、国内云托管(阿里云百炼、火山方舟、华为云)与聚合网关。渠道不同,SLA、数据条款、账单与合规口径也不同:企业客户常因合规审计走云厂商渠道(拿统一账单、安全认证),个人与创业团队多走官方直连(最便宜、新功能最快);同模型在不同渠道的价格可能不同,签约前把渠道差异当定价维度一起比。

选择顺序建议:先定数据政策与合规边界(能不能出域、能不能关训练开关),再在边界内比能力,最后谈价格与条款:价格最透明,也最不该是首要决策项。

flowchart TD
    policy[数据政策与合规边界] --> channel[确定可用渠道]
    channel --> ability[用自有评测集验证能力]
    ability --> load[压测速率、并发与延迟]
    load --> terms[核对数据条款、SLA 与可观测性]
    terms --> price[按真实用量测算价格与 TCO]
    price --> pilot[灰度上线并持续监控]

供应商选型不是先比单价,而是先过滤不可用边界,再用真实任务验证能力、工程表现与长期成本。

三条线的适用场景速判
  • 闭源 API:快速上线、前沿能力、不想养 GPU 团队、用量弹性大:几乎任何产品起步期的最优解
  • 开源模型:数据敏感、调用量大到 API 账单失控、需要完全掌控版本与行为:规模化后的主流路径
  • 混合:本地开源扛常规量,API 旗舰兜底最难任务:大型产品的常见终态(见 模型推理与部署 的部署决策表)

选型评估清单

维度关注点
能力目标任务上的实测效果(用你自己的评测集)
价格输入/输出单价、缓存价、批量价
速率与并发RPM/TPM 限制是否满足峰值
延迟首 token 时间、流式能力
数据政策数据是否用于训练、是否留存、传输地域
稳定性SLA、限流与故障历史
生态SDK、工具调用、多模态支持
工具调用Agent 场景的 function calling 正确率与多轮稳定性
推理深度是否需要思考模式 / effort 档位,思考 token 的计费方式
多模态图像 / 音频 / 视频输入是否必需,按张 / 按秒折算后的成本
地域与合规数据存储地域、是否可关闭训练、境内备案要求
可观测性用量明细、成本拆分、日志与审计接口

清单的每一条都要落到可验证的动作,否则只是纸面检查:能力 → 跑评测集;价格 → 查官方定价页并做算账表;速率与延迟 → 压测脚本实测;数据政策 → 逐条读数据条款原文;稳定性 → 查状态页历史与 SLA 文档。评测怎么做见 实测方法论,算账见 LLM 成本测算。

成本优化三板斧

  1. 模型分层:简单任务用便宜小模型,难任务才上旗舰
  2. 缓存:相同请求命中缓存,显著降低成本
  3. 提示词精简:省 token 就是省钱(提示词压缩、上下文管理)

展开说:模型分层的落地做法(分几层、路由规则、降级链)见 多模型路由与分层,成本测算与杠杆排序见 LLM 成本测算;缓存要求 prompt 前缀字节级稳定(系统提示、知识库片段放前缀,别在开头插时间戳),命中部分按折扣价计费、通常比原价低一个量级(以官方页面为准),机制见 模型推理与部署 的提示词缓存节;提示词精简的收益是双重的:输入省 token 直接省成本,输出端设 max_tokens 上限压话痨,输出单价通常高于输入,压输出往往比压输入见效更快(技巧见 提示词工程)。

三板斧之外还有补充杠杆:批处理折扣(离线任务通常 5 折左右)、错峰时段折扣、蒸馏 / 微调小模型替代大模型:具体测算与适用条件见 LLM 成本测算。

实操建议

  • 与供应商签合同前先跑你自己数据的压测
  • 关键路径不要单点依赖一家:抽象一层接口,保留切换能力
  • 用量告警:设置每日/每月成本上限,防止失控
  • 主流供应商定价对比与模型能力速览:见 模型能力与边界(含 2026-08-23 定价表)

再补几条上线前后高频踩坑的经验:

  • 密钥管理:每环境独立 key(开发 / 测试 / 生产分开),生产 key 设额度上限与告警,定期轮换;密钥进密钥管理服务,不进代码仓库(仓库泄漏扫描 CI 常抓这个)
  • 灰度切换:换模型或换供应商先在 5%-10% 流量灰度,对比质量、延迟、成本指标再放量;模型升级会悄悄改变行为(话术、边界、格式),不灰度直接全量有风险(回归方法见 评估与评测)
  • 线上监控:错误率、延迟分位数(P95/P99)、token 消耗与成本占比上每日看板;错误率突增先看是不是限流(429)与模型端故障
  • 合同条款:除价格外重点看 SLA 承诺、数据条款(是否用于训练、留存时长)、价格调整通知期与退出机制:供应商涨价或改条款时你要有"转身"的时间
待补充

主流供应商与模型家族(2026 视角)

下表为 2026 年主流供应商全景,价格为量级参考,具体数字一律以各官方页面为准;模型能力与边界 有 2026-08-23 的能力与定价快照,两页配合看。

供应商代表模型(2026)上下文量级多模态 / 工具调用价格带(量级)适合场景
OpenAIGPT-5.6 家族(sol / terra / luna)及 o 系列遗留长上下文为主,以官方为准文本 + 图像;工具调用成熟三档拉开,旗舰输入 $4-20/M 量级通用对话、Agent、代码,生态与文档最全
AnthropicClaude 5 家族:Fable 5 / Opus 5 / Sonnet 5 / Haiku 4.5除 Haiku 4.5 外 1M文本 + 图像;工具调用与长时 Agent 强四档梯度,$1-10/M 输入量级长时 Agent、复杂编码、企业场景
GoogleGemini 3.x:3.1 Pro / 3.6-3.7 Flash百万级(以官方为准)文本 + 图像 / 视频;思考默认开启快档有免费额度,付费档较低多模态理解、搜索整合、Agent
xAIGrok 系列(旗舰 / 快档)以官方为准以官方为准以官方为准实时信息、与 X 生态结合的场景
MetaLlama 4(Scout / Maverick)Scout 宣称 10M,Maverick 1M文本 + 图像;权重开放(许可门控)权重免费,自付推理成本私有化部署、数据敏感场景
DeepSeekV4-Pro / V4-Flash,R1 系列蒸馏小模型1M文本为主,视觉实验型号;思考默认开启国内定价极具竞争力,错峰半价中文场景、性价比优先、推理任务
阿里Qwen 系列(0.6B-235B 开源)+ 通义 / 百炼托管 API百万级(以官方为准)文本 + 图像;全系开源 Apache 2.0权重免费;托管 API 人民币计价中文场景、开源私有化、与阿里云生态集成
智谱GLM 系列(开源 + 开放平台)以官方为准文本 + 图像;Agent 场景强人民币计价,以官方为准中文对话、Agent、高校与政企
MistralMistral 系列(开源 + 平台 API)以官方为准文本为主以官方为准欧洲合规要求、开源部署
MiniMaxMiniMax 系列(文本 + 语音)以官方为准语音能力突出人民币计价,以官方为准语音交互、角色对话、中文场景
字节豆包 / Seed 系列(火山引擎)以官方为准文本 + 图像 + 语音人民币计价,以官方为准中文场景、与抖音 / 飞书生态集成

海外厂商观察

  • OpenAI:产品线最全的生态位:从旗舰到低价档位齐全,文档、SDK 与第三方集成最成熟,新能力(推理档位、实时语音)往往最先落地;「按需分配 effort」是官方推荐思路,而非手动切换模型(Reasoning Guide)
  • Anthropic:四档定价梯度本身就是选型工具:Haiku 4.5 最快最便宜、Sonnet 5 速度智能兼顾、Opus 5 面向复杂编码与企业、Fable 5 为最强且面向长时运行 Agent;官方工程博客对 Agent 架构与路由原则的阐述最系统(Models Overview)
  • Google:Gemini 3.x 全系默认思考,Pro 与 Flash 两条线定位清晰;与搜索、Android、Workspace 生态深度整合,多模态(视频理解)是其传统强项
  • xAI:Grok 系列与 X 生态实时信息结合是其差异点;迭代速度快,适合关注实时信息类产品的团队纳入备选
  • Mistral:欧洲厂商,开源与 API 双轨,对欧洲合规(GDPR)有天然优势;模型主打高效,适合欧洲市场产品

国内厂商观察

  • DeepSeek:V4 系列 1M 上下文、思考默认开启,API 同时兼容 OpenAI 与 Anthropic 格式(换供应商成本最低),错峰时段半价;R1 系列蒸馏出 1.5B-70B 小模型,开源推理模型路线开创者(DeepSeek Pricing)
  • 阿里(Qwen / 通义):Qwen 全系开源(Apache 2.0)且参数档位齐全(0.6B-235B),本地部署生态成熟;百炼平台提供托管 API,与阿里云企业生态打通,中文能力与合规口径清晰
  • 智谱(GLM):中文对话与 Agent 场景表现稳定,开放平台面向政企与高校客户多,商务流程完整
  • 字节(豆包 / Seed):火山引擎托管,与抖音、飞书等字节生态集成度高,中文语音与多模态场景可选
  • 国内厂商共性:人民币计价、境内数据合规链路完整、中文优化好;对比时注意大额包、充值优惠与错峰折扣的玩法差异(以官方定价页为准),别只看单价表

国产 vs 海外:数据合规与网络差异

  • 数据合规:海外 API 默认数据可能出境、留存并用于改进产品(多数可关训练开关);国内产品用海外 API 要评估生成式 AI 合规要求(境内提供服务的算法备案等,见 出海与合规);国产 API 数据留在境内,对国内合规与政企客户更友好,但出海产品反过来要考虑对方市场的合规(如 GDPR)
  • 网络与访问:海外 API 在国内访问存在稳定性与延迟问题,企业通常走专线或云厂商海外节点中转;国内 API 在海外同理。网络差异要当功能问题测,不是"能通就行"
  • 定价策略:海外按美元计价、随汇率波动;国内人民币计价、常有大额包与充值优惠;错峰、批处理、免费额度的玩法各家不同,具体以官方定价页为准
  • 能力差异:2026 年国产旗舰在中文、代码、数学上已与海外旗舰接近(差距在收窄),但长尾能力、生态成熟度与文档仍有差异。用你自己的评测集下结论,别用国籍下结论

定价与计费结构对比

各供应商的计费结构大同小异(Token 计价是主流,输入 / 输出分价、输出更贵),差异在折扣玩法与免费额度。下表为结构对比,具体数字以官方页面为准;2026-08-23 的价格快照见 模型能力与边界。

供应商输入 / 输出单价缓存折扣批处理折扣免费额度
OpenAI按型号分档(快 / 中 / 旗舰),以官方为准命中缓存输入约为原价 1/10批处理约 5 折有限免费额度(以官方为准)
Anthropic四档梯度,以官方为准有缓存价(以官方为准)有批处理价(以官方为准)视活动而定,以官方为准
GooglePro / Flash 分档,以官方为准有缓存价(以官方为准)有批处理价(以官方为准)Flash 档有免费额度
DeepSeek人民币计价,以官方为准以官方为准以官方为准错峰时段半价(非批处理,属时段折扣)
国内厂商(阿里 / 智谱 / 字节等)人民币计价,以官方为准部分提供,以官方为准部分提供,以官方为准多有新手免费额度
价格是变动项,不是静态事实

模型价格频繁调整,且同一供应商的不同渠道(官方直连 vs 云厂商转售)价格可能不同。任何"定价对比"都要标注日期与渠道,签约与算账前重查官方定价页。

本页表格只保证结构正确,不保证数字新鲜。

怎么看官方定价页(五步法)

  1. 先找对型号:定价页按型号 / 档位列价,别拿旗舰价当全系价;注意"预览版"与"正式版"可能同价不同命
  2. 看单价:输入 / 输出分开列,单位通常是美元 / 百万 token($X/M);思考模型要确认思考 token 是否计入输出价
  3. 看缓存价:prompt 缓存命中部分的单价,通常远低于原输入价;这决定你固定前缀策略的收益上限
  4. 看批处理价:离线任务走批处理队列的折扣价与延迟承诺(通常小时级)
  5. 看免费额度与限流:免费层的速率限制(RPM / RPD)与额度、付费层的配额、以及超出后的计费规则

多模态与特殊计费(图片按张折算、音频按秒、按座位订阅)在定价页的附加说明里,别漏看;全部看完后,用 LLM 成本测算 的公式套你的真实用量算账。

折扣都不是免费的,拿到折扣价的同时要看清代价:

  • 缓存折扣要求 prompt 前缀字节级稳定:固定内容放前缀、别在开头插时间戳或随机串,否则命中率上不去
  • 批处理折扣换的是延迟:小时级出结果,只适合离线任务(批量摘要、离线分类),不适合在线交互
  • 错峰折扣(如 DeepSeek 深夜半价)限制时段,适合能接受延迟调度的批量任务
  • 免费额度通常配严格限流(RPM / RPD),只够原型验证与评测跑分,不能当生产容量使用;正式上线前用付费 key 重新压测配额表现

能力维度深度

七个能力维度,每个给出"选型时怎么验证"。验证的总原则:在官方文档上确认能力存在,在自有评测集上确认能力可用:前者防"没有",后者防"有但用不好"。

能力维度的优先级按产品形态定

对话产品重延迟与稳定性,Agent 产品重工具调用与上下文,知识库产品重长上下文与数据政策,创作产品重多模态与输出质量。

先按产品形态排出前三维度,再逐项验证,不要七个维度平均用力。

上下文窗口与长上下文

  • 标称窗口 ≠ 有效窗口:1M 窗口不代表 1M token 都能被稳定利用,长输入下中间位置信息利用率下降(lost in the middle),关键指令放开头或结尾(机制见 大模型基础)
  • 上下文压缩是有代价的:长输入按 token 计费、注意力开销随长度增长、长上下文挤占并发:"全塞进去"是最贵的方案,长文档优先 RAG 检索 + 分段引用
  • 选型时怎么验证:用你的真实长文档(合同、代码库、论文)测"信息提取准确率随输入长度的衰减曲线";对比长上下文模型 vs 小窗口 + RAG 的成本与效果,别只比窗口数字

Tool Calling 可靠性

  • 工具调用(function calling)是 Agent 产品的命脉:模型要"选对函数 + 生成合法参数",多轮工具调用还要保持状态稳定(机制见 Agent 与工作流)
  • 选型时怎么验证:用你自己的工具 schema 集(含边界输入、必填参数、枚举约束)测三项:正确选函数率、参数合法性(JSON Schema 校验)、多轮调用后的状态保持率;解析失败率是换模型最直接的信号,Agent 场景别只看问答类基准

多模态输入

  • 图像按张折算 token(分辨率不同价格不同)、音频 / 视频按秒折算;多模态输入同样按 token 计费,折算规则以官方为准(见 多模态)
  • 选型时怎么验证:用真实截图、PDF、扫描件、图表样例测 OCR 准确率与图表理解能力;注意"能看图"和"图里的数字读得对"是两回事

推理模型与普通模型

  • 推理模型输出前先思考,思考 token 按输出计费,首 token 延迟显著更长;effort / thinking 档位可调(none → max),"思考默认开启"已成 2026 年旗舰标配(见 模型能力与边界)
  • 选型时怎么验证:同一评测集跑"思考开 vs 关"两档,记录正确率提升与成本 / 延迟增加的比例;对"思考后仍错"的样本单独归类。那是最值得换模型或加护栏的信号;数学代码类任务用多次采样 + 验证器(pass@k)而非单次生成

延迟与吞吐

  • 关键指标:首 token 时间(TTFT)、生成速率(TPOT)、RPM / TPM 配额;长输入拖慢 TTFT,长输出拖慢整体,流式输出改善体感(机制见 模型推理与部署)
  • 选型时怎么验证:压测脚本按输入长度分段记录 P50 / P95 / P99 延迟;并发压到配额上限,看限流后的退避与重试行为;把延迟预算写进 SLA 再选型(延迟是设计出来的)

SLA 与限流

  • 供应商的可用性承诺、限流策略(突发 vs 平滑)与错误码(429、5xx)各不相同;状态页是事故的第一现场
  • 选型时怎么验证:读 SLA 文档与状态页历史;压测确认配额上限与恢复行为;客户端设计指数退避与降级,把供应商抖动当必然事件对待

数据政策

  • 三个必查项:数据是否用于训练(能否关训练开关)、数据留存时长、传输与存储地域;敏感数据与高风险场景走私有化部署(见 模型推理与部署 与 出海与合规)
  • 选型时怎么验证:逐条读数据条款原文(不是营销页);把关训练开关的操作在控制台实际执行一遍并留档;企业采购时要求对方提供数据处理协议(DPA)

实测方法论

选型结论必须来自自有评测集的实测,而不是榜单与厂商演示。完整方法论见 评估与评测,这里给选型压测的操作清单:

评测集怎么来

  • 每个核心任务收集 20-50 条真实样本(不是模型生成的假样本),覆盖常规、边界与失败案例,人工标注期望结果
  • 来源:线上日志抽样、竞品公开案例、用户反馈与投诉、历史 badcase;新功能没有日志就先用模拟数据,上线后回填
  • 评测集是资产不是消耗品:随 badcase 持续扩充,模型与 prompt 变更后反复使用(评估与评测 的持续校准一节)
  • 标注口径要可复现:什么算"对"、什么算"错"、错误分几类(幻觉 / 漏答 / 格式 / 推理错),写进标注规范,否则多人标注结果不可比
评测集样例:客服问答任务 30 条
  • 常规 20 条:常见问题、带上下文的追问、多轮对话
  • 边界 6 条:超长输入、空输入、表情与错别字、中英混杂
  • 失败 4 条:知识库查不到的、需要拒答的、需要转人工的
  • 每条标注:期望回答要点、可接受的最低标准、错误分类:跑完一个模型,先看错误分布再谈总分

对比什么

维度指标说明
质量正确率、错误类型分布幻觉、漏答、格式错误分开统计
延迟TTFT、端到端、P95/P99按输入长度分段记录
成本单次 token 消耗 × 单价思考 token 计入输出
稳定性多次采样方差、错误率、配额表现单次结果不可信

多轮采样取均值

  • temperature > 0 时单次输出有随机性:同一输入跑 3-5 次,质量取众数 / 均值,延迟取分位数
  • 比较两个模型用同一评测集、同一采样参数、同一评测脚本,只改模型一个变量;换了参数等于换了实验
  • 统计口径要写进记录:均值还是 P95?冷启动还是稳态?流式还是非流式?没有口径的数字不可比(压测口径八项见 模型推理与部署)

Playground 与生产差异

  • Playground 无并发、无配额压力,结果不能外推生产容量;免费额度的速率限制与付费层不同
  • 生产环境多了并发、限流、缓存、批处理与灰度流量:上线前用生产 key 与真实流量形态压测,把 Playground 当功能演示、把生产压测当选型依据
  • 两处最容易踩的差异:缓存命中率(生产的前缀结构与 Playground 不同,缓存收益要按生产实测)与并发限流(Playground 单发看不出配额问题,并发压测才会暴露 429)

记录与回归

  • 每次选型留一张记录表(存档三个月后做增量):
日期模型 / 版本评测集质量P95 延迟单次成本结论
(示例)2026-08-24某旗舰 vs 某快模型客服 50 条92% vs 88%1.2s vs 0.4s$0.004 vs $0.001常规量走快模型,疑难升级旗舰
  • 模型更新、prompt 变更、供应商改价后重跑评测集;"上次测过"会过期,三个月是合理的刷新周期

多模型路由与分层

模型分层

  • 常规三层:简单任务(分类、抽取、改写、FAQ)走小模型 / 快模型 → 中等任务走中档 → 难题(复杂推理、长链规划)才上旗舰 / 推理模型
  • 层的数量够用就好:大多数产品三层足够,层数越多,路由与维护成本越高(各档位价格梯度见 模型能力与边界 与 LLM 成本测算)

路由器设计

  • 先模型内、后模型间:同一模型调 effort / thinking 档位是成本最低的路由(OpenAI none→max、Gemini minimal→high 各档均可映射为策略);评测证明不够再上模型间路由
  • 规则路由优先:输入信号取任务类型(意图识别结果)、输入长度、用户付费层级、历史成功率;示例:客服首轮走快模型,连续追问两次或前一次低置信自动升级
  • 语义路由:用 embedding 相似度把查询匹配到预定义任务模板,再按模板定档位;比规则灵活,但需要维护模板库
  • 路由阈值用评测集校准,上线后监控各档位的请求占比、成本占比与升级率:升级率异常高说明阈值偏激进,成本占比异常高说明偏保守

flowchart TD
    request[用户请求] --> signal{任务复杂度、长度、置信度}
    signal -->|简单| fast[小模型 / 快模型]
    signal -->|中等| mid[中档模型]
    signal -->|复杂| flagship[旗舰 / 推理模型]
    fast --> result{成功且置信度足够?}
    mid --> result
    flagship --> result
    result -->|是| answer[返回结果]
    result -->|否| fallback[升级、切备选或人工兜底]

路由把大多数请求留在低成本档位,把复杂度和失败重试集中到少数需要旗舰能力的路径上。

降级策略

  • 快模型失败或低置信 → 升级旗舰重试 → 仍失败进人工兜底或安全话术;这层逻辑放进产品架构,而不是靠模型自觉
  • 供应商抖动(限流 / 故障)时切备选供应商或本地模型:降级链要预先演练,别在事故现场第一次跑

何时不路由

  • 任务形态单一、调用量小、或评测证明两档无差异时,单模型更简单可靠;路由本身也有成本(复杂度、延迟、维护),只在评测证明值得时引入(官方原则见 Anthropic Building Effective Agents)

风险与锁定

单点依赖风险

  • 依赖单一供应商的风险:故障与限流(业务中断)、涨价与改价(成本失控)、模型下架 / 改名 / 行为漂移(效果变化)、政策与合规变化(不可用)
  • 缓解:关键路径保留备选供应商与本地部署选项(不一定要用,但要能切);接口抽象层让切换成本可控;模型变更走灰度

迁移成本

  • 换供应商要搬的东西:接口调用(OpenAI 兼容格式已是事实标准,多数平台直接兼容)、prompt 与系统提示(要移植与回归)、工具定义与结构化约束、评测集与监控基线
  • 缓解:第一天就抽象接口层(网关 / 适配器),prompt 与评测集版本化;"能换"本身就是议价筹码:不要让自己陷入"换不起所以接受涨价"的境地

数据出境与合规

  • 数据出境、训练开关、留存时长是选型的第一道闸门;国内提供生成式 AI 服务有备案等合规要求,出海产品要满足目标市场法规(GDPR 等):完整清单见 出海与合规
  • 敏感数据与高风险场景优先私有化部署;混合架构(本地扛量大、API 兜底最难)是常见折中(见 模型推理与部署)

供应商稳定性评估

  • 评估项:状态页与历史故障记录、SLA 承诺与赔偿条款、安全认证(SOC 2 等)、社区与开发者生态活跃度、商务条款(用量承诺、价格保护期、退出与数据返还流程)
  • 把供应商当外部团队管理:定期回顾其发布节奏、改价通知与路线图,任何重大变更触发你的选型复核
锁定是逐步形成的,别等到"换不动"才规划

接口耦合、prompt 依赖、评测基线绑定供应商、团队只会用一家的 SDK:每一样都在加深锁定。

锁定不可怕,不可逆的锁定才可怕:从第一天保留接口抽象、双供应商评测、评测集与 prompt 版本化,代价极小,却是事后迁移成本最高的部分。

来源说明

本文为原创整理,综合以下官方资料撰写,访问验证日期 2026-08-24;模型能力、价格与条款变动频繁,以各官方页面为准。

  1. OpenAI API Pricing:定价与计费结构
  2. OpenAI Reasoning Guide:思考模型与 effort 档位
  3. Anthropic Models Overview:Claude 5 家族能力与上下文
  4. Anthropic Pricing:四档定价梯度与批处理
  5. Anthropic Building Effective Agents:模型分层、路由与"先简单后复杂"原则
  6. Google Gemini API Pricing:Gemini 定价与免费额度
  7. DeepSeek Pricing:V4 定价、错峰折扣与上下文
  8. Qwen3 与 Meta llama-models:开源权重、许可证与部署生态
  9. 智谱开放平台、MiniMax 开放平台、火山引擎豆包大模型、阿里云百炼:国内厂商定价与模型页
  10. 站内关联:模型能力与边界(2026-08-23 定价表)、评估与评测、LLM 成本测算、出海与合规、多模态、AI 平台汇总(平台网址清单)

更新记录

日期变更说明
2026-08-25补充导语与站内关联指向新增的 AI 平台汇总(平台网址清单)
2026-08-24扩写由清单式占位扩写为供应商全景 + 定价结构对比 + 能力维度深度 + 实测方法论 + 多模型路由分层 + 风险与锁定;兑现「待补充」中可落实项(定价结构、实测方法),具体数字留待实测回填