开源与闭源模型生态
模型生态:开源与闭源阵营的格局、差异与选型
2026 年的模型供给分成两大阵营:开源(open weights)与闭源(closed API)。本页从生态与选型视角回答三个问题:阵营里都有谁、许可证明面上有什么区别、产品和团队该怎么选。单模型的能力、定价与推理机制不在本页展开,分工见下一节。
与相邻页面的分工
| 页面 | 回答什么 |
|---|---|
| 本页(model-ecosystem) | 生态格局:阵营、许可证、选型框架、迁移风险 |
| 模型能力与选型 | 单模型能力与定价快照、effort 档位、多模型路由 |
| 模型推理与部署 | 推理机制:为什么慢、怎么优化、私有化部署 |
| 模型训练与对齐 | 训练、微调、蒸馏与对齐 |
| LLM API 与供应商 | 供应商全景、API 选型、合同与锁定 |
生态格局:两大阵营
开源阵营
开源阵营以「开放权重 + 免费下载」为共同点,但各自的定位、许可证与中文友好度差异很大。按「谁在发、发什么、能不能商用」三条线看:
- Qwen(阿里):参数档位最全(0.6B-235B),全系 Apache 2.0,中文与本地部署生态最成熟。Qwen3 支持思考/非思考双模式切换,MoE 版(如 Qwen3-MoE)是稀疏激活路线的代表
- DeepSeek(深度求索):性价比路线,推理能力开源化开创者。V4 系列 1M 上下文、思考默认开启;R1 蒸馏出 1.5B-70B 小模型,MIT 许可,开源推理模型绕不开的参照系
- Llama(Meta):开源生态的起点,2023 年引发本地部署浪潮。Llama 4 Scout/Maverick 为开源旗舰,MoE 架构、10M/1M 上下文,权重需 Meta 许可门控,商用门槛最高
- Mistral(Mistral AI):欧洲厂商,模型高效,对欧洲合规(GDPR)有天然优势。Mixtral 8x7B 最早验证 MoE 稀疏激活的性价比,开源与平台 API 双轨
- Gemma(Google):轻量级模型线,面向端侧、边缘与入门部署,参数量小、适合原型与离线场景,许可证同样带使用限制
| 模型线 | 来源 | 参数量级 | 许可证 | 中文能力 | 定位 |
|---|---|---|---|---|---|
| Qwen3 | 阿里 | 0.6B-235B | Apache 2.0 | 强 | 全档位通用 + 私有化首选 |
| DeepSeek V4 / R1 | 深度求索 | R1 1.5B-70B | MIT | 强 | 推理 + 性价比 |
| Llama 4 | Meta | MoE 旗舰 | Llama 许可 | 中 | 开源旗舰 / 英文生态 |
| Mistral | Mistral AI | 7B-123B 量级 | Apache / MIT 混 | 弱 | 欧洲合规 / 高效部署 |
| Gemma | 1B-27B 量级 | Gemma 许可 | 弱 | 端侧 / 边缘 / 原型 |
开源阵营的中文优势
Qwen 与 DeepSeek 在中文预训练语料上投入大,词表与 tokenizer 对中文更友好:同样内容中文 token 数更少、理解更好(机制见 大模型基础 的 Token 一节)。
中文产品的私有化选型先看这两家,英文或欧洲市场再看 Llama 与 Mistral。
闭源阵营
闭源阵营以「托管 API + 按量付费」为共同形态,模型权重不公开,能力通过 API 交付:
- OpenAI:GPT-5.6 家族(sol/terra/luna)档位齐全,生态、文档与第三方集成最全,新能力落地最早。o 系列(o3-pro、o4-mini)作为推理专用线仍可调用
- Anthropic:Claude 5 家族(Fable/Opus/Sonnet/Haiku)四档梯度,除 Haiku 外 1M 上下文,长时 Agent 与企业场景最强
- Google:Gemini 3.x 全系默认思考,Pro/Flash 两条线,多模态与搜索整合是差异点
- 国产闭源:智谱 GLM、字节豆包/Seed、MiniMax、阿里通义托管 API 等,人民币计价、境内数据合规链路完整、中文优化好。国产闭源的差异化:与国内云生态(阿里云百炼、火山引擎、华为云)深度集成,政企采购流程完整,且多数提供开源与闭源双轨(如 Qwen 开源 + 通义托管 API)
闭源阵营的共同代价:数据出域、按量计费、行为由供应商掌控。国产闭源与海外闭源在网络、合规与定价玩法上差异明显,详见 LLM API 与供应商 的国产 vs 海外一节。
能力差距与收窄趋势
2026 年开源与闭源旗舰的差距显著收窄,但没有消失。把时间线拉长看,差距的形态在四年里经历了四个阶段:
- 2023 年:开源落后闭源一个代际。Llama 系只能做原型与本地小任务,前沿能力几乎全在闭源
- 2024 年:MoE 与长上下文拉近距离。Mixtral、Qwen-MoE 验证稀疏激活,开源在成本效率上开始反超
- 2025 年:推理能力开源化。DeepSeek-R1 用纯强化学习训出推理能力,并把思考过程蒸馏给 1.5B-70B 小模型,32B 蒸馏版在数学基准上超过 o1-mini(见 模型训练与对齐 的蒸馏一节)
- 2026 年:差距变成分任务、分维度的局部问题。中文、代码、数学、常规推理上开源对齐闭源;长尾事实、复杂多模态、长时 Agent 仍是短板
差距收窄的三个机制:
- 蒸馏:把大模型能力压缩进小模型,让开源模型在具体任务上逼近闭源旗舰(机制见 模型训练与对齐)
- 开源推理模型:Qwen3 Thinking、DeepSeek-R1 等把「思考」带到本地,推理不再只是闭源 API 的卖点
- 评测驱动的迭代:开源社区用公开评测集快速迭代,厂商把评测结果当发布门槛,短板被逐项补齐
结论:能力差距已经变成分任务、分维度的局部问题,不再是无条件的整体劣势。判断一个场景能不能用开源,跑自己的评测集,不要凭阵营下结论(评测方法见 评估与评测)。
差距收窄不意味着处处可用
公开基准上的接近,不等于你的任务分布上接近。开源模型在通用问答上追平,不代表它在你的长尾业务、专有格式、多轮工具调用上同样追平。
每个候选模型都要在自有评测集上过一遍,再下结论。
MoE 趋势:开源的效率武器
MoE(Mixture of Experts,专家混合) 是 2024 年起开源阵营的主线架构:把 FFN 层替换成多个专家子网络,每次只激活少量专家,用总参数买容量、用激活参数控制成本(机制见 模型推理与部署 的 MoE 一节)。
- Mixtral 8x7B 最早验证 MoE 的性价比:总参数约 47B、每 token 激活约 13B,推理成本接近 13B 稠密模型,能力明显更强
- DeepSeek V3/V4 把 MoE 做到极致,用激活参数控制成本,是「高能力、低价」路线的架构底座
- Qwen3-MoE 与 Llama 4 Scout/Maverick 跟进,MoE 成为开源旗舰的标准架构
对选型的意义:MoE 让开源模型在同等推理成本下提供更高能力,是开源收窄能力差距的底层驱动之一。但 MoE 部署更复杂:权重总参数大、需要多卡切分、路由带来通信开销,小显存设备跑不动,部署前要按 模型推理与部署 的显存公式算清楚。
开源模型的获取与部署渠道
- Hugging Face Hub:国际主流的模型仓库,模型卡、许可证、评测与示例一条龙
- ModelScope(魔搭):阿里系模型仓库,国内访问快,Qwen 等国产模型的官方发布地之一
- Ollama / llama.cpp:本地运行的最短路径,一条命令跑模型,适合原型与个人试用
- vLLM / SGLang:生产级推理引擎,提供 OpenAI 兼容 API,上线首选(部署路径见 模型推理与部署)
获取渠道本身不是选型维度,但决定团队上手成本:国内团队选 ModelScope + 国产模型链路短,海外团队走 Hugging Face 生态全。模型、许可证与评测信息以官方仓库为准,第三方镜像与分支要自己验证。
许可证实务意义
许可证决定一个模型能不能商用、能不能改、改了能不能再分发。这是选型的第一道闸门:能下载不等于能商用,能商用不等于无限制。
主流许可证对照
| 许可证 | 商用 | 修改与衍生 | 再分发 | 代表模型 | 关键注意点 |
|---|---|---|---|---|---|
| Apache 2.0 | 允许 | 允许 | 允许 | Qwen3 全系 | 需保留版权声明;含专利授权条款 |
| MIT | 允许 | 允许 | 允许 | DeepSeek-R1 蒸馏版、Mistral 早期模型 | 最宽松,需保留版权声明 |
| Llama 许可 | 有条件允许 | 有限制 | 有限制 | Llama ¾ 系列 | 商用需接受 Meta 条款,再分发受限,不构成开源 |
| Gemma 许可 | 有条件允许 | 有限制 | 有限制 | Gemma 系列 | 禁止军用等特定用途 |
| RAIL 类 | 有条件允许 | 视条款 | 视条款 | 部分社区模型 | 附加使用限制(如禁止医疗/军事) |
open weights ≠ 开源
「开源模型」在行业内多数是开放权重(open weights):发布方公开的是训练好的权重文件,不是完整的开源软件。
- 开源(open source)按 OSI 定义,要求源代码、构建流程、修改与再分发权利都开放
- 开放权重只开放权重,训练数据、训练代码与数据管线通常不公开
- 许可证决定使用边界:Apache 2.0 / MIT 接近自由使用,Llama / Gemma / RAIL 类附加商用门槛与用途限制
三者的形态差别:
| 形态 | 权重 | 训练数据 | 训练代码 | 修改与再分发 | 代表 |
|---|---|---|---|---|---|
| 闭源 | 不公开 | 不公开 | 不公开 | 禁止 | GPT-5.6、Claude 5、Gemini 3.x |
| 开放权重 | 公开下载 | 通常不公开 | 通常不公开 | 视许可证 | Llama、Qwen、DeepSeek、Gemma |
| 真正开源 | 公开 | 公开 | 公开 | 允许 | 少量社区模型、旧代模型 |
对产品经理,这条辨析有实务实感:把开源权重接入商用产品前,先查许可证原文。常见踩坑:以为「GitHub 上有仓库」就能商用;用了 Llama 许可的模型做闭源产品,再分发时发现被条款卡住;衍生模型沿用上游许可证,把限制也继承下来(呼应 大模型基础 的开源辨析)。
许可证对商用、衍生与合规的实际影响
- 商用:决定产品能不能收费、能不能嵌进闭源交付物。Apache 2.0 / MIT 直接放行;Llama 许可对月活超门槛的商用有额外申请流程,RAIL 类对特定行业(医疗、军事)设禁
- 衍生:决定微调后的模型归谁、能不能再分发。多数许可证要求衍生模型沿用上游许可证,商用衍生品要把上游的保留声明一并带过去
- 合规:保留版权声明、专利声明,满足出口管制与军用限制。用开源模型生成的数据再训新模型,还涉及训练数据来源的合规争议,立项前要与法务确认
许可证会变,别用记忆代替查证
同一个模型的许可证可能在版本迭代中收紧:早期版本宽松、后续版本加限制的情况出现过不止一次。
立项与发布前各查一次官方仓库的 LICENSE,并把许可证版本写进选型记录。
怎么看一份模型许可证:五查清单
- 查商用:能不能收费卖服务、能不能嵌入闭源产品、有没有月活/规模门槛
- 查衍生:微调后的模型能不能再分发、要不要沿用上游许可证
- 查用途限制:有没有行业禁止(医疗、军事、监控)
- 查版本范围:许可证适用哪个版本,后续版本是否可能变更
- 查专利授权:有没有显式专利授权与终止条款(Apache 2.0 有,MIT 没有)
选型决策框架
选型的本质是在六条维度上做权衡:能力、成本、数据隐私、定制自由、生态与工具链、长期锁定。
六条维度的展开
- 能力:目标任务上的实测效果,用自有评测集对比;闭源旗舰整体领先,开源在中文/代码/数学/推理上收窄
- 成本:闭源按量付费、零运维;开源是固定算力成本,规模化后边际成本低,但自担 GPU 与运维(算账方法见 LLM 成本测算)
- 数据隐私:闭源数据出域、留存与训练策略各异;开源权重私有化部署后数据不出域,合规可控
- 定制自由:闭源只能调参、用工具、做 RAG;开源可微调、可改权重、可完全掌控版本与行为
- 生态与工具链:闭源 SDK、文档、第三方集成最成熟;开源的部署生态(Ollama、vLLM、SGLang)成熟,企业级配套略薄
- 长期锁定:闭源换供应商要搬接口、prompt、评测;开源权重在手,切换成本低,但要自己跟进版本
三路权衡:开、闭与混合
| 维度 | 闭源 API | 开源私有化 | 混合(路由) |
|---|---|---|---|
| 能力 | 前沿,持续更新 | 接近,自己跟进版本 | 分层各取所需 |
| 成本 | 按量付费,零运维 | 固定算力,自担运维 | 量大本地、难任务 API |
| 数据隐私 | 数据出域,条款各异 | 数据不出域 | 敏感本地、常规出域 |
| 定制自由 | 低(只能调参/用工具) | 高(可微调、可改权重) | 按场景分配 |
| 生态工具链 | 最成熟 | 部署生态成熟,配套略薄 | 两者叠加 |
| 长期锁定 | 高(接口/prompt/评测绑定) | 低(权重在手) | 中 |
三条路不是互斥的终态,而是随业务阶段演进的路径:起步用闭源 API 快速验证,调用量大了把常规量迁到本地开源,最难任务保留 API 旗舰兜底(路由做法见 模型能力与选型 与 LLM API 与供应商)。
三路各自的适用信号
选闭源 API:
- 团队没有 GPU 运维能力,或不想养推理团队
- 需要最新最强的能力,等不起开源跟进
- 调用量小、波动大,按量付费比固定算力划算
- 快速验证产品假设,上线速度优先
选开源私有化:
- 数据敏感,明确要求不出域
- 调用量大到 API 账单失控,自建成本更优
- 需要深度定制:微调、改权重、完全掌控版本
- 业务对延迟、可用性有自建才能满足的要求
选混合(路由):
- 常规量稳定、峰值与难题并存
- 想用开源摊薄成本,又不愿放弃闭源旗舰的能力
- 已具备推理运维能力,接口层已抽象
评估开源项目健康度
选中一个开源模型前,除模型本身外还要评估项目的健康度,避免选到「下载容易、维护没人」的分支:
- 治理:发布方是否持续维护,版本节奏是否稳定,有没有明确路线图
- 社区:Issue 响应、讨论活跃度、第三方集成数量(推理引擎、框架、工具链)
- 衍生生态:微调版本、量化版本、部署教程是否丰富
- 许可证清晰度:LICENSE 文件是否明确,是否随版本更新,有无附加条款
- 商用记录:有没有已知的商用落地案例或法务先例
分场景建议
| 产品场景 | 推荐路径 | 理由 |
|---|---|---|
| 对话助手(面向 C 端) | 闭源 API + 快模型分层 | 上线快、能力强、弹性大 |
| 企业私有化(敏感数据) | 开源私有化部署 | 数据不出域、合规可控 |
| RAG 知识库 | 开源或闭源均可,重点在检索 | 模型能力要求中等,阵营差距不敏感 |
| Agent(多工具长链路) | 闭源旗舰为主,开源作备选 | 工具调用与长链稳定仍领先 |
| 成本敏感(高调用量) | 开源私有化 + 路由降级 | 规模化边际成本低 |
| 出海(目标市场合规) | 按目标市场选区域厂商或开源 | GDPR 等法规决定数据边界 |
成本曲线:什么时候自建划算
- 闭源 API:成本随调用量线性上涨,单价再便宜也架不住量;适合用量小、波动大、起步期
- 开源私有化:固定算力成本 + 运维人力,存在一个反转点:当 API 账单接近自建算力成本时,自建开始划算
- 混合:常规量走本地摊薄固定成本,峰值与最难任务走 API 按需扩容,兼顾成本与弹性
反转点没有固定公式,取决于调用量、输入输出长度、GPU 利用率与人力成本。用 LLM 成本测算 的公式套真实用量先算账,再决定走哪条路。
一个典型的混合架构
某企业客服产品:常规 FAQ 走本地部署的 Qwen3(量大、敏感、要稳定),疑难问题与多轮情绪对话路由到闭源旗舰,失败或低置信再升级到更强档位。
成本曲线:常规量占 90%,本地推理把月账单压到纯 API 方案的两成;旗舰 API 只承担最难 10%,账单可控。
选型六步流程
- 列任务清单:梳理产品核心任务,标注输入/输出形态与出错后果(致命/一般/可容忍)
- 建评测集:每个任务收集 20-50 条真实样本,覆盖常规、边界与失败案例,人工标注期望结果
- 跑候选:同一评测集跑开/闭/混合候选,记录正确率与错误类型分布(方法论见 评估与评测)
- 算成本:按真实用量套定价算月账单,标注反转点;思考 token 计入输出成本
- 查合规:逐条读数据条款与许可证原文,敏感数据先划数据边界
- 留退出通道:接口抽象、prompt 版本化、评测集存档,让切换随时可行
生态迁移风险
选型决定一条会随时间演化的路径,迁移风险要提前评估。
闭源厂商锁定
- 接口耦合:换供应商要改调用、prompt、工具定义与评测基线。OpenAI 兼容 API 缓解了接口层,但提示词与评测集仍绑定具体模型
- 行为漂移:模型更新会悄悄改变输出,需要灰度与持续回归(见 评估与评测)
- 商业风险:涨价、下架、改条款、合规变化都可能发生,「换不起所以接受涨价」是最被动的局面
锁定分三个层次,缓解难度递增:
| 层次 | 锁定内容 | 切换成本 | 缓解手段 |
|---|---|---|---|
| 接口层 | API 格式、SDK、鉴权 | 低 | OpenAI 兼容 API、网关适配层 |
| 行为层 | prompt、工具定义、输出风格 | 中 | prompt 版本化、灰度回归 |
| 评测层 | 评测集、基线阈值、监控口径 | 高 | 评测集存档、双底座评测 |
缓解:第一天就抽象接口层,保留双供应商评测,把 prompt 与评测集版本化(详见 LLM API 与供应商 的风险与锁定一节)。
开源版本漂移
- 版本跟进成本:模型迭代按月计,本地部署要自己跟进新版本、重新评测、灰度替换
- 许可证变更:新版本可能换许可证,旧版本停止维护,出现「想升级但条款变紧」的两难
- 依赖链漂移:推理引擎(vLLM、SGLang、Ollama)与模型版本的兼容性随两者迭代变化,升级模型前要验证引擎支持
- 社区分叉:热门模型会出现多个社区微调分支,质量参差,选用分支要自己承担评测与维护
从闭源迁开源的现实障碍
- 能力落差:长尾事实、复杂多模态、长时 Agent 仍是开源短板,迁移前要逐任务评测确认
- prompt 迁移:为闭源模型调优的 prompt 换到开源模型后行为会变,需要重新调优与回归
- 评测集与基线重建:闭源评测基线不能直接外推,要在开源模型上重跑并重新定阈值
- 运维能力:私有化要求团队具备 GPU 运维、监控、扩缩容与版本管理能力
- 成本曲线反转点:API 账单超过自建算力成本时才划算,调用量小的时候自建反而更贵
迁移的正确姿势
迁移的关键是长期保持可迁移性:接口抽象、评测集、prompt 版本化、双供应商/双底座评测。
这些习惯让每一次切换都变成低成本的常规操作,而不是事故现场第一次跑。
生态趋势展望
- 开源继续收窄差距:蒸馏、MoE 与开源推理模型三个引擎还在发力,2026 年后开源在中长尾任务上的可用性只会更高
- 闭源转向「系统」竞争:单模型能力差距缩小后,闭源厂商把竞争点移到 Agent 系统、工具链、企业级支持与生态锁定
- 混合成为常态:开闭源的边界不再是非此即彼,「本地开源扛量 + API 旗舰兜底」会成为大流量产品的默认架构
- 许可证博弈加剧:头部厂商用许可证做商业护城河,开源与「开放权重」的定义之争影响选型合规口径,跟进许可证变更成为常态化工作
来源说明
本文为原创整理,综合以下官方资料撰写,访问验证日期 2026-08-27;模型、价格与许可证变动频繁,以各官方页面为准。
- Apache License 2.0:开源许可证文本
- MIT License:开源许可证文本
- OSI Open Source Definition:开源定义
- Responsible AI Licenses:RAIL 类限制性许可
- Meta llama-models:Llama 4 模型与许可
- Qwen3:Qwen3 系列与 Apache 2.0 许可
- DeepSeek-R1:R1 模型卡、蒸馏与 MIT 许可
- Google Gemma:Gemma 模型与许可
- Mistral:Mistral 模型线
- Anthropic Models Overview:Claude 5 家族能力与定位
- OpenAI Reasoning Guide:推理模型与 effort 档位
- Gemini Pricing:Gemini 3.x 定价
- 站内关联:模型能力与选型、大模型基础、模型推理与部署、模型训练与对齐、LLM API 与供应商、LLM 成本测算
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用