跳转至

大模型基础

大模型基础

大语言模型(LLM,Large Language Model)是当前 AI 产品的核心技术底座。产品经理不需要会训练模型,但必须理解它怎么工作、能力边界在哪、成本从哪来——这三件事直接决定产品里哪些功能能做、该怎么做、要花多少钱。本文讲透大模型的基础机制;模型怎么训练、怎么部署,分别见 模型训练与对齐模型推理与部署

核心概念

先建立一张概念速查表,后续各节逐个展开:

概念一句话解释
参数模型内部的"旋钮",参数越多通常能力越强
Token模型处理文本的最小单位(约 1 个汉字 ≈ 1-2 个 token)
上下文窗口模型一次能"看到"的 token 上限,决定输入长度
温度 (temperature)输出随机性:低 = 稳定保守,高 = 多样发散
Top-P / Top-K采样时从候选 token 里截断的范围(配合温度使用)
系统提示词给模型的"角色设定与规则",优先级高于用户输入
流式输出一个字一个字地生成,不等全部完成
知识截止日期训练数据的时间边界,之后发生的事模型不知道
幻觉模型一本正经地编造不存在的知识或事实
推理模型输出前先"思考"(生成内部推理 token)的模型
预训练 / 后训练训练的两段式:先学语言与世界,再学"听话"(见 模型训练与对齐
基座模型 / 对话模型 / 推理模型按训练状态与能力取向分类:会续写 / 会对话 / 会思考

两个容易混淆的维度:一是"大"体现在哪里——参数量、训练数据量、计算量三者共同构成规模,长上下文和多任务能力是"大"的结果而非定义;二是"开源"的准确含义——很多"开源大模型"其实只开放权重(open weights),能否商用、修改、再分发要看具体许可证(如 Qwen 系 Apache 2.0 可商用、Llama 系需 Meta 许可门控),不能笼统说"开源就随便用"。

Token 与词表

Token 是什么

模型不认识文字,只认识数字。文本进入模型前,先由分词器(Tokenizer)把字符串切成一段段Token,再映射成词表里的整数 ID(Token ID),最后查表变成向量参与计算。Token 不一定是"词":一个汉字、一个英文子词、一个标点、一段空格都可能是一个 Token。整条链路是:

1
文本 → Tokenizer 切分 → Token 序列 → 词表映射 → Token ID → 向量 → 模型计算

四个相关概念要分清:

概念定义说明
Token切分后的离散单位不必然等于"词"
词表Token → 整数 ID 的映射表含特殊标记(开始、结束、角色标记等)
Tokenizer完整的分词流程归一化、预分词、子词切分、ID 映射
Token IDToken 在词表中的编号编号大小无语义,ID 100 和 101 不表示相近

BPE 分词直觉

主流分词算法是 BPE(Byte Pair Encoding,字节对编码),它的直觉可以概括为两句话:

  • 高频片段保留为整词:常出现的词(英文的 "the"、"AI",中文的"我们")直接作为整体切分,一个 token 一个词;
  • 低频词拆成子词:生僻词、新词、专有名词拆成更小的片段,由片段组合表达。

BPE 从字符/字节开始,反复合并语料里出现频率最高的相邻符号对,直到词表达到目标大小——词表大小与序列长度之间的平衡是设计核心:词表太大,嵌入层和输出层参数爆炸(词表 × 隐藏维度,且输入输出两份);词表太小,文本被切得太碎,序列变长、成本变高。字节级的兜底(byte fallback)保证任何字符串都能被编码——但"能编码"不等于"编得好":罕见词会被拆成很长的字节序列,模型理解差且成本高。

中文 Token 特性

中文没有空格分词,通常 1 个汉字 ≈ 1-2 个 token(常用字、常用词可能 1 字 1 token,低频词或生僻字可能拆成 2 个以上)。这意味着:

  • 同样内容,中文往往比英文更"费 token",成本测算时不能拿英文经验套中文(估算方法见 LLM 成本测算);
  • 词表里中文覆盖越好,中文序列越短、成本越低、理解越好——这是国产模型(Qwen、DeepSeek 等)在中文场景的优势之一;
  • 提示词长度、上下文规划都要按"中文 1 字 ≈ 1-2 token"的直觉估算,精确数字以各模型官方 tokenizer 实测为准;
  • 多语种共用词表时,高资源语言会占据大部分词表容量,低资源语言被切得更碎——"能编码所有语言"不等于"所有语言都编得好"。

Token 与成本

Token 是模型的运算单位、显存单位和计费单位:API 按输入/输出 token 分别计价,长输入和长输出直接推高成本;上下文窗口、KV Cache 显存也按 token 计数。产品经理必须建立"一切开销都以 token 计量"的心智模型:

  • 输入 token 包括系统提示词、工具定义、历史对话、检索内容——写 prompt 时这些"看不见的 token"都要计入;
  • 输出 token 单价通常高于输入,且输出长度不可控(模型可能话痨),要设 max_tokens 上限;
  • 具体测算方法见 LLM 成本测算
一次客服对话的 token 账单

一个典型客服场景:系统提示词 500 token + 工具定义 300 token + 知识库片段 800 token + 5 轮历史对话 2000 token = 输入 3600 token;每轮回答平均 150 token × 5 轮 = 输出 750 token。若模型报价输入 $1/M、输出 $6/M,单次会话成本约 3600×$1/M + 750×$6/M ≈ $0.008。看似一分钱不到,日活 10 万用户、人均 2 次会话,月成本就是 10 万 × 2 × 30 × $0.008 ≈ $48,000——"看不见的 token"(历史对话、工具定义、知识片段)往往是账单的大头。

Tokenizer 的边界

Tokenizer 是一套约定,不是自然规律:不同模型的词表、切分规则、特殊标记都不一样,同一个词在不同模型里的 token 数可以不同;文本规范化(空格、Unicode、大小写)也因实现而异。它在工程上还会成为事故点——2025 年 AWS Bedrock 的 Claude 服务出现过 tokenizer 偏移 bug(社区戏称 "bedtok"),导致输出与预期系统性偏差。教训是:tokenizer 行为要作为产品基线的一部分去验证,涉及长文档处理、上下文预算、字数统计("2000 字以内"靠 token 数推算)时不能想当然。

语言模型的核心机制

条件概率:预测下一个 token

大模型的本质是一个条件概率函数:给定上文,估计下一个 token 是什么。写成公式就是:

1
p(下一个 token | 上文)

比如看到"今天天气真",模型给"好"分配很高的概率。训练时,模型在海量文本上反复做这件事:每个位置都用前面的内容预测后面的内容,预测错的就调整参数。评价模型"有多会预测"有个指标叫困惑度(Perplexity)——模型对下一个 token 平均越有把握(概率越高),困惑度越低;但它只反映"拟合语言分布"的程度,不等于综合能力:一个只会复读的模型困惑度也可以很低。

这个目标看起来简单,但为了预测得准,模型被迫从文本里学习语法、语义、事实、指代关系、代码结构和推理线索——知识和推理能力就是这样被"逼"出来的。

自回归逐 token 生成

推理时模型一次只生成一个 token:预测出下一个 token 后,把它拼到上文末尾,再预测下一个,循环往复直到满足停止条件(生成结束符、达到长度上限、业务主动中止)。这个过程叫自回归生成,它决定了两个产品层面的重要事实:

  • 输出是流式的:模型本来就是逐 token 产出的,天然适合流式输出(见「温度与采样参数」节);
  • 输出有方向性错误累积:早期选错一个 token,后续可能被放大,也可能被上下文修正——所以"一次生成很长的回答"比"分步生成"更容易跑偏,这也解释了为什么复杂任务要拆步骤(见 提示词工程)。

生成什么时候停下来?模型"说完一句话"并不会天然停止——停止行为来自训练时学的结束标记(EOS)、运行时的停止序列(stop strings)、长度上限与业务控制(超时、用户打断)共同作用。输出截断、话痨不停、答非所问等产品问题,很多都能追溯到停止条件没设好。

为什么"预测下一个词"能学出知识与推理

一个常见疑问是:预测下一个词只是"文字接龙",怎么会产生真正的知识?答案在于压缩:要把海量文本的规律压缩进有限参数里,模型必须提取可泛化的结构,而不是死记硬背。它会学会"苹果"在公司语境下指科技公司、在水果语境下指食物;学会"因为……所以……"的因果模式;学会代码的语法规则。规模越大、数据越多,能提取的结构越复杂,推理能力越强——这就是「能力涌现与规模效应」一节的伏笔。

注意力与上下文:谁和谁相关

支撑"预测下一个词"的技术基础是 Transformer 架构,其中注意力机制是核心:每个 token 在计算时,会按"相关程度"从上下文的其他 token 那里加权取信息——"苹果"会从"公司"、"发布"那里取信息理解语境;"他打了她"里,动作与对象的绑定关系由注意力权重刻画。几个关键事实:

  • 多头注意力:模型从多个"角度"同时建立联系(语法关系、指代、远距离依赖),层数堆叠让信息反复加工、逐步抽象;
  • 位置编码:注意力本身不区分顺序("我打他"和"他打我"的 token 集合相同),要靠位置编码注入先后信息,现代模型多用 RoPE;
  • 知识分布在整个参数系统里:模型的知识与能力不是某个"知识文件",而是分散在全部参数中——所以知识无法"增删"(要更新知识得重新训练或用检索),也无法像数据库一样溯源;
  • 架构细节见 Transformer 架构深度学习基础,这里只需记住结论:注意力决定了"模型看到什么",上下文管理就是产品侧对注意力的引导

模型是怎么"思考"的

  1. 模型被训练来预测"下一个 token 是什么"
  2. 海量文本训练后,模型学会了语言的模式与知识
  3. 推理时按概率逐 token 生成——所以输出天然带随机性
  4. 没有真正的"查证"过程:模型是回忆+推理,不是检索

最后一条是产品设计的分水岭:模型不联网、不查库、不翻书,它只是根据上文按概率续写。想让回答基于事实,就必须把事实放进上下文(RAG、检索、工具调用),详见 RAG 基础

生成过程:采样 vs 贪心

模型每步输出的其实是词表上每个 token 的概率分布,从分布里选哪个,有两种基本策略:

  • 贪心解码:每步选概率最高的 token。稳定、可复现,但容易陷入局部最优(比如重复的车轱辘话);
  • 采样:按概率随机抽取,低概率 token 也有机会。输出更多样、更"有创造力",但稳定性差。

现实产品几乎都落在两者之间,用温度、Top-P、Top-K 调节采样强度(见「温度与采样参数」节)。一个反直觉结论:"温度调低"不等于"事实更准"——概率高只说明"模型觉得顺",不代表"事实上对"。事实正确性要靠检索校验(RAG)、引用来源与评测兜底,采样参数只是降低随机扰动。

两段式训练范式

现代大模型不是"一步到位"训练出来的,而是预训练 + 后训练两段式:

预训练:学语言与世界

海量无标注文本(网页、书籍、论文、代码、多语种语料,动辄数万亿 token)上做"预测下一个 token"。产出的是基座模型——一个"续写机器":语言能力极强、知识量大,但不听话:你问它问题,它可能反问回来、复述你的话或者自己接着编。预训练的细节(数据、算力、扩展定律)见 模型训练与对齐

后训练:学"听话"

在预训练基础上,用指令数据(问题-回答对)和人类偏好数据继续训练,让模型学会:回答问题而不是续写、遵循指令的格式要求、拒绝有害请求、表达不确定。这一阶段包括指令微调(SFT)、RLHF/DPO 等对齐技术,见 模型训练与对齐

两段各解决什么问题

阶段解决什么数据产物
预训练"会不会":语言、知识、基础推理海量无标注文本基座模型(会续写)
后训练"乖不乖":指令遵循、对话、安全指令数据、人类偏好数据对话/指令模型(会干活)

基座 / 对话 / 推理模型的区分

按训练状态与能力取向,模型可以分成三类(它们不是互斥的):

类型描述代表
基座模型只做了预训练,会续写、不听话DeepSeek-Base、Qwen-Base
对话/指令模型基座 + SFT + 偏好对齐,会对话、遵循指令各家 API 默认模型
推理模型针对数学、代码、逻辑专项训练,输出前先"思考"o1、DeepSeek-R1、各家 Thinking 模式

推理模型"思考更久"意味着延迟与成本更高,不是所有任务都该用——实时对话用快模型,难题才上推理模型(选型逻辑见 模型能力与选型)。

对产品经理而言,两段式的意义是:模型的"知识"来自预训练(有截止日期),模型的"行为"来自后训练(可以被对齐约束)。前者决定知识新鲜度上限,后者决定可控性边界。

能力涌现与规模效应

上下文学习(In-Context Learning)

上下文学习指:不更新任何参数,只把"任务说明 + 几个示例"写进提示词,模型就能临时学会做新任务——比如给它 3 个"句子→情感标签"的例子,它就能给新句子打标签。这是大模型区别于传统 NLP 模型的核心能力:传统模型每个任务要单独训练,大模型靠提示词即席适配。上限由上下文窗口承载,写法技巧见 提示词工程

指令遵循

模型能同时满足多条约束(格式、语气、步骤、角色),并且约束越多越复杂时仍然可靠——这是后训练(尤其对齐)的直接产物。指令遵循能力是 Agent 产品的基础:任务拆解、工具调用都依赖模型"听指挥"(见 Agent 与工作流)。

思维链(Chain-of-Thought)

思维链指让模型"先想后答":把推理过程显式写出来,而不是直接给结论。对数学、逻辑、规划类任务,思维链能显著提高正确率——它把"一步到位"变成"逐步逼近",每步都基于前面明确的中间结果。2025 年起的推理模型把思维链内化为模型能力:模型输出前先自行产生内部推理 token,思考深度由 effort 参数控制(详见 模型能力与选型)。

规模效应

经验规律:在架构和数据分布稳定的前提下,参数量、训练数据量、训练计算量三者的扩大,会带来可预测的能力提升(损失按幂律下降)。但注意三点:

  • 三者要匹配:参数多而数据少会欠训练(见 模型训练与对齐 的 Chinchilla 最优配比);
  • 规模效应预测的是"语言建模损失",不等于推理、事实性、产品体验同步提升;
  • 参数量不是唯一变量:数据质量、架构、后训练同样关键,小模型用好数据也能很强。

涌现的正确理解

涌现指:任务表现随规模增大出现"突然变好"——小模型几乎做不了,模型一到某个规模就跨过阈值。需要谨慎理解:

  • 部分"突然"来自评测方法:离散打分、通过/失败阈值会让平滑的能力曲线显示成"突变";换成连续指标,提升往往更平滑;
  • 涌现是观察现象,不代表模型内部存在某个可定位的"能力开关";
  • 不能据此断言"小模型永远不行":蒸馏、高质量数据、后训练与系统增强(RAG、工具)都能让小模型在特定任务上逼近大模型——小模型变强主要来自能力迁移(蒸馏、合成数据)与系统补偿(检索、工具),不等于它的大模型兄弟能力被复刻。

规模效应的产品含义

  • 升级模型 = 白嫖能力提升:同一产品形态,换更大模型常常直接带来效果提升——但成本与延迟也同步上升,要按"能力-成本-延迟"三角重新评估;
  • 模型能力地图每 1-2 年重构(见「LLM 发展简史」),选型决策要跟着评测更新;
  • 别用公开榜单总分做选型:榜单与你的任务分布几乎必然不同,用自建评测集(20-50 条真实样本)对比才是正路(实操清单见 模型能力与选型)。

幻觉深入

幻觉的三种类型

幻觉不只有"编造事实"一种,产品里需要区分对待:

类型表现例子
事实性幻觉与外部事实冲突或编造无依据的内容编造不存在的论文、API 参数、公司成立年份
忠实性幻觉与给定资料/上下文矛盾资料写公司 2019 年成立,模型答 2016 年
推理错误自洽性与逻辑推导不成立前提正确但推导过程偷换概念、过度概括

区分价值在于治理手段不同:忠实性幻觉靠"把资料放对位置 + 要求基于证据回答"缓解;事实性幻觉靠检索、引用与校验;推理错误靠思维链、验证器与任务拆分。

幻觉的成因

  • 训练截止:训练数据有截止日期,之后的事模型不知道,但会"猜";
  • 知识压缩失真:海量知识压进有限参数,细节必然被稀释、混淆(名字、数字、来源最容易串);
  • 概率补全:训练目标是"预测顺",不是"查证对"——概率高的表达不一定事实正确;
  • 长尾知识不足:冷门、专业、少见于语料的内容,模型只有模糊印象;
  • 低置信照答:模型不能可靠判断"自己是否知道",证据不足时仍倾向继续生成(对齐还强化了"要有帮助"的倾向,加剧了硬答);
  • 上下文利用失败:关键信息在长输入中被截断、被噪声淹没(见「上下文窗口机制」节)。

什么时候最容易幻觉

  • 数字与日期:具体数值、年份、时效信息;
  • 人名、书名、公司名:需要精确指称的信息;
  • 长尾与专业领域:语料覆盖少、训练样本稀疏;
  • 开放式追问:"还有吗?再详细点?"会诱导模型补全;
  • 前提本身就是错的:错误前提 + 有求必应 = 顺着编。

检测手段

上线前和上线后都要能"抓"幻觉,常用手段:证据核对(回答 vs 资料原文)、引用检查(引用是否真实存在且支持结论)、一致性检测(多次生成对比,差异大是风险信号——但一致也不等于对)、不确定性估计(token 概率/logprob 辅助,不可当真理)、人工抽检(高风险场景必须)。落地时建议给幻觉定一个可统计的口径(如"回答中无依据断言的比例"),纳入评测集定期回归——没有数字,幻觉治理就是口号(统计方法见 评估与评测)。

缓解手段全表

手段原理适用场景
RAG先把事实放进上下文,再让模型基于资料回答私有知识、实时信息、需要追溯来源
引用来源要求回答绑定出处,便于人工/系统核对事实问答、专业内容
温度调低 + 结构化约束减少发散,约束输出格式稳定输出场景(配合 Top-P 使用)
Grounding/工具调用联网搜索、查数据库、执行代码,用工具结果替代记忆实时数据、精确计算
评测与护栏建立幻觉率基线、高风险场景人工审核、拒答话术医疗/法律/金融等高风险领域
训练与对齐高质量事实数据、拒答数据、不确定性表达训练平台侧能力(产品侧不可控)

原则:幻觉无法消灭,只能管理。产品必须在架构上假设"模型会错",设计检索校验、人工兜底与降级链——这是 产品经理的必知结论 的第一条。

一个典型的幻觉事故

某知识库问答产品上线后,用户问"我们的报销流程是什么",模型流畅地给出了"三日内提交、财务审批、两周到账"的完整流程——全部是编的:公司真实流程是"邮件提交 + 人工处理"。归因发现:检索环节没召回相关文档(分块与关键词不匹配),模型面对"没有资料但必须回答"的局面,用训练语料里"通用报销流程"补全了答案。整改方案是三层:检索召回率评测(见 RAG 基础)、提示词强制"无资料必须说明"、以及答案引用文档编号供人工核验。教训:幻觉事故里,产品流程的锅往往比模型本身大

上下文窗口机制

窗口是什么

上下文窗口是模型一次推理能容纳的最大 token 数,输入 + 输出共用。它决定了:一次能塞进多长的文档、多少轮对话、多复杂的 Agent 任务。注意输入输出是同一份预算:塞了 60 万 token 的文档,就只剩 40 万给输出。

位置编码与窗口扩展

模型要知道 token 的先后顺序,靠位置编码(现代模型多用 RoPE 旋转位置编码)注入位置信息。窗口扩展(把模型支持的长度变大)是系统工程,位置编码外推只是其中一环:

方法核心思路代价
PI把位置整体压缩回训练范围局部位置分辨率下降
NTK-aware按频率差异化缩放(高频管局部、低频管长距离)大倍率下仍可能不稳定
YaRN按波长区间分段插值 + 注意力尺度修正超参数复杂
LongRoPE搜索各维度的非均匀缩放因子搜索校准成本高

"改个配置就能无限加长"是误解:只改配置、不重新训练,模型在训练未见过的长度上会退化;而且位置编码只是第一道门槛,后面还有注意力计算(随长度近似平方增长)和 KV Cache 显存(线性增长)两道系统门槛(详见 模型推理与部署)。

长上下文模型现状

2026 年的旗舰模型普遍达到 1M(100 万)token 量级的上下文:Claude 5 家族、DeepSeek V4 均为 1M,Llama 4 Scout 宣称 10M。1M 意味着一次可以读完几本书、整份代码库,长文档产品形态被重新定义(如"整库问答"替代分块检索)。但大窗口不是免费的,见下文成本分析。

窗口 ≠ 记忆

标称窗口 ≠ 有效窗口。标称窗口是"能放多少",有效窗口是"放进去之后模型能稳定用多少"。长输入下模型会出现 lost in the middle 现象——中间位置的信息利用率明显低于开头和结尾;信息越多,关键约束越容易被淹没。所以:

  • 长文档问答不要盲目"全塞进去",RAG 检索 + 分段引用往往比硬塞全文更可靠(见 RAG 基础);
  • 长对话要主动做上下文管理:摘要压缩、裁剪历史、按需携带——"无限窗口"不是"无限记忆";
  • 关键指令放开头或结尾,别放中间。

长输入的成本与注意力开销

长上下文有真实的资源代价:

  • 计费:输入 token 按量计费,长输入直接推高成本(见 LLM 成本测算);
  • 注意力开销:标准注意力的计算量随长度近似平方增长,长输入的首 token 延迟显著上升(机制见 模型推理与部署);
  • KV Cache 显存:缓存随长度线性增长,长上下文挤占并发能力。

结论:长上下文与 RAG 是互补关系,不是替代关系——一个解决"能不能装下",一个解决"怎么高效找到对的"。

温度与采样参数

三个旋钮

参数作用直觉
temperature缩放概率分布的"陡峭度"低 = 只选大概率,稳定;高 = 雨露均沾,发散
top_p保留累计概率达 P 的候选集合,再采样动态截断,去掉低概率长尾
top_k只保留概率最高的 K 个候选,再采样固定截断,简单粗暴

三者配合使用:先调 temperature 定基调,再用 top_p/top_k 掐掉长尾。常见配置如 temperature 0.7 + top_p 0.9。没有跨模型通用的最佳值——模型不同、任务不同,最佳档位要用自己的评测集试出来(评测方法见 评估与评测)。

除这三个外,还有几个常用控制旋钮:重复惩罚(frequency/presence penalty,压低车轱辘话)、max_tokens 上限(控制输出长度与成本)、停止序列(stop strings,精确截断)、固定随机种子(可复现,但并行实现下不保证完全一致)。

什么任务用什么档

任务类型建议原因
事实问答、信息抽取、代码生成低温(0-0.3)要稳定、可复现、格式正确
客服、结构化输出低温 + 结构化约束一致性优先
头脑风暴、文案创作中高温(0.8-1.2)+ 较高 top_p需要多样性
翻译、摘要中温(0.3-0.7)平衡流畅与忠实
数学、代码解题多次采样 + 验证器(pass@k)单次采样赌运气,多试取对

两个原则:事实问答不靠高温度"提升能力"——它只会增加编造;代码与数学靠"多次采样 + 验证器"而不是调一次参数——对同一题采样 N 个答案,用测试用例/答案校验挑对的,成功率显著高于单次生成(pass@k 指标)。

给研发同学的采样参数交接格式

上线前把采样配置写清楚,别让"顺手调参"变成事故:每个任务记下 temperature / top_p / top_k / max_tokens / 停止序列 / 是否结构化约束解码,以及选这套参数时用的评测集——参数不是拍脑袋定的,是评测试出来的;改参数 = 改行为,必须走回归。

流式输出与 SSE

自回归生成天然逐 token 产出,服务端把生成过程边生成边推送给客户端,协议常用 SSE(Server-Sent Events,服务器推送事件)——一次 HTTP 连接内不断推送文本增量。流式输出的产品价值:

  • 首 token 体感延迟从"等全文"(秒到分钟级)降到"等开头"(毫秒到秒级),对话体验质变;
  • 用户可以在生成过程中就阅读、打断、纠偏;
  • 长回答不至于让用户面对"沉默 + 转圈"。

代价是流式对成本控制、内容安全审核(边生成边审)、中断续传提出了工程要求。首 token 延迟与生成速率的机制见 模型推理与部署

LLM 发展简史

时间里程碑意义
2017Transformer 架构(Attention Is All You Need)注意力机制取代 RNN,并行训练成为可能,奠定现代大模型架构
2018GPT-1 / BERT预训练 + 微调范式确立:先在大语料学通用能力,再适配任务
2019GPT-2证明"加大模型 + 加大数据"的路子可行,零样本生成能力初显
2020GPT-3 与 In-Context Learning规模效应显现:GPT-3 证明"提示词 + 示例"无需微调即可完成任务
2022ChatGPT 与 RLHF对齐技术让模型"听话";对话交互形态引爆大众市场
2023开源浪潮与多模态Llama 开源引爆本地部署生态(Ollama、vLLM 等);GPT-4 验证多模态输入
2024长上下文与 MoE上下文进入百万量级;Mixtral/Qwen-MoE 验证稀疏激活架构
2025-2026推理模型时代o1/R1 用强化学习训出"思考"能力;effort 可调成为旗舰标配(详见 模型能力与选型

这条时间线给产品经理的启示:大模型的能力地图每 1-2 年重构一次(2018 年的微调、2020 年的提示词、2025 年的思考档位),选型决策必须跟着评测更新,不能把"去年最好"当成"今年最好"。同时注意:架构演进(Transformer 的注意力、MoE 的稀疏激活、推理模型的思考)都是公开论文与开源实现推动的,技术本身不神秘,产品门槛在"用评测找到适合自己的那一档"。

怎么读一份模型发布

模型发布(模型卡/技术报告)重点看五处:参数量与激活参数(MoE 要区分)、训练数据与 token 预算、上下文长度(标称 vs 有效)、许可证(能否商用)、官方评测的数字口径(自报还是第三方、采样配置、评测集是否与你的任务同分布)。不要只看"榜单总分"——它与你的用户分布几乎必然不同;把官方数字当线索,把自建评测当判决。

常见误区

把产品同学最常踩的认知坑集中列出来,避免踩雷。这些误区大多源自"把模型当人、当数据库"的直觉——模型的机制与人脑和数据库都不同,先承认这点,很多坑就能绕开。 下面的条目按"误解 → 正解"的形式给出:

  • "模型会自己去查资料":不会。模型只根据上下文续写,不联网、不查库;实时/私有信息必须靠 RAG 或工具喂给它;
  • "温度调低就能保证事实正确":不能。温度只控制随机性,模型"觉得顺"不等于"事实上对",事实正确靠检索校验与评测;
  • "上下文窗口大 = 记忆好":不是。标称窗口 ≠ 有效窗口,长输入下中间信息利用率明显下降(lost in the middle),要主动做上下文管理;
  • "开源模型 = 随便商用":不是。很多"开源"只开放权重,能否商用、修改、再分发取决于许可证(Apache 2.0、Llama 许可门控等)——用前查许可证,别拿营收赌;
  • "参数量越大越好":不一定。数据、架构、后训练同样关键;同参数量下词表、层宽、层数不同,能力与部署成本差异很大;
  • "涌现是神秘的能力突变":不是。部分是评测方法造成的"假突变",能力提升用连续指标看往往更平滑;
  • "输出流利 = 回答正确":不是。流利是语言能力,正确是事实与推理能力,两者由不同的训练机制决定——这是幻觉的根源,也是护栏设计的前提;
  • "模型升级后行为不变":不是。模型更新会悄悄改变行为(话术、边界、格式),上线后要持续回归评测(见 评估与评测);
  • "让它写 500 字就写 500 字":不是。模型对长度没有精确感知,"字数达标"要靠 max_tokens 上限、格式约束与后处理兜底,而不是靠提示词祈祷。

产品经理的必知结论

  • 模型输出永远可能出错——产品必须设计纠错与兜底:检索校验、低置信降级、人工兜底、安全话术,这层逻辑放在产品架构里,而不是指望模型自觉;
  • 训练截止日期决定知识新鲜度上限:实时信息靠搜索、RAG、工具调用补齐,不能靠"再问问它";
  • Token 是成本单位:长输入长输出 = 高成本,成本随用量线性增长,上线前先算账(见 LLM 成本测算);
  • 上下文窗口不是"无限记忆":长对话会截断遗忘,要主动管理上下文(摘要、裁剪、检索);
  • 成本结构:输入 vs 输出分账:客服类输入占大头(压上下文 + 缓存),写作类输出占大头(压输出长度);
  • 隐私边界:公共 API 的数据留存策略各异,敏感数据走私有化部署(见 模型推理与部署LLM API 与供应商);
  • 可控性分层:提示词(快,临时)、RAG(事实兜底)、微调(行为定制,贵且慢)——按需选层,先提示词和 RAG,评测证明不够再微调(决策表见 模型训练与对齐);
  • 先评测、后选型:能力、成本、延迟都要用自建评测集(20-50 条真实样本)对比,而不是看榜单总分;模型/档位/参数选完,把评测结果存档,三个月后做增量而不是从零再来(实操清单见 模型能力与选型);
  • 模型迭代按月计:能力、价格、上下文每季度都在变,选型要留出切换空间(接口抽象、评测集常跑常新)。

新项目落地检查清单

把上面的结论落成开工前的自查清单:

  1. 事实类功能是否接了检索/工具兜底?模型"不知道"时有没有明确话术?
  2. 知识新鲜度需求是否超过训练截止日期?超了,走 RAG 或搜索,别指望模型;
  3. 单次调用的输入/输出 token 预算是否估算过?按真实 prompt 数一遍,别拍脑袋;
  4. 长对话是否做了上下文管理(摘要/裁剪/按需携带)?有没有设对话长度上限?
  5. 敏感数据是否确认了数据留存与地域策略?该私有化的是否规划了部署路径?
  6. 采样参数是否按任务类型设定,并用评测集校准过?
  7. 有没有建立幻觉率、正确率、延迟与成本的线上监控?
  8. 模型更新后是否安排了回归评测?评测集是否随 badcase 持续扩充?

来源说明

本文为原创整理,综合以下资料撰写,访问验证日期 2026-08-23;模型能力与价格变动频繁,以各官方页面为准。

  1. AIGC-Interview-Book「大模型基础(精华版)」:基础概念与概述、模型架构与工作原理(预取参考材料,2026-08-23)
  2. 地球科学大数据课程笔记《2026-05-22 Transformer 与大模型.md》第三节:规模扩展与能力涌现(课程讲义)
  3. Language Models are Few-Shot Learners (GPT-3):In-Context Learning 与规模效应
  4. Training Language Models to Follow Instructions (InstructGPT):指令微调与 RLHF 原理
  5. Anthropic Building Effective Agents:先提示词与检索、评测证明后再微调的工程原则
  6. 站内关联:模型能力与选型提示词工程RAG 基础LLM 成本测算