大模型基础
大模型基础
大语言模型(LLM,Large Language Model)是当前 AI 产品的核心技术底座。产品经理不需要会训练模型,但必须理解它怎么工作、能力边界在哪、成本从哪来——这三件事直接决定产品里哪些功能能做、该怎么做、要花多少钱。本文讲透大模型的基础机制;模型怎么训练、怎么部署,分别见 模型训练与对齐 与 模型推理与部署。
核心概念
先建立一张概念速查表,后续各节逐个展开:
| 概念 | 一句话解释 |
|---|---|
| 参数 | 模型内部的"旋钮",参数越多通常能力越强 |
| Token | 模型处理文本的最小单位(约 1 个汉字 ≈ 1-2 个 token) |
| 上下文窗口 | 模型一次能"看到"的 token 上限,决定输入长度 |
| 温度 (temperature) | 输出随机性:低 = 稳定保守,高 = 多样发散 |
| Top-P / Top-K | 采样时从候选 token 里截断的范围(配合温度使用) |
| 系统提示词 | 给模型的"角色设定与规则",优先级高于用户输入 |
| 流式输出 | 一个字一个字地生成,不等全部完成 |
| 知识截止日期 | 训练数据的时间边界,之后发生的事模型不知道 |
| 幻觉 | 模型一本正经地编造不存在的知识或事实 |
| 推理模型 | 输出前先"思考"(生成内部推理 token)的模型 |
| 预训练 / 后训练 | 训练的两段式:先学语言与世界,再学"听话"(见 模型训练与对齐) |
| 基座模型 / 对话模型 / 推理模型 | 按训练状态与能力取向分类:会续写 / 会对话 / 会思考 |
两个容易混淆的维度:一是"大"体现在哪里——参数量、训练数据量、计算量三者共同构成规模,长上下文和多任务能力是"大"的结果而非定义;二是"开源"的准确含义——很多"开源大模型"其实只开放权重(open weights),能否商用、修改、再分发要看具体许可证(如 Qwen 系 Apache 2.0 可商用、Llama 系需 Meta 许可门控),不能笼统说"开源就随便用"。
Token 与词表
Token 是什么
模型不认识文字,只认识数字。文本进入模型前,先由分词器(Tokenizer)把字符串切成一段段Token,再映射成词表里的整数 ID(Token ID),最后查表变成向量参与计算。Token 不一定是"词":一个汉字、一个英文子词、一个标点、一段空格都可能是一个 Token。整条链路是:
1 | |
四个相关概念要分清:
| 概念 | 定义 | 说明 |
|---|---|---|
| Token | 切分后的离散单位 | 不必然等于"词" |
| 词表 | Token → 整数 ID 的映射表 | 含特殊标记(开始、结束、角色标记等) |
| Tokenizer | 完整的分词流程 | 归一化、预分词、子词切分、ID 映射 |
| Token ID | Token 在词表中的编号 | 编号大小无语义,ID 100 和 101 不表示相近 |
BPE 分词直觉
主流分词算法是 BPE(Byte Pair Encoding,字节对编码),它的直觉可以概括为两句话:
- 高频片段保留为整词:常出现的词(英文的 "the"、"AI",中文的"我们")直接作为整体切分,一个 token 一个词;
- 低频词拆成子词:生僻词、新词、专有名词拆成更小的片段,由片段组合表达。
BPE 从字符/字节开始,反复合并语料里出现频率最高的相邻符号对,直到词表达到目标大小——词表大小与序列长度之间的平衡是设计核心:词表太大,嵌入层和输出层参数爆炸(词表 × 隐藏维度,且输入输出两份);词表太小,文本被切得太碎,序列变长、成本变高。字节级的兜底(byte fallback)保证任何字符串都能被编码——但"能编码"不等于"编得好":罕见词会被拆成很长的字节序列,模型理解差且成本高。
中文 Token 特性
中文没有空格分词,通常 1 个汉字 ≈ 1-2 个 token(常用字、常用词可能 1 字 1 token,低频词或生僻字可能拆成 2 个以上)。这意味着:
- 同样内容,中文往往比英文更"费 token",成本测算时不能拿英文经验套中文(估算方法见 LLM 成本测算);
- 词表里中文覆盖越好,中文序列越短、成本越低、理解越好——这是国产模型(Qwen、DeepSeek 等)在中文场景的优势之一;
- 提示词长度、上下文规划都要按"中文 1 字 ≈ 1-2 token"的直觉估算,精确数字以各模型官方 tokenizer 实测为准;
- 多语种共用词表时,高资源语言会占据大部分词表容量,低资源语言被切得更碎——"能编码所有语言"不等于"所有语言都编得好"。
Token 与成本
Token 是模型的运算单位、显存单位和计费单位:API 按输入/输出 token 分别计价,长输入和长输出直接推高成本;上下文窗口、KV Cache 显存也按 token 计数。产品经理必须建立"一切开销都以 token 计量"的心智模型:
- 输入 token 包括系统提示词、工具定义、历史对话、检索内容——写 prompt 时这些"看不见的 token"都要计入;
- 输出 token 单价通常高于输入,且输出长度不可控(模型可能话痨),要设
max_tokens上限; - 具体测算方法见 LLM 成本测算。
一次客服对话的 token 账单
一个典型客服场景:系统提示词 500 token + 工具定义 300 token + 知识库片段 800 token + 5 轮历史对话 2000 token = 输入 3600 token;每轮回答平均 150 token × 5 轮 = 输出 750 token。若模型报价输入 $1/M、输出 $6/M,单次会话成本约 3600×$1/M + 750×$6/M ≈ $0.008。看似一分钱不到,日活 10 万用户、人均 2 次会话,月成本就是 10 万 × 2 × 30 × $0.008 ≈ $48,000——"看不见的 token"(历史对话、工具定义、知识片段)往往是账单的大头。
Tokenizer 的边界
Tokenizer 是一套约定,不是自然规律:不同模型的词表、切分规则、特殊标记都不一样,同一个词在不同模型里的 token 数可以不同;文本规范化(空格、Unicode、大小写)也因实现而异。它在工程上还会成为事故点——2025 年 AWS Bedrock 的 Claude 服务出现过 tokenizer 偏移 bug(社区戏称 "bedtok"),导致输出与预期系统性偏差。教训是:tokenizer 行为要作为产品基线的一部分去验证,涉及长文档处理、上下文预算、字数统计("2000 字以内"靠 token 数推算)时不能想当然。
语言模型的核心机制
条件概率:预测下一个 token
大模型的本质是一个条件概率函数:给定上文,估计下一个 token 是什么。写成公式就是:
1 | |
比如看到"今天天气真",模型给"好"分配很高的概率。训练时,模型在海量文本上反复做这件事:每个位置都用前面的内容预测后面的内容,预测错的就调整参数。评价模型"有多会预测"有个指标叫困惑度(Perplexity)——模型对下一个 token 平均越有把握(概率越高),困惑度越低;但它只反映"拟合语言分布"的程度,不等于综合能力:一个只会复读的模型困惑度也可以很低。
这个目标看起来简单,但为了预测得准,模型被迫从文本里学习语法、语义、事实、指代关系、代码结构和推理线索——知识和推理能力就是这样被"逼"出来的。
自回归逐 token 生成
推理时模型一次只生成一个 token:预测出下一个 token 后,把它拼到上文末尾,再预测下一个,循环往复直到满足停止条件(生成结束符、达到长度上限、业务主动中止)。这个过程叫自回归生成,它决定了两个产品层面的重要事实:
- 输出是流式的:模型本来就是逐 token 产出的,天然适合流式输出(见「温度与采样参数」节);
- 输出有方向性错误累积:早期选错一个 token,后续可能被放大,也可能被上下文修正——所以"一次生成很长的回答"比"分步生成"更容易跑偏,这也解释了为什么复杂任务要拆步骤(见 提示词工程)。
生成什么时候停下来?模型"说完一句话"并不会天然停止——停止行为来自训练时学的结束标记(EOS)、运行时的停止序列(stop strings)、长度上限与业务控制(超时、用户打断)共同作用。输出截断、话痨不停、答非所问等产品问题,很多都能追溯到停止条件没设好。
为什么"预测下一个词"能学出知识与推理
一个常见疑问是:预测下一个词只是"文字接龙",怎么会产生真正的知识?答案在于压缩:要把海量文本的规律压缩进有限参数里,模型必须提取可泛化的结构,而不是死记硬背。它会学会"苹果"在公司语境下指科技公司、在水果语境下指食物;学会"因为……所以……"的因果模式;学会代码的语法规则。规模越大、数据越多,能提取的结构越复杂,推理能力越强——这就是「能力涌现与规模效应」一节的伏笔。
注意力与上下文:谁和谁相关
支撑"预测下一个词"的技术基础是 Transformer 架构,其中注意力机制是核心:每个 token 在计算时,会按"相关程度"从上下文的其他 token 那里加权取信息——"苹果"会从"公司"、"发布"那里取信息理解语境;"他打了她"里,动作与对象的绑定关系由注意力权重刻画。几个关键事实:
- 多头注意力:模型从多个"角度"同时建立联系(语法关系、指代、远距离依赖),层数堆叠让信息反复加工、逐步抽象;
- 位置编码:注意力本身不区分顺序("我打他"和"他打我"的 token 集合相同),要靠位置编码注入先后信息,现代模型多用 RoPE;
- 知识分布在整个参数系统里:模型的知识与能力不是某个"知识文件",而是分散在全部参数中——所以知识无法"增删"(要更新知识得重新训练或用检索),也无法像数据库一样溯源;
- 架构细节见 Transformer 架构 与 深度学习基础,这里只需记住结论:注意力决定了"模型看到什么",上下文管理就是产品侧对注意力的引导。
模型是怎么"思考"的
- 模型被训练来预测"下一个 token 是什么"
- 海量文本训练后,模型学会了语言的模式与知识
- 推理时按概率逐 token 生成——所以输出天然带随机性
- 没有真正的"查证"过程:模型是回忆+推理,不是检索
最后一条是产品设计的分水岭:模型不联网、不查库、不翻书,它只是根据上文按概率续写。想让回答基于事实,就必须把事实放进上下文(RAG、检索、工具调用),详见 RAG 基础。
生成过程:采样 vs 贪心
模型每步输出的其实是词表上每个 token 的概率分布,从分布里选哪个,有两种基本策略:
- 贪心解码:每步选概率最高的 token。稳定、可复现,但容易陷入局部最优(比如重复的车轱辘话);
- 采样:按概率随机抽取,低概率 token 也有机会。输出更多样、更"有创造力",但稳定性差。
现实产品几乎都落在两者之间,用温度、Top-P、Top-K 调节采样强度(见「温度与采样参数」节)。一个反直觉结论:"温度调低"不等于"事实更准"——概率高只说明"模型觉得顺",不代表"事实上对"。事实正确性要靠检索校验(RAG)、引用来源与评测兜底,采样参数只是降低随机扰动。
两段式训练范式
现代大模型不是"一步到位"训练出来的,而是预训练 + 后训练两段式:
预训练:学语言与世界
在海量无标注文本(网页、书籍、论文、代码、多语种语料,动辄数万亿 token)上做"预测下一个 token"。产出的是基座模型——一个"续写机器":语言能力极强、知识量大,但不听话:你问它问题,它可能反问回来、复述你的话或者自己接着编。预训练的细节(数据、算力、扩展定律)见 模型训练与对齐。
后训练:学"听话"
在预训练基础上,用指令数据(问题-回答对)和人类偏好数据继续训练,让模型学会:回答问题而不是续写、遵循指令的格式要求、拒绝有害请求、表达不确定。这一阶段包括指令微调(SFT)、RLHF/DPO 等对齐技术,见 模型训练与对齐。
两段各解决什么问题
| 阶段 | 解决什么 | 数据 | 产物 |
|---|---|---|---|
| 预训练 | "会不会":语言、知识、基础推理 | 海量无标注文本 | 基座模型(会续写) |
| 后训练 | "乖不乖":指令遵循、对话、安全 | 指令数据、人类偏好数据 | 对话/指令模型(会干活) |
基座 / 对话 / 推理模型的区分
按训练状态与能力取向,模型可以分成三类(它们不是互斥的):
| 类型 | 描述 | 代表 |
|---|---|---|
| 基座模型 | 只做了预训练,会续写、不听话 | DeepSeek-Base、Qwen-Base |
| 对话/指令模型 | 基座 + SFT + 偏好对齐,会对话、遵循指令 | 各家 API 默认模型 |
| 推理模型 | 针对数学、代码、逻辑专项训练,输出前先"思考" | o1、DeepSeek-R1、各家 Thinking 模式 |
推理模型"思考更久"意味着延迟与成本更高,不是所有任务都该用——实时对话用快模型,难题才上推理模型(选型逻辑见 模型能力与选型)。
对产品经理而言,两段式的意义是:模型的"知识"来自预训练(有截止日期),模型的"行为"来自后训练(可以被对齐约束)。前者决定知识新鲜度上限,后者决定可控性边界。
能力涌现与规模效应
上下文学习(In-Context Learning)
上下文学习指:不更新任何参数,只把"任务说明 + 几个示例"写进提示词,模型就能临时学会做新任务——比如给它 3 个"句子→情感标签"的例子,它就能给新句子打标签。这是大模型区别于传统 NLP 模型的核心能力:传统模型每个任务要单独训练,大模型靠提示词即席适配。上限由上下文窗口承载,写法技巧见 提示词工程。
指令遵循
模型能同时满足多条约束(格式、语气、步骤、角色),并且约束越多越复杂时仍然可靠——这是后训练(尤其对齐)的直接产物。指令遵循能力是 Agent 产品的基础:任务拆解、工具调用都依赖模型"听指挥"(见 Agent 与工作流)。
思维链(Chain-of-Thought)
思维链指让模型"先想后答":把推理过程显式写出来,而不是直接给结论。对数学、逻辑、规划类任务,思维链能显著提高正确率——它把"一步到位"变成"逐步逼近",每步都基于前面明确的中间结果。2025 年起的推理模型把思维链内化为模型能力:模型输出前先自行产生内部推理 token,思考深度由 effort 参数控制(详见 模型能力与选型)。
规模效应
经验规律:在架构和数据分布稳定的前提下,参数量、训练数据量、训练计算量三者的扩大,会带来可预测的能力提升(损失按幂律下降)。但注意三点:
- 三者要匹配:参数多而数据少会欠训练(见 模型训练与对齐 的 Chinchilla 最优配比);
- 规模效应预测的是"语言建模损失",不等于推理、事实性、产品体验同步提升;
- 参数量不是唯一变量:数据质量、架构、后训练同样关键,小模型用好数据也能很强。
涌现的正确理解
涌现指:任务表现随规模增大出现"突然变好"——小模型几乎做不了,模型一到某个规模就跨过阈值。需要谨慎理解:
- 部分"突然"来自评测方法:离散打分、通过/失败阈值会让平滑的能力曲线显示成"突变";换成连续指标,提升往往更平滑;
- 涌现是观察现象,不代表模型内部存在某个可定位的"能力开关";
- 不能据此断言"小模型永远不行":蒸馏、高质量数据、后训练与系统增强(RAG、工具)都能让小模型在特定任务上逼近大模型——小模型变强主要来自能力迁移(蒸馏、合成数据)与系统补偿(检索、工具),不等于它的大模型兄弟能力被复刻。
规模效应的产品含义
- 升级模型 = 白嫖能力提升:同一产品形态,换更大模型常常直接带来效果提升——但成本与延迟也同步上升,要按"能力-成本-延迟"三角重新评估;
- 模型能力地图每 1-2 年重构(见「LLM 发展简史」),选型决策要跟着评测更新;
- 别用公开榜单总分做选型:榜单与你的任务分布几乎必然不同,用自建评测集(20-50 条真实样本)对比才是正路(实操清单见 模型能力与选型)。
幻觉深入
幻觉的三种类型
幻觉不只有"编造事实"一种,产品里需要区分对待:
| 类型 | 表现 | 例子 |
|---|---|---|
| 事实性幻觉 | 与外部事实冲突或编造无依据的内容 | 编造不存在的论文、API 参数、公司成立年份 |
| 忠实性幻觉 | 与给定资料/上下文矛盾 | 资料写公司 2019 年成立,模型答 2016 年 |
| 推理错误 | 自洽性与逻辑推导不成立 | 前提正确但推导过程偷换概念、过度概括 |
区分价值在于治理手段不同:忠实性幻觉靠"把资料放对位置 + 要求基于证据回答"缓解;事实性幻觉靠检索、引用与校验;推理错误靠思维链、验证器与任务拆分。
幻觉的成因
- 训练截止:训练数据有截止日期,之后的事模型不知道,但会"猜";
- 知识压缩失真:海量知识压进有限参数,细节必然被稀释、混淆(名字、数字、来源最容易串);
- 概率补全:训练目标是"预测顺",不是"查证对"——概率高的表达不一定事实正确;
- 长尾知识不足:冷门、专业、少见于语料的内容,模型只有模糊印象;
- 低置信照答:模型不能可靠判断"自己是否知道",证据不足时仍倾向继续生成(对齐还强化了"要有帮助"的倾向,加剧了硬答);
- 上下文利用失败:关键信息在长输入中被截断、被噪声淹没(见「上下文窗口机制」节)。
什么时候最容易幻觉
- 数字与日期:具体数值、年份、时效信息;
- 人名、书名、公司名:需要精确指称的信息;
- 长尾与专业领域:语料覆盖少、训练样本稀疏;
- 开放式追问:"还有吗?再详细点?"会诱导模型补全;
- 前提本身就是错的:错误前提 + 有求必应 = 顺着编。
检测手段
上线前和上线后都要能"抓"幻觉,常用手段:证据核对(回答 vs 资料原文)、引用检查(引用是否真实存在且支持结论)、一致性检测(多次生成对比,差异大是风险信号——但一致也不等于对)、不确定性估计(token 概率/logprob 辅助,不可当真理)、人工抽检(高风险场景必须)。落地时建议给幻觉定一个可统计的口径(如"回答中无依据断言的比例"),纳入评测集定期回归——没有数字,幻觉治理就是口号(统计方法见 评估与评测)。
缓解手段全表
| 手段 | 原理 | 适用场景 |
|---|---|---|
| RAG | 先把事实放进上下文,再让模型基于资料回答 | 私有知识、实时信息、需要追溯来源 |
| 引用来源 | 要求回答绑定出处,便于人工/系统核对 | 事实问答、专业内容 |
| 温度调低 + 结构化约束 | 减少发散,约束输出格式 | 稳定输出场景(配合 Top-P 使用) |
| Grounding/工具调用 | 联网搜索、查数据库、执行代码,用工具结果替代记忆 | 实时数据、精确计算 |
| 评测与护栏 | 建立幻觉率基线、高风险场景人工审核、拒答话术 | 医疗/法律/金融等高风险领域 |
| 训练与对齐 | 高质量事实数据、拒答数据、不确定性表达训练 | 平台侧能力(产品侧不可控) |
原则:幻觉无法消灭,只能管理。产品必须在架构上假设"模型会错",设计检索校验、人工兜底与降级链——这是 产品经理的必知结论 的第一条。
一个典型的幻觉事故
某知识库问答产品上线后,用户问"我们的报销流程是什么",模型流畅地给出了"三日内提交、财务审批、两周到账"的完整流程——全部是编的:公司真实流程是"邮件提交 + 人工处理"。归因发现:检索环节没召回相关文档(分块与关键词不匹配),模型面对"没有资料但必须回答"的局面,用训练语料里"通用报销流程"补全了答案。整改方案是三层:检索召回率评测(见 RAG 基础)、提示词强制"无资料必须说明"、以及答案引用文档编号供人工核验。教训:幻觉事故里,产品流程的锅往往比模型本身大。
上下文窗口机制
窗口是什么
上下文窗口是模型一次推理能容纳的最大 token 数,输入 + 输出共用。它决定了:一次能塞进多长的文档、多少轮对话、多复杂的 Agent 任务。注意输入输出是同一份预算:塞了 60 万 token 的文档,就只剩 40 万给输出。
位置编码与窗口扩展
模型要知道 token 的先后顺序,靠位置编码(现代模型多用 RoPE 旋转位置编码)注入位置信息。窗口扩展(把模型支持的长度变大)是系统工程,位置编码外推只是其中一环:
| 方法 | 核心思路 | 代价 |
|---|---|---|
| PI | 把位置整体压缩回训练范围 | 局部位置分辨率下降 |
| NTK-aware | 按频率差异化缩放(高频管局部、低频管长距离) | 大倍率下仍可能不稳定 |
| YaRN | 按波长区间分段插值 + 注意力尺度修正 | 超参数复杂 |
| LongRoPE | 搜索各维度的非均匀缩放因子 | 搜索校准成本高 |
"改个配置就能无限加长"是误解:只改配置、不重新训练,模型在训练未见过的长度上会退化;而且位置编码只是第一道门槛,后面还有注意力计算(随长度近似平方增长)和 KV Cache 显存(线性增长)两道系统门槛(详见 模型推理与部署)。
长上下文模型现状
2026 年的旗舰模型普遍达到 1M(100 万)token 量级的上下文:Claude 5 家族、DeepSeek V4 均为 1M,Llama 4 Scout 宣称 10M。1M 意味着一次可以读完几本书、整份代码库,长文档产品形态被重新定义(如"整库问答"替代分块检索)。但大窗口不是免费的,见下文成本分析。
窗口 ≠ 记忆
标称窗口 ≠ 有效窗口。标称窗口是"能放多少",有效窗口是"放进去之后模型能稳定用多少"。长输入下模型会出现 lost in the middle 现象——中间位置的信息利用率明显低于开头和结尾;信息越多,关键约束越容易被淹没。所以:
- 长文档问答不要盲目"全塞进去",RAG 检索 + 分段引用往往比硬塞全文更可靠(见 RAG 基础);
- 长对话要主动做上下文管理:摘要压缩、裁剪历史、按需携带——"无限窗口"不是"无限记忆";
- 关键指令放开头或结尾,别放中间。
长输入的成本与注意力开销
长上下文有真实的资源代价:
- 计费:输入 token 按量计费,长输入直接推高成本(见 LLM 成本测算);
- 注意力开销:标准注意力的计算量随长度近似平方增长,长输入的首 token 延迟显著上升(机制见 模型推理与部署);
- KV Cache 显存:缓存随长度线性增长,长上下文挤占并发能力。
结论:长上下文与 RAG 是互补关系,不是替代关系——一个解决"能不能装下",一个解决"怎么高效找到对的"。
温度与采样参数
三个旋钮
| 参数 | 作用 | 直觉 |
|---|---|---|
| temperature | 缩放概率分布的"陡峭度" | 低 = 只选大概率,稳定;高 = 雨露均沾,发散 |
| top_p | 保留累计概率达 P 的候选集合,再采样 | 动态截断,去掉低概率长尾 |
| top_k | 只保留概率最高的 K 个候选,再采样 | 固定截断,简单粗暴 |
三者配合使用:先调 temperature 定基调,再用 top_p/top_k 掐掉长尾。常见配置如 temperature 0.7 + top_p 0.9。没有跨模型通用的最佳值——模型不同、任务不同,最佳档位要用自己的评测集试出来(评测方法见 评估与评测)。
除这三个外,还有几个常用控制旋钮:重复惩罚(frequency/presence penalty,压低车轱辘话)、max_tokens 上限(控制输出长度与成本)、停止序列(stop strings,精确截断)、固定随机种子(可复现,但并行实现下不保证完全一致)。
什么任务用什么档
| 任务类型 | 建议 | 原因 |
|---|---|---|
| 事实问答、信息抽取、代码生成 | 低温(0-0.3) | 要稳定、可复现、格式正确 |
| 客服、结构化输出 | 低温 + 结构化约束 | 一致性优先 |
| 头脑风暴、文案创作 | 中高温(0.8-1.2)+ 较高 top_p | 需要多样性 |
| 翻译、摘要 | 中温(0.3-0.7) | 平衡流畅与忠实 |
| 数学、代码解题 | 多次采样 + 验证器(pass@k) | 单次采样赌运气,多试取对 |
两个原则:事实问答不靠高温度"提升能力"——它只会增加编造;代码与数学靠"多次采样 + 验证器"而不是调一次参数——对同一题采样 N 个答案,用测试用例/答案校验挑对的,成功率显著高于单次生成(pass@k 指标)。
给研发同学的采样参数交接格式
上线前把采样配置写清楚,别让"顺手调参"变成事故:每个任务记下 temperature / top_p / top_k / max_tokens / 停止序列 / 是否结构化约束解码,以及选这套参数时用的评测集——参数不是拍脑袋定的,是评测试出来的;改参数 = 改行为,必须走回归。
流式输出与 SSE
自回归生成天然逐 token 产出,服务端把生成过程边生成边推送给客户端,协议常用 SSE(Server-Sent Events,服务器推送事件)——一次 HTTP 连接内不断推送文本增量。流式输出的产品价值:
- 首 token 体感延迟从"等全文"(秒到分钟级)降到"等开头"(毫秒到秒级),对话体验质变;
- 用户可以在生成过程中就阅读、打断、纠偏;
- 长回答不至于让用户面对"沉默 + 转圈"。
代价是流式对成本控制、内容安全审核(边生成边审)、中断续传提出了工程要求。首 token 延迟与生成速率的机制见 模型推理与部署。
LLM 发展简史
| 时间 | 里程碑 | 意义 |
|---|---|---|
| 2017 | Transformer 架构(Attention Is All You Need) | 注意力机制取代 RNN,并行训练成为可能,奠定现代大模型架构 |
| 2018 | GPT-1 / BERT | 预训练 + 微调范式确立:先在大语料学通用能力,再适配任务 |
| 2019 | GPT-2 | 证明"加大模型 + 加大数据"的路子可行,零样本生成能力初显 |
| 2020 | GPT-3 与 In-Context Learning | 规模效应显现:GPT-3 证明"提示词 + 示例"无需微调即可完成任务 |
| 2022 | ChatGPT 与 RLHF | 对齐技术让模型"听话";对话交互形态引爆大众市场 |
| 2023 | 开源浪潮与多模态 | Llama 开源引爆本地部署生态(Ollama、vLLM 等);GPT-4 验证多模态输入 |
| 2024 | 长上下文与 MoE | 上下文进入百万量级;Mixtral/Qwen-MoE 验证稀疏激活架构 |
| 2025-2026 | 推理模型时代 | o1/R1 用强化学习训出"思考"能力;effort 可调成为旗舰标配(详见 模型能力与选型) |
这条时间线给产品经理的启示:大模型的能力地图每 1-2 年重构一次(2018 年的微调、2020 年的提示词、2025 年的思考档位),选型决策必须跟着评测更新,不能把"去年最好"当成"今年最好"。同时注意:架构演进(Transformer 的注意力、MoE 的稀疏激活、推理模型的思考)都是公开论文与开源实现推动的,技术本身不神秘,产品门槛在"用评测找到适合自己的那一档"。
怎么读一份模型发布
模型发布(模型卡/技术报告)重点看五处:参数量与激活参数(MoE 要区分)、训练数据与 token 预算、上下文长度(标称 vs 有效)、许可证(能否商用)、官方评测的数字口径(自报还是第三方、采样配置、评测集是否与你的任务同分布)。不要只看"榜单总分"——它与你的用户分布几乎必然不同;把官方数字当线索,把自建评测当判决。
常见误区
把产品同学最常踩的认知坑集中列出来,避免踩雷。这些误区大多源自"把模型当人、当数据库"的直觉——模型的机制与人脑和数据库都不同,先承认这点,很多坑就能绕开。 下面的条目按"误解 → 正解"的形式给出:
- "模型会自己去查资料":不会。模型只根据上下文续写,不联网、不查库;实时/私有信息必须靠 RAG 或工具喂给它;
- "温度调低就能保证事实正确":不能。温度只控制随机性,模型"觉得顺"不等于"事实上对",事实正确靠检索校验与评测;
- "上下文窗口大 = 记忆好":不是。标称窗口 ≠ 有效窗口,长输入下中间信息利用率明显下降(lost in the middle),要主动做上下文管理;
- "开源模型 = 随便商用":不是。很多"开源"只开放权重,能否商用、修改、再分发取决于许可证(Apache 2.0、Llama 许可门控等)——用前查许可证,别拿营收赌;
- "参数量越大越好":不一定。数据、架构、后训练同样关键;同参数量下词表、层宽、层数不同,能力与部署成本差异很大;
- "涌现是神秘的能力突变":不是。部分是评测方法造成的"假突变",能力提升用连续指标看往往更平滑;
- "输出流利 = 回答正确":不是。流利是语言能力,正确是事实与推理能力,两者由不同的训练机制决定——这是幻觉的根源,也是护栏设计的前提;
- "模型升级后行为不变":不是。模型更新会悄悄改变行为(话术、边界、格式),上线后要持续回归评测(见 评估与评测);
- "让它写 500 字就写 500 字":不是。模型对长度没有精确感知,"字数达标"要靠
max_tokens上限、格式约束与后处理兜底,而不是靠提示词祈祷。
产品经理的必知结论
- 模型输出永远可能出错——产品必须设计纠错与兜底:检索校验、低置信降级、人工兜底、安全话术,这层逻辑放在产品架构里,而不是指望模型自觉;
- 训练截止日期决定知识新鲜度上限:实时信息靠搜索、RAG、工具调用补齐,不能靠"再问问它";
- Token 是成本单位:长输入长输出 = 高成本,成本随用量线性增长,上线前先算账(见 LLM 成本测算);
- 上下文窗口不是"无限记忆":长对话会截断遗忘,要主动管理上下文(摘要、裁剪、检索);
- 成本结构:输入 vs 输出分账:客服类输入占大头(压上下文 + 缓存),写作类输出占大头(压输出长度);
- 隐私边界:公共 API 的数据留存策略各异,敏感数据走私有化部署(见 模型推理与部署 与 LLM API 与供应商);
- 可控性分层:提示词(快,临时)、RAG(事实兜底)、微调(行为定制,贵且慢)——按需选层,先提示词和 RAG,评测证明不够再微调(决策表见 模型训练与对齐);
- 先评测、后选型:能力、成本、延迟都要用自建评测集(20-50 条真实样本)对比,而不是看榜单总分;模型/档位/参数选完,把评测结果存档,三个月后做增量而不是从零再来(实操清单见 模型能力与选型);
- 模型迭代按月计:能力、价格、上下文每季度都在变,选型要留出切换空间(接口抽象、评测集常跑常新)。
新项目落地检查清单
把上面的结论落成开工前的自查清单:
- 事实类功能是否接了检索/工具兜底?模型"不知道"时有没有明确话术?
- 知识新鲜度需求是否超过训练截止日期?超了,走 RAG 或搜索,别指望模型;
- 单次调用的输入/输出 token 预算是否估算过?按真实 prompt 数一遍,别拍脑袋;
- 长对话是否做了上下文管理(摘要/裁剪/按需携带)?有没有设对话长度上限?
- 敏感数据是否确认了数据留存与地域策略?该私有化的是否规划了部署路径?
- 采样参数是否按任务类型设定,并用评测集校准过?
- 有没有建立幻觉率、正确率、延迟与成本的线上监控?
- 模型更新后是否安排了回归评测?评测集是否随 badcase 持续扩充?
来源说明
本文为原创整理,综合以下资料撰写,访问验证日期 2026-08-23;模型能力与价格变动频繁,以各官方页面为准。
- AIGC-Interview-Book「大模型基础(精华版)」:基础概念与概述、模型架构与工作原理(预取参考材料,2026-08-23)
- 地球科学大数据课程笔记《2026-05-22 Transformer 与大模型.md》第三节:规模扩展与能力涌现(课程讲义)
- Language Models are Few-Shot Learners (GPT-3):In-Context Learning 与规模效应
- Training Language Models to Follow Instructions (InstructGPT):指令微调与 RLHF 原理
- Anthropic Building Effective Agents:先提示词与检索、评测证明后再微调的工程原则
- 站内关联:模型能力与选型、提示词工程、RAG 基础、LLM 成本测算
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用