数据与标注
数据与标注
高质量数据是 AI 产品效果的基石:无论是 RAG 知识库、微调数据还是评测集。本页只讲数据工作本身:数据从哪来、怎么变成可用资产、工具与流程怎么组织。模型能力与定价对比见 模型能力与边界,数据与推理成本测算见 LLM 成本测算;检索技术细节见 检索技术,RAG 落地实践见 RAG 产品化实战,法规红线见 出海与合规。
数据工作全景
数据工作是一条「从原料到可用资产」的流水线:采集 → 清洗 → 标注 → 管理。每一环都是独立工程,也都有对应的质量门;下表先给全景,各环节的展开见 数据管线全景。
| 环节 | 内容 | PM 检查点 | 常见坑 |
|---|---|---|---|
| 采集 | 文档、日志、用户行为、公开数据、RAG 语料 | 来源是否合法、授权是否覆盖用途、范围是否最小必要 | 未经授权爬取、采集范围失控 |
| 清洗 | 去重、去噪、格式统一、脱敏 | 去重规则是否保留必要重复、脱敏后任务效果是否可接受 | 清洗过度破坏分布、规则跟不上新变体 |
| 标注 | 人工/半自动标注、质量抽检 | 标注指南是否先行、一致性指标是否达标、抽检是否闭环 | 口径不统一、只标不检、返工无流程 |
| 管理 | 版本、权限、合规审批 | 数据集是否版本化、访问是否按权限、使用是否留痕 | 版本混乱、越权访问、审批流于形式 |
数据工作的总原则:质量门前置、口径可追溯、流程可复用。质量门前置指每个环节设检查点而不是最后一起查;口径可追溯指每条数据回答「从哪来、谁标的、按什么规则标的」;流程可复用指采集与标注的规则沉淀成文档与工具,而不是每次重新发明。
flowchart LR
source[合法数据来源] --> collect[采集并记录授权]
collect --> clean[清洗、去重、脱敏]
clean --> annotate[按指南标注与抽检]
annotate --> manage[版本、权限与审批]
manage --> target{投放用途}
target -->|RAG| rag[切块、嵌入、建索引]
target -->|微调| train[SFT / 偏好数据训练]
target -->|评测| eval[隔离评测集]数据管线把授权与质量门放在入口,经过清洗、标注和治理后,才分别进入 RAG、微调或评测用途。
产品经理的关注点
- 数据即资产:AI 产品的护城河常常是独家数据 + 数据飞轮(用户用得越多数据越好,数据越好产品越好)
- 数据质量 > 数据量:1000 条干净数据好过 10 万条垃圾
- 标注规范先行:标注口径不统一 = 数据不可用
- 脱敏是前提:个人敏感信息(手机号、身份证、地址)处理后再入库
- 数据要能举证:每条训练/评测数据的来源、授权与用途回答「合规三问」:从哪来、授权了什么、用在哪
- 数据是活的资产:评测集、语料库、偏好集都要版本化管理并持续回流,上线第一天就建,而不是上线后补
- 把数据工作排进计划:采集与标注是人力密集型工作,周期以周计:数据就绪日期往往决定模型上线日期,而不是模型代码决定
PM 的日常三件事:盯质量门(每环节的检查点有没有人执行)、盯回流(线上反馈有没有进下一版数据)、盯台账(数据地图与授权记录有没有跟上新数据)。
数据合规红线
- 数据来源合法(用户授权、合同约定)
- 收集最小必要
- 删除权利(用户要求删除时能删干净)
- 授权链完整:每一条数据都能回溯到「来源 → 授权协议 → 用途」,第三方数据要有书面授权,用户数据要有对应版本的同意记录。授权链断掉的一环,就是合规事故的起点
- 出境合规:数据流向境外供应商(模型 API、标注平台、云服务)要过出境评估或标准合同路径,以官方口径为准
- 训练授权单独取得:用户数据用于训练/微调必须单独 opt-in,默认不训练
合规细节(授权链、最小必要、删除权、出境评估的做法)见下文 数据合规与治理,法规框架见 出海与合规,产品机制见 数据隐私与用户控制。
数据飞轮设计
- 产品内埋点收集用户的显式反馈(赞/踩、修改行为)
- 把用户修改了 AI 输出作为最优质数据
- 定期回流数据改进产品(评测集、知识库、提示词)
埋点是飞轮的入口,反馈是飞轮的燃料,具体做法:
- 埋点三件套:事件(赞/踩/复制/修改/转人工)、上下文(问题、回答、检索到的资料 id)、结果(修改后的最终文本)。三者齐备才能事后分析用户为什么不满意
- 显式反馈:赞/踩按钮要轻(一次点击),踩之后可选追问一句「哪里不对」。可选的追问能换来高价值信号
- 隐式反馈:用户复制回答、修改回答后发送、重新提问、转人工,都是低成本的隐式信号;其中修改行为(把 AI 输出改了多少、改成什么)是最优质数据
- 反馈回流闭环:线上反馈 → 抽样人工标注归因(检索问题 / 生成问题 / 知识缺失)→ 修复 → 补进评测集与知识库 → 下次评测验证修复,形成「反馈 → 改进 → 再反馈」的循环(RAG 场景的闭环做法见 RAG 产品化实战 的错案回流)
- 飞轮指标:反馈覆盖率(多少比例的问答有反馈)、修改率(用户修改 AI 输出的比例)、回流率(反馈中进入下一版数据的比例)。没有指标,飞轮转没转看不出来
flowchart TD
feedback[赞、踩、修改、转人工] --> triage[人工抽检与错误归因]
triage --> fix[修复检索、提示词或知识]
fix --> datasets[回填评测集与知识库]
datasets --> verify[评测验证修复]
verify --> release[灰度上线]
release --> feedback反馈飞轮把线上信号转成可验证的数据资产,修复必须经过评测再回到线上观察。
各类反馈信号与数据用途的对应关系:
| 反馈信号 | 采集方式 | 数据用途 | 质量门 |
|---|---|---|---|
| 赞 | 按钮点击 | 正样本、偏好对 | 抽检与人工标注的一致性 |
| 踩 | 按钮点击 + 可选原因 | 偏好对负例 | 原因归类人工复核 |
| 修改 | 对比原始回答与最终文本 | SFT 示例、偏好对 | 差异过滤(改动过小不算有效修改) |
| 转人工 | 会话事件 | 拒答与边界样本 | 归因标注(检索/生成/知识缺失) |
| 复制 | 复制事件 | 有用性信号 | 与回答相关性抽检 |
练习
审视你的产品:哪些环节可以低成本收集高质量反馈数据?
设计一个反馈 → 改进的最小闭环。
数据管线全景
从采集到上线,完整的数据管线包含五个环节:采集、清洗、标注、管理、投放(进入知识库 / 训练 / 评测)。投放的载体与质量标准随用途不同(RAG 语料见 RAG 产品化实战,检索评测集构建见 检索技术,微调数据见 模型训练与对齐),但前四个环节的工程方法一致。
采集
数据来源分四类,授权要求与处理方式各不相同:
| 来源 | 典型例子 | 授权要求 | PM 检查点 |
|---|---|---|---|
| 自有文档 | 产品文档、制度、FAQ、客服话术 | 内部确认可公开/可入知识库 | 版本是否最新、是否含敏感内容 |
| 用户行为 | 埋点日志、对话记录、反馈 | 隐私政策告知 + 对应同意 | 是否脱敏、是否在授权用途内 |
| 公开数据 | 官网、公开报告、开源数据集 | 网站条款/robots、数据许可 | 条款是否允许抓取与商用 |
| RAG 语料 | 部门文档、客户资料、行业资料 | 企业授权、合同约定 | 权限分级是否入库前打好 |
- 公开数据爬取前先读 robots 协议与服务条款:允许抓取不等于允许商用,更不等于允许用于训练,许可范围要能举证
- 用户行为数据采集前先过最小必要评审:每个字段说清用途与保留期,说不清就不采
- 采集即打标:来源、抓取时间、授权协议版本、语言/领域标签在入口处记录,事后再补等于重采
清洗
清洗的目标:把数据变成符合用途的形态。常见动作:
- 去重:精确去重(哈希)之外要处理近似重复(同文转载、换行差异、翻译版本)。但要小心「该保留的重复」:同一制度的不同版本是重复也是历史,去重前先定「以哪个版本为准」
- 去噪:页眉页脚、广告、乱码、非目标语言内容、OCR 错误。噪声稀释语料质量,也会让评测集失真
- 格式统一:编码统一(UTF-8)、换行统一、日期/数字格式统一、半角全角统一。格式问题会直接破坏 embedding 与关键词检索的一致性
- 脱敏:PII 识别与替换,方法与粒度权衡见 数据隐私与用户控制 的「PII 识别与脱敏」
- 质量门:每批清洗后抽样检查(漏网噪声比例、格式异常比例),不合格的批次不进入下一环节
清洗过度破坏分布
清洗是「去掉坏的」,不是「变成想要的」:过度清洗(删掉口语化表达、过滤掉所有长句、强行拉平类别分布)会破坏真实数据分布,模型学到的「现实」是清洗后的滤镜,上线遇到真实分布就会退化。
判断标准:清洗前后各跑一遍评测,质量不下降的清洗才是有效清洗。
标注
标注是把「机器看不出来、人看得出来」的信息(类别、边界、偏好、答案质量)固化到数据上的环节。任务类型与工具选型见 标注工具与平台,质量保障方法见 标注规范与质量。
管理
数据管理解决三个问题:版本、权限、合规审批。
- 版本:数据集与代码一样要版本化(内容哈希 + 变更记录 + 责任人)。「哪个数据集训出了这个模型」要能回答;评测集尤其要版本隔离,避免评测污染
- 权限:按角色分级(标注员看任务、审核员看答案、分析师看脱敏样本),敏感数据集(含真实用户内容)默认不可导出
- 合规审批:数据用途变更(客服日志 → 训练数据)要重新过授权与审批;新数据集入库前过「来源 + 用途 + 保留期」三件套评审
- 台账:一份数据台账(来源、授权、用途、保留期、负责人)与 数据隐私与用户控制 的数据地图对齐,季度对账
投放
清洗与标注后的数据按用途投放:
- RAG 语料:切块、嵌入、建索引:入库即校验,运营细节见 RAG 产品化实战 的索引运营
- 微调数据:按 SFT / 偏好对格式组织,进训练管线——见 模型训练与对齐
- 评测集:版本化隔离、防污染,构建方法见 评估与评测
投放的统一要求:每条数据可溯源(来源、清洗、标注记录齐全)、可撤回(用户删除请求能定位到具体数据并移除)。
标注工具与平台
标注工具的核心差异不在界面,而在是否支持你的任务类型、是否支持多人协作、数据放哪里。选型先看任务,再看规模,最后看隐私与成本。
开源工具
| 工具 | 任务类型 | 部署与协作 | 一句话定位 |
|---|---|---|---|
| Label Studio | 文本分类、序列标注、目标检测、音频/视频等多模态 | 自托管(Docker),多用户,标注/审核角色分离,支持 ML 辅助标注 | 任务类型最全的开源标注平台(Label Studio 官方文档) |
| Doccano | 文本分类、序列标注、序列到序列 | 自托管,多用户,界面轻量 | 轻量文本标注工具(Doccano 仓库) |
| Argilla | 偏好对、评分、修正、文本分类(面向 LLM 反馈数据) | 自托管,Python SDK + Web 界面,与训练/评测管线集成 | 面向 LLM 反馈与偏好数据采集的协作平台(Argilla 官方文档) |
| Prodigy | 文本分类、序列标注、偏好排序,主动学习 | 本地安装,命令行驱动 + Web 标注,商业授权(闭源) | 主动学习驱动的标注工具,强调「模型帮你标」(Prodigy 官网) |
商业平台
- Scale AI:数据标注与 RLHF 数据平台,提供托管标注团队与「数据引擎」(Data Engine)方法论,为模型厂商提供偏好数据与评测服务。能力与定价以官方页面为准(Scale AI 官网)
- Surge AI:面向 LLM 的偏好数据与红队测试平台,强调给模型公司供数据。以官方页面为准(Surge AI 官网)
- Snorkel:程序化标注(weak supervision),用标注函数批量生成弱标签再整合,适合有工程能力的团队(Snorkel 官网)
- 众包平台(Toloka、Appen 等)按任务发布、按量计费,适合规模化文本分类等劳动密集型任务,以官方页面为准
国内生态
国内生态以云厂商标注服务与众包平台为主(阿里云、百度的智能标注与数据众包服务等,能力与价格以官方页面为准),另有面向内容安全与客服语料的标注团队;选型逻辑与海外一致:任务类型匹配、数据不出域、成本可控。
选型维度
| 维度 | 决策问题 | 提示 |
|---|---|---|
| 任务类型 | 工具是否原生支持我的任务(分类 / 序列 / 对话 / 偏好对 / 多模态)? | 偏好对与排序任务的选择远少于文本分类,别拿分类工具硬做偏好 |
| 规模 | 数据量是千条、万条还是十万条?标注员是 1 人还是 20 人? | 小规模用开源自托管;大规模考虑商业平台或众包 |
| 隐私 | 数据能否离开公司网络?是否含真实用户内容? | 敏感数据要求自托管或私有化部署,标注外包要签 DPA |
| 成本 | 自建人力(标注员 + 管理)vs 按量付费 vs 工具授权费 | 把管理成本算进去:自建工具的管理成本常被低估 |
| 与管线集成 | 标注结果能否导出为训练/评测所需格式,能否接进反馈回流? | 导出格式与 API 决定自动化程度 |
标注规范与质量
标注质量问题的根源几乎都是规范缺失或规范失效,而不是标注员不认真。质量体系由四件套组成:标注指南、一致性度量、抽检返工、人员培训。
先明确常见标注任务类型。工具选型与质量指标都从任务类型出发:
| 任务类型 | 标注内容 | 典型工具 | 一致性难点 |
|---|---|---|---|
| 文本分类 | 打类别标签(意图、情感、领域) | Label Studio、Doccano | 类别边界模糊 |
| 序列标注 | 标注实体与边界(NER、槽位) | Label Studio、Doccano、Prodigy | 边界判定不一致 |
| 对话质量 | 对回答打分/排序(有帮助、安全) | Argilla、Prodigy | 主观维度混杂 |
| 偏好对 | 两个回答选优/排序 | Argilla、Prodigy | 个人偏好差异 |
| 摘要与改写 | 写摘要、改错 | Label Studio | 质量标准难统一 |
标注指南(annotation guideline)
标注指南是标注工作的产品需求文档:
- 写什么:任务定义(什么是正例/负例)、边界案例(难例、模糊例如何处理)、标注流程(步骤、工具操作)、质量要求(期望的一致性水平)
- 怎么写:用真实案例说话:每条规则配 2-3 个正反例,比抽象定义有用十倍;边界案例单独成节;标注员遇到没写过的案例要能上报而不是自行决定
- 怎么迭代:指南是活文档:试点标注 100-200 条后收集分歧案例,把高频分歧写进指南;每轮返工的案例回流更新指南;指南版本与数据集版本对应(「这批数据是按 v3 指南标的」)
- PM 的检查点:新任务上线前,指南先给 2-3 个标注员试用,一致性达标(如 kappa 达到阈值)再批量开工
双人标注与一致性度量
- 双人标注:同一批样本由两个人独立标注,用于度量任务本身是否清晰。任务定义清晰时一致性高,一致性低说明指南没写清或任务太难
- Cohen's kappa:两人标注一致性的标准度量,扣除了「瞎猜也能一致」的成分,取值 -1 到 1;一般文本分类任务 kappa 达到 0.7-0.8 以上视为可接受(不同任务阈值不同,以业界实践为准)(Cohen's kappa - Wikipedia)
- 分歧处理:分歧样本进入讨论会:三人以上仲裁决定最终标签,并把分歧案例回写指南。分歧不是失败,是指南迭代的原料
- 不是所有任务都要双人:成本高的专家任务可以单人标注 + 抽检,但抽检样本要覆盖分歧高发的类别
质量抽检与返工流
- 抽检:按批次随机抽检(常见比例 5-10%,按质量历史调整),抽检记录错误率,错误率超阈值的批次整批返工
- 返工流:抽检发现问题 → 定位错误模式(理解偏差还是手误)→ 批量修正同类错误 → 更新指南 → 重抽检。返工不能只改抽到的那几条
- 标注员维度:按标注员统计错误率,持续偏高的标注员需要培训或调岗。这是质量管理,不是处罚
- 审计留痕:谁标的、谁审的、按哪个版本指南、结论如何,全部留痕。这是评测集与训练数据可信度的证据链
众包 vs 专家 vs 内部标注
| 方式 | 适合 | 优点 | 风险 |
|---|---|---|---|
| 众包 | 大规模、规则清晰的任务(文本分类、内容审核) | 规模弹性、成本低 | 质量波动大、敏感数据出境、指南执行不一致 |
| 专家 | 领域判断任务(医疗/法律/金融标注、偏好对) | 质量高、能处理模糊案例 | 贵、慢、规模受限 |
| 内部 | 核心数据(评测集、对齐偏好数据、产品核心语料) | 口径可控、数据不出域、贴近产品 | 占用人手、扩展性差 |
- 组合拳:内部定规范与抽检,众包做批量,专家处理疑难。分层是主流做法
- 核心数据不外流:评测集与偏好数据是核心资产,即使众包也要先脱敏;涉密场景(企业知识库语料)只走内部或私有化标注
标注人员培训
- 上岗前:指南培训 + 试标考核(试标一批,达到一致性阈值才上岗)
- 过程中:定期校准会(每周/每两周抽一批分歧案例集体讨论)、新指南版本发布时复训
- 考核指标:一致性(kappa)、抽检错误率、返工率。指标入周报;标注质量是运营指标,不是一次性验收
合成数据
合成数据(synthetic data)指由模型(而非真实世界事件)生成的数据。LLM 时代合成数据的应用大幅扩展:从补数据到造任务,是当前数据工程的重要杠杆,但也带来新的风险。
场景:什么时候用合成数据
- 补齐长尾:真实数据里罕见的场景(罕见意图、罕见实体、极端案例)用模型生成补充。长尾恰恰是模型最弱的区间,也是合成数据最有效的区间
- 隐私替换:用生成数据替代真实 PII 场景,或对真实数据做重写脱敏(把姓名、地址等替换为虚构但形态一致的占位)。重写不等于匿名化,以官方口径为准
- 平衡类别:类别不均衡(正例远少于负例)时,为少数类生成补充样本
- 造任务与自举:生成指令-回答对、为已有文本生成问答对(用于 RAG 评测与微调)。Self-Instruct 是这类方法的代表(Self-Instruct 论文)
- 模型自训练:用强模型生成高质量文本训练小模型:「教科书式数据」是 phi 系列的核心方法(Textbooks Are All You Need 论文),从强模型输出中学习复杂推理是 Orca 系列的方法(Orca 论文)
方法与工具
- 方法:提示词模板批量生成、改写/扩写真实数据、多模型投票与筛选(只保留一致同意的生成)、蒸馏式生成(强模型教弱模型)。方法与效果细节以论文与官方文档为准
- 筛选比生成更重要:合成数据的关键步骤是质量过滤:用规则(长度、格式、去重)与模型(评分、一致性)双重过滤,只保留高质量子集。生成的量不重要,过滤后的质才重要
- 工具:模型厂商提供数据生成与微调平台(OpenAI、Google 等的数据生成能力,以官方文档为准);开源侧以提示词工程 + 评测框架组合为主
风险
合成数据的三大风险
- 分布偏差:合成数据是模型对世界的想象,会放大模型已有的偏见与盲区。模型不知道的领域,合成数据也不会知道;合成数据比例过高会让真实分布被稀释
- 幻觉污染:生成内容可能含事实错误,错误会随训练固化进模型;用未经验证的合成数据训练,等于把幻觉变成信念
- 评估集污染:合成数据进评测集尤其危险。评测集必须反映真实任务分布,用模型生成的问题当评测题,等于自己出题自己考,评测分数虚高且不可信
- 评估集污染的实证:对开源模型的评测研究发现,用模型生成的数据做评测会导致基准分数系统性虚高、无法反映真实能力差异(The False Promise of Imitating Proprietary LLMs 论文)。评测集一旦被合成数据污染,后续所有改进都会建立在不真实的基线上
- 合成数据使用原则:真实数据打底、合成数据补充;每一批合成数据都标注合成来源并接受抽检;进训练集前跑评测对比(加合成与不加合成的效果差);永不进评测集。评测集只能用真实数据与人工标注
RLHF 与偏好数据工程
让模型符合人类偏好是后训练阶段的核心工作。本页只讲偏好数据的工程侧(怎么构建、怎么回流),训练算法与流程见 模型训练与对齐 的「人类反馈强化学习(RLHF)」与「RLHF 的替代与演进」。
偏好对构建
RLHF 的基础数据是偏好对:同一问题给出两个回答,标注者判断哪个更好(或排序)。构建要点:
- 任务设计:同一 prompt 下生成 2-4 个候选回答(不同温度/不同模型/不同提示词),标注者排序。候选差异太小没有信息量,差异太大看不出细微偏好,生成时控制多样性
- 标注指令:「哪个更好」要定义清楚(更有帮助?更安全?更符合事实?)。不同维度的偏好混在一起会让模型学混乱;维度拆开标(helpfulness 与 harmlessness 分开)是主流做法
- 标注者:偏好判断是主观任务,一致性天然低于分类任务。双人标注 + 分歧仲裁在这里尤其重要;筛选「与多数人一致」的标注者是奖励模型时代的共识做法
- 数据量:偏好数据量级随模型与任务差异很大,以论文与官方实践为准。不要拍脑袋定要多少条,按评测效果迭代(InstructGPT 论文 报告了数据规模与效果的关系,以原文为准)
拒绝采样
拒绝采样(rejection sampling)是偏好数据的低成本增强:从模型采样 N 个回答,用奖励模型(或规则、人工)选出最好的那个,作为高质量样本回灌训练。把「采样-筛选」当作数据来源,是 Anthropic 训练 Helpful/Harmless 模型时的关键做法之一(Training a Helpful and Harmless Assistant 论文)。
反馈数据回流
产品侧收集的赞/踩/修改数据(见 数据飞轮设计)是偏好数据的线上来源:
- 踩 → 偏好对:被踩的回答与(修改后的)最终回答组成差-好对,回流为偏好数据
- 修改 → 高质量示例:用户把 AI 输出修改成最终发送版本,修改后的文本是高质量 SFT 示例。用户帮模型免费标注
- 回流纪律:线上反馈必须过抽检与指南:「用户即标注员」要加质量控制,否则垃圾进、垃圾出
- 历史教训:直接把产品反馈灌进训练数据而不做质量门,会放大噪声。反馈回流与专职标注是互补关系,不是替代关系
RLAIF 与模型合成偏好
RLAIF(Reinforcement Learning from AI Feedback)用模型代替人类标注偏好:让一个模型(或规则)对两个回答给出偏好判断。数据量几乎无限、成本低,是可扩展监督(scalable oversight)路线的重要一环:
- 宪法式 AI(Constitutional AI):Anthropic 让模型根据一组宪法原则自我批评与修订回答,再据此训练。这是 RLAIF 的代表作(Constitutional AI 论文、Anthropic 官方博客)
- RLAIF 论文:Google 的研究显示 AI 反馈训练的奖励模型与人类反馈效果相当(以论文实验口径为准)(RLAIF 论文)
- 趋势与边界:合成偏好是当前对齐数据的主流方向之一,但 AI 判断人类偏好存在自增强偏差(模型偏好会自我强化);LLM-as-Judge 的局限同样适用于偏好标注(评测方法见 评估与评测)。人机混合仍是可信做法:AI 批量初筛、人类抽检仲裁
对齐数据管线
一条可复用的对齐数据管线:产品反馈收集 → 清洗与脱敏 → 人工抽检归因 → 构建偏好对/SFT 示例 → 专职标注复核 → 进训练/评测 → 效果评测 → 新反馈回流。管线中的每个环节都要有质量门(抽检率、一致性、返工率),与 模型训练与对齐 的训练流程衔接。
flowchart LR
product[产品反馈] --> sanitize[清洗与脱敏]
sanitize --> review[人工抽检与归因]
review --> pairs[偏好对 / SFT 示例]
pairs --> annotate[专职标注复核]
annotate --> train[训练或评测]
train --> measure[效果评测]
measure --> product对齐数据管线以产品反馈为入口、以效果评测为闸门,合格数据才进入训练并继续接受线上反馈。
数据合规与治理
红线一节给「不能碰」的清单,本节给「怎么管」的机制。法规框架与各市场差异见 出海与合规,产品机制(脱敏、删除、同意管理)见 数据隐私与用户控制。
授权链管理
- 来源合法:每条数据回答「从哪来」:自有数据(用户协议版本、同意记录)、第三方数据(授权合同、授权范围)、公开数据(许可条款、robots 协议)三类来源分别留档
- 合同约定:第三方数据合同写清「用途范围」(能否用于训练/微调/商用)、地域范围、期限;供应商变更或合同到期时数据要能停用与删除
- 授权记录:授权与同意记录可审计(谁、何时、哪个版本、勾选了哪些项)。训练数据上线前,法务按授权链逐条过审(清单见 出海与合规 的「微调数据审查清单」)
最小必要与删除权利
- 最小必要:采集字段逐个过「用途评审」,说不清用途的字段不采;用途变更(如客服日志转训练)要重新取得同意
- 删除权利:用户要求删除时能删干净:对话、日志、备份、向量库、第三方副本全链路删除;删除实现(软删/硬删、SLA)见 数据隐私与用户控制 的用户控制一节
数据出境评估
- 出境触发:数据流向境外主体(模型 API、标注平台、海外日志)即算出境,按数据流向认定,不按服务形态
- 出境路径:安全评估、标准合同、认证。适用哪条以官方口径与法务判断为准(出海与合规 的「跨境传输」)
- 工程支撑:出境清单与数据地图一致(哪些字段流向哪个供应商);供应商选择时把数据区域、数据驻留作为选型条件
训练数据政策(供应商维度)
- no-train 条款:使用第三方模型 API 时确认供应商是否用你的数据训练(是否默认不训练、是否有 opt-out)。这是选型条件而不是合同细节,各厂商政策以官方页面为准(如 OpenAI 企业隐私、Anthropic 商业条款)
- 标注外包同理:众包平台是否拿数据训练自己的模型、数据存储区域、删除能力。外包标注也是数据接收方,要签数据处理协议(DPA)
- 供应商条款对比表:不训练、不保留、数据区域、子处理者披露四列,纳入选型评审(口径见 数据隐私与用户控制 的「与模型供应商的数据处理条款」)
治理机制落地
- 数据台账:一份台账覆盖「来源、授权、用途、保留期、负责人、存储位置」,与数据地图对齐,季度对账
- 审批流:新数据集入库与用途变更走审批(来源 + 用途 + 保留期三件套),审批留痕
- 审计:数据集访问、导出、删除操作留审计日志;标注外包的交接记录归档
- PM 的季度巡检:授权链抽查(任意 3 条数据的授权记录能否当场拿出)、台账对账(新存储/新数据集是否补行)、供应商条款复核(no-train 承诺是否仍有效)
来源说明
本文为原创整理,主要依据以下权威来源(访问日期 2026-08-24,均已核实可达;具体能力、价格与政策以官方页面为准)。
- Label Studio 官方文档——开源标注平台的任务类型、部署与协作
- Doccano 仓库——轻量文本标注工具
- Argilla 官方文档——LLM 反馈与偏好数据协作平台
- Prodigy 官网——主动学习标注工具(商用闭源)
- Scale AI 官网、Surge AI 官网、Snorkel 官网——商业数据平台(以官方页面为准)
- Cohen's kappa - Wikipedia——一致性度量定义
- 合成数据:Self-Instruct 论文、Textbooks Are All You Need 论文(phi 系列教科书数据)、Orca 论文(复杂解释轨迹)、The False Promise of Imitating Proprietary LLMs 论文(合成数据评测污染实证)
- RLHF 与偏好数据:InstructGPT 论文、Training a Helpful and Harmless Assistant 论文(拒绝采样)、Constitutional AI 论文 与 Anthropic 官方博客、RLAIF 论文
- 供应商政策(以官方页面为准):OpenAI 企业隐私、Anthropic 商业条款
- 站内相关:模型训练与对齐、检索技术、RAG 产品化实战、数据隐私与用户控制、出海与合规、评估与评测
更新记录
| 日期 | 变更 | 说明 |
|---|---|---|
| 2026-08-24 | 扩写 | 从 35 行扩至 330+ 行:数据工作全景补检查点与常见坑、数据合规红线补授权链与出境、数据飞轮补埋点与回流做法;新增数据管线全景、标注工具与平台、标注规范与质量、合成数据、RLHF 与偏好数据工程、数据合规与治理六节;锚点(既有 H2/练习块)保持稳定 |
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用