数据与标注
数据与标注
高质量数据是 AI 产品效果的基石——无论是 RAG 知识库、微调数据还是评测集。
数据工作全景
| 环节 | 内容 |
|---|---|
| 采集 | 文档、日志、用户行为、公开数据 |
| 清洗 | 去重、去噪、格式统一、脱敏 |
| 标注 | 人工/半自动标注、质量抽检 |
| 管理 | 版本、权限、合规审批 |
产品经理的关注点
- 数据即资产:AI 产品的护城河常常是"独家数据 + 数据飞轮"(用户用得越多数据越好,数据越好产品越好)
- 数据质量 > 数据量:1000 条干净数据好过 10 万条垃圾
- 标注规范先行:标注口径不统一 = 数据不可用
- 脱敏是前提:个人敏感信息(手机号、身份证、地址)处理后再入库
数据合规红线
- 数据来源合法(用户授权、合同约定)
- 收集最小必要
- 删除权利(用户要求删除时能删干净)
数据飞轮设计
- 产品内埋点收集"用户的显式反馈"(赞/踩、修改行为)
- 把"用户修改了 AI 输出"作为最优质数据
- 定期回流数据改进产品(评测集、知识库、提示词)
练习
审视你的产品:哪些环节可以低成本收集高质量反馈数据?设计一个"反馈 → 改进"的最小闭环。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用