跳转至

数据与标注

数据与标注

高质量数据是 AI 产品效果的基石——无论是 RAG 知识库、微调数据还是评测集。

数据工作全景

环节内容
采集文档、日志、用户行为、公开数据
清洗去重、去噪、格式统一、脱敏
标注人工/半自动标注、质量抽检
管理版本、权限、合规审批

产品经理的关注点

  • 数据即资产:AI 产品的护城河常常是"独家数据 + 数据飞轮"(用户用得越多数据越好,数据越好产品越好)
  • 数据质量 > 数据量:1000 条干净数据好过 10 万条垃圾
  • 标注规范先行:标注口径不统一 = 数据不可用
  • 脱敏是前提:个人敏感信息(手机号、身份证、地址)处理后再入库

数据合规红线

  • 数据来源合法(用户授权、合同约定)
  • 收集最小必要
  • 删除权利(用户要求删除时能删干净)

数据飞轮设计

  • 产品内埋点收集"用户的显式反馈"(赞/踩、修改行为)
  • 把"用户修改了 AI 输出"作为最优质数据
  • 定期回流数据改进产品(评测集、知识库、提示词)
练习

审视你的产品:哪些环节可以低成本收集高质量反馈数据?设计一个"反馈 → 改进"的最小闭环。