提示词与评测工具
提示词与评测工具
提示词开发与效果评测是 AI 产品迭代的日常。本页整理常用的工具与工作流。
提示词开发工具
- 官方 Playground:各家模型平台的调试台(最常用)
- 可视化提示词工具:测试变量、批量对比输出
- 版本管理:提示词入库(git),带版本号与备注
- 结构化提示词框架:如 Claude Code 的 CLAUDE.md、系统提示词模板
评测工具
| 工具类型 | 作用 | 例子 |
|---|---|---|
| 评测平台 | 跑评测集、出分数 | 自建脚本 / 商业评测平台 |
| LLM 裁判 (LLM-as-Judge) | 用模型给模型打分 | 自动化评估 |
| 回归测试工具 | 提示词改动后全量回归 | 自建流水线 |
| 用户反馈收集 | 线上真实反馈回流 | 产品内反馈组件 |
评测集建设要点
- 从真实用户输入出发,而非凭空想象
- 分类存放:典型 / 边界 / 对抗
- 每次改动留基线分数,做前后对照
- 定期补充线上失败案例
工作流建议
- Playground 快速试 → 2. 用例入库 → 3. 批量跑分 → 4. 分析失败 → 5. 修改提示词 → 6. 回归
注意
LLM 裁判有偏差(偏爱长答案、偏爱自己风格),重要指标仍要人工抽检。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用