跳转至

提示词与评测工具

提示词与评测工具

提示词开发与效果评测是 AI 产品迭代的日常。本页整理常用的工具与工作流。

提示词开发工具

  • 官方 Playground:各家模型平台的调试台(最常用)
  • 可视化提示词工具:测试变量、批量对比输出
  • 版本管理:提示词入库(git),带版本号与备注
  • 结构化提示词框架:如 Claude Code 的 CLAUDE.md、系统提示词模板

评测工具

工具类型作用例子
评测平台跑评测集、出分数自建脚本 / 商业评测平台
LLM 裁判 (LLM-as-Judge)用模型给模型打分自动化评估
回归测试工具提示词改动后全量回归自建流水线
用户反馈收集线上真实反馈回流产品内反馈组件

评测集建设要点

  • 真实用户输入出发,而非凭空想象
  • 分类存放:典型 / 边界 / 对抗
  • 每次改动留基线分数,做前后对照
  • 定期补充线上失败案例

工作流建议

  1. Playground 快速试 → 2. 用例入库 → 3. 批量跑分 → 4. 分析失败 → 5. 修改提示词 → 6. 回归
注意

LLM 裁判有偏差(偏爱长答案、偏爱自己风格),重要指标仍要人工抽检。