对话助手
对话助手
对话助手是最经典的 AI 产品形态:以聊天界面为核心交互,覆盖从通用助手到垂直场景(客服、教育、法律、健身……)。聊天既是入口也是产品本身——用户不学新界面,一句话就能表达需求,模型直接产出结果。
对话助手有两条特性决定了它和传统软件不同:
- 输入是开放的:用户说什么不可枚举,产品必须为「大概率行为」设计,而不是为「可预期的流程」设计(非确定性带来的影响见 AI 产品开发生命周期(CC/CD))
- 交互即产品:聊天没有「页面层级」,产品设计全部落在对话内容本身——开场说什么、回答多长、边界怎么声明,都是产品决策
对话为什么是 AI 产品的默认界面
- 自然语言是通用接口:不需要学习按钮和表单,表达能力比任何 UI 都宽——这是对话助手的上限来源,也是它的失控来源(用户什么都会问)。
- 门槛最低:打字/说话人人会,覆盖非数字原生用户;语音让交互进一步下沉(见 语音与音频)。
- 模型直接消费对话:多轮对话天然适配上下文窗口,不需要为每类输入单独做结构解析——成本低,所以「先做个聊天」是 AI 产品最常见的起点。
对话助手与相邻形态的边界
对话只是交互形态,「对话助手」作为产品定义的是一类以对话完成用户任务的产品。它与相邻形态的边界:
| 形态 | 任务边界 | 交互特点 | 自主程度 | 典型代表 |
|---|---|---|---|---|
| 对话助手 | 问答、建议、轻量动作 | 纯对话,无固定界面 | 低,输出即终点 | ChatGPT、客服机器人 |
| 知识库问答 | 私有知识问答 | 对话为主,但知识域受限 | 低 | 企业文档问答(见 知识库问答) |
| Agent 产品 | 多步任务、跨系统执行 | 对话是入口,执行在后台 | 中高,可自主行动 | 订票、研究助手(见 Agent 产品) |
| Copilot | 嵌入既有工作流 | 对话与工具界面并存 | 中,输出进工作流 | 代码补全、设计辅助(见 Copilot) |
边界是流动的:对话助手加工具调用就滑向 Agent,加私有知识就滑向知识库问答。判断产品形态的关键不是「有没有聊天框」,而是「任务边界和失败半径」——本页讨论以对话完成任务的通用设计问题。
对话产品的五段管线(产品经理视角)
把一次对话拆成五段,每段都有产品决策:
| 阶段 | 产品决策 | 常见错误 |
|---|---|---|
| 入口 | 在哪触发对话、开场说什么 | 只有聊天框,无引导无示例 |
| 理解 | 意图识别、实体抽取、输入校验 | 全靠模型猜,无分类层兜底 |
| 检索 / 工具 | 知识库召回、工具调用 | 资料整库塞进 prompt,又贵又易幻觉 |
| 生成 | 回答结构、长度、语气、引用 | 长文小作文、无引用无重点 |
| 护栏与反馈 | 内容安全、拒答、赞踩收集 | 输出无过滤、无反馈入口 |
管线不是产品架构图,而是排查问题的地图:用户说「答非所问」,先定位是理解错了、检索没召回、还是生成偏了——五段里哪段出问题,修法完全不同。
本文是对话助手的方法页:先分通用 / 垂直 / 角色化三类,再展开冷启动、对话体验、记忆、系统提示词、信任、成本与评测七个核心设计问题;垂直场景的深度拆解(客服自动化)见 客服自动化,同属一类。
读本文之前
对话助手的技术底座(提示词工程、多模态、LLM 能力)见 AI 基础;评测方法论见 评估与评测;客服案例口径与 AI 产品开发生命周期(CC/CD) 的「客服工单助手」走查保持一致。
产品分类
三类对话助手:通用 / 垂直 / 角色化
| 维度 | 通用助手 | 垂直助手 | 角色化助手 |
|---|---|---|---|
| 定义 | 能力全、不做场景限定 | 聚焦场景、内置专业知识 | 人格化陪伴 / 娱乐 |
| 购买逻辑 | 为「一次解决任何问题」的能力付费,订阅制为主 | 为「结果」付费(解决率、节省的工时),B 端按席位 / 调用量 | 为情绪价值付费,订阅 / 打赏 / 道具 |
| 成本结构 | 单次调用成本高,对话越长 token 越贵;靠缓存与分层模型控制 | 知识库治理 + 检索 + 生成三段成本,输入长输出短、单次成本可控 | 单次成本低,但人设运营与陪伴内容是持续投入 |
| 留存机制 | 工具性留存:任务频次 + 记忆与个性化粘性 | 业务价值留存:问题被解决才会回来 | 情感联结与习惯化:每天聊,人设一致性是命门 |
| 代表 | ChatGPT、Claude、豆包 | 客服机器人、法律助手、AI 教练 | 陪伴型 AI |
三类之间没有严格边界,产品会互相借鉴:通用助手可以内置垂直能力(自定义指令、专属会话),垂直助手可以长出角色化表达(客服机器人的拟人化话术)。分类的意义在于回答三个问题:用户为什么付费、成本结构长什么样、靠什么留住用户——这决定了产品设计的优先级,也决定了评测该看什么指标。
购买逻辑:三类各卖什么
| 类型 | 定价模式 | 付费方 | 决策链 | 续费理由 |
|---|---|---|---|---|
| 通用助手 | 免费层 + 订阅(按席位 / 用量) | C 端个人 | 单次试用即决策,冲动订阅 | 每周还在用、离不开 |
| 垂直助手 | B 端按席位 / 调用量 / 年费;C 端订阅 | B 端部门 / 个人 | 采购流程,看 ROI 与合规 | 节省的工时 > 订阅费 |
| 角色化助手 | 订阅 / 打赏 / 道具 / 广告 | C 端个人 | 情感冲动付费 | 情感联结还在、人设没崩 |
通用与角色化卖「人」(能力或情感),垂直卖「事」(结果)。卖「事」的定价可以直接挂业务指标(每解决一单收多少钱),卖「人」的只能挂使用时长与订阅。
成本结构:三类成本敏感度
- 通用助手:旗舰模型 + 长对话 → 单次成本高、毛利率压力大;必须靠缓存、分层路由、量化等手段压成本(见「成本与体验权衡」)。用户增长直接放大成本,属于「毛利随规模被稀释」的模型。
- 垂直助手:输入长(系统提示 + 知识库上下文)但输出短(回答/建议),且知识库前缀可缓存——单次成本可控;真正的成本在知识库治理与人工兜底(维护、抽检、转人工的客服成本)。
- 角色化助手:短对话、小模型即可,边际成本趋近于零;成本在人设内容的生产(设定、剧本、音色、美术)与流失后补量。
留存机制:三类留存的曲线形态
- 通用助手:任务驱动,使用频次随「有没有事问」波动,曲线大起大落;留存靠记忆与个性化(用越久越懂你,迁移成本上升)。
- 垂直助手:业务驱动,问题解决即离开,留存是「再遇到同类问题还会回来」;单次会话短但复访稳定,留存取决于问题频次而不是聊天趣味。
- 角色化助手:习惯驱动,每天固定时段打开,曲线平滑;留存取决于人设一致性(今天和昨天是同一个「人」)与内容更新。
角色化助手的特有问题
角色化助手最容易踩的坑不是技术而是人设与伦理:
- 人设一致性:用户与「这个角色」建立关系,角色说变就变(模型更新、提示词改动导致性格漂移)就是关系破裂——人设参数要版本管理,像维护品牌一样维护角色
- 情感依赖边界:陪伴产品与用户(尤其未成年人)建立情感联结,需要内容安全与使用边界设计(时长提醒、危机话题转人工或转专业机构)
- 越界风险:用户把角色化助手当真人倾诉敏感信息——隐私与数据使用声明要比功能更早给到用户
通用与垂直:两种产品逻辑
- 通用助手是「别挡路」:用户带着任意问题来,产品任务是理解快、生成快、不打断。搜索式入口 + 会话式出口,广度优先;评测看「留不留得住」。
- 垂直助手是「把事办成」:用户带着特定任务来,产品任务是领域内答得准、动作办得成、边界守得住。深度优先;评测看「办不办得成」。
垂直助手的双边界:知识边界 + 场景边界
垂直助手靠两个显式边界立住人设,也靠它们控制幻觉与责任范围:
- 知识边界:只答领域内的问题。领域外问题明确拒绝(「这超出我的知识范围」),而不是硬答。知识边界之外没有「正确答案」,硬答就是幻觉的第一来源。
- 场景边界:只办场景内的动作。客服助手被要求算命、健身教练被问股票,礼貌拒绝并引导回场景。场景边界之外没有「正当动作」,代办就是越权。
双边界的落地四件套(缺一件都不算立住了):
| 手段 | 作用 | 失败表现 |
|---|---|---|
| 系统提示词声明边界 | 模型层面约束人设与行为 | 边界只写在产品介绍里、没进提示词,模型照样越界 |
| 路由 / 分类层拦截 | 输入侧先分流,领域外直接进拒答话术 | 全靠模型自觉,边界样本在评测集里反复翻车 |
| 拒答话术设计 | 拒绝 + 给下一步(换问法 / 转人工 / 给线索) | 冷冰冰一句「我不知道」,用户流失 |
| 评测集含边界样本 | 把「领域外问题必须拒答」变成可回归的断言 | 评测集全是对内问题,边界行为从未被验证 |
核心设计问题
1. 冷启动与首次体验
对话产品的第一个用户决策是说点什么——空输入是最大流失点。用户面对空白聊天框,往往不知道 AI 能干什么、该怎么问。
- 开场引导:首屏给出建议提问(示例问题),降低「想第一句话」的成本;示例要覆盖高频场景,而不是展示模型有多聪明。
- 能力提示:明示能做什么、不能做什么(如「我能查物流、改地址、转人工」),管理预期也防边界外提问——用户不问边界外的问题,比被拒答后解释边界便宜得多。
- 空状态设计:空白聊天框不是「空状态」,而是「要引导用户迈出第一步」的状态——示例问题点一下就能发出去,而不是让用户自己打字。
开场引导的三种常见设计,按产品类型取舍:
| 设计 | 做法 | 适合类型 |
|---|---|---|
| 建议问题列表 | 首屏 3~5 个高频示例问题,点击即问 | 通用助手、垂直助手 |
| 能力卡片 | 展示功能清单(「我能查物流 / 改地址 / 转人工」) | 垂直助手 |
| 流程引导 | 问第一个问题前先收集必要信息(「请提供订单号」) | 强流程场景(客服、下单) |
示例问题的写法也是产品设计:
| 好示例 | 坏示例 | 原因 |
|---|---|---|
| 「帮我写一封请假邮件」 | 「什么是人工智能」 | 展示能力价值,而不是考模型知识 |
| 「查一下订单 12345 到哪了」 | 「你能做什么?」 | 示范正确用法(带参数),用户照抄就能成功 |
| 「这周健身计划怎么安排」 | 「你叫什么名字」 | 把用户引向可闭环的任务,而不是闲聊 |
首次体验的任务设计:给用户一个「30 秒能体验成功」的入口。第一次使用就该完成一次「问 → 答 → 有用」的完整闭环,让用户感知到价值,而不是先注册、先配置、先看说明。首次体验检查清单:
| 检查项 | 标准 |
|---|---|
| 首答速度 | 首次提问到首字出现 < 2 秒,完整回答不拖沓 |
| 首答质量 | 第一个回答就能解决一个真实小问题,不堆免责声明 |
| 示例问题 | ≥ 3 个示例问题,覆盖高频场景,点击即问 |
| 能力声明 | 用户 10 秒内能说出「它能帮我做什么」 |
| 成功定义 | 首次会话内完成一次「问题被解决」的闭环 |
首次体验的三个常见失败路径,上线前逐个排查:
- 答非所问:用户第一个真实问题命中能力盲区 → 首答即失望。解法:冷启动阶段把示例问题设计成「高命中率」问题,同时收集真实首问回填评测集。
- 流程太长:首答前要注册、要授权、要选偏好 → 用户在价值兑现前流失。解法:先用匿名会话兑现价值,再引导登录。
- 答完没下一步:回答完没有后续动作引导(追问、相关建议、转人工)→ 会话戛然而止。解法:设计「下一轮建议」与任务完成确认。
2. 对话体验设计
- 流式输出:逐字显示与「转圈等待」的体验差异巨大——流式让用户提前读到内容、感知到进展。产品要分别关注首 token 延迟(TTFT,用户等待的体感起点)与输出速度(读速是否跟得上)。流式还天然支持「读到一半发现不对就打断」。
- 中断与编辑:用户要能随时停止生成、编辑自己的提问、重发。编辑后上下文的处理要有明确规则:是替换该轮输入重答,还是保留历史追加一轮——两者结论不同,规则不明确就会「越答越偏」。
- 多轮上下文:会话内记忆决定对话连贯性,也是成本与质量的双杠杆。取舍三件事:
- 长度:超窗口怎么办——截断最早轮次最便宜但会失忆;摘要压缩(早期轮次先摘要再进上下文)质量更好;
- 摘要:谁来做摘要、多久做一次、摘要本身算不算上下文;
- 过期:会话多久过期、过期后是否保留摘要(客服场景的会话转人工需要摘要延续)。
- 回答长度与语气:长度不是越短越好也不是越长越好——简单查询给短答,方案类问题给结构长文;语气要稳定(「人设」的一部分),同一产品时而官方时而卖萌就是体验事故。
- 任务完成确认:任务型对话(查单、改地址)结束时要显式确认「已办成」并给出后续入口;只回答不确认,用户不确定到底办了没有。
- 输出排版:长回答要用列表、分点、代码块降低阅读成本,引用来源要有可见的标注样式——对话里的「排版」就是回答的 markdown 结构,没有结构的长文段落在聊天场景里不可读。
- AI 主动 vs 被动:多数对话助手被动回答;需要主动追问的场景(收集信息、澄清歧义)要设计「追问时机」——一次只追问一件事,连续追问超过三轮用户会烦。
- 多模态输入输出:语音、图片、文件输入(拍照问「这个怎么装」、传文档让它总结),技术底座见 多模态。语音对话的体验特殊性:实时对话要求打断能力(边说边打断)、口语化表达(ASR 错误、停顿、改口)、短回答倾向(没人愿意听语音助手念小作文),以及通话场景的隐私与合规(见 语音与音频)。
3. 长期记忆与个性化
记忆是把「用过的用户」和「新用户」区分开的留存杠杆,也是隐私与体验的双刃剑:
- 记什么:显式偏好(用户主动设置:称呼、语言、回复风格)与隐式行为(历史话题、常问事项)。显式优先——隐式记忆出错时的纠正成本更高。
- 记忆的分级:会话记忆(本次对话)、短期记忆(近几日活跃上下文)、长期记忆(用户画像与偏好)。三级有不同的存储、有效期与删除策略,不要混在一个「记忆」里。
- 记忆可见可改:用户能查看 AI 记住了自己什么、能修改(「我记住了你偏好周末出行」→ 用户可改可删)。记忆是产品功能,不是模型黑盒。
- 记忆删除:用户可一键清除记忆;删除权与保留期的产品实现见 数据隐私与用户控制。
- 记忆的过期策略:偏好长期保留,行为数据设过期(如 30/90 天),敏感信息默认不存——记忆不是永久存储,过期策略要与隐私声明一致。
- 记忆污染:一次误解被写进长期记忆,之后每一轮都在错误前提上回答(见「常见坑」)。写入记忆要克制:只记「用户明确表达且可验证」的信息,低置信推断不写。
记忆的写入策略可以做成决策规则:
| 信息类型 | 是否写入长期记忆 | 理由 |
|---|---|---|
| 用户明确设置的偏好 | 写 | 最高置信,用户主动表达 |
| 重复出现的行为模式(≥ 3 次) | 写 | 有证据支持的模式 |
| 单次对话中的猜测 | 不写 | 一次误解会被永久放大 |
| 敏感信息(健康、财务、身份) | 默认不写,除非显式授权 | 隐私风险大于便利 |
4. 系统提示词作为产品配置
对话助手的「人设、边界、话术、流程」很大程度由系统提示词承载——系统提示词是产品配置,不是研发随手改的字符串:
- 版本管理:提示词有版本号、变更记录,与模型版本解耦记录——评测与事故回溯都要「模型 + 提示词」双版本,否则无法回答「哪次改动导致了行为变化」。
- 线上变更流程:任何提示词改动走「评测集回归 → 灰度 → 监控 → 回滚预案」,与发版同等级别——改一句人设话术可能改变全量输出风格(提示词设计方法见 提示词工程 与 Anthropic 官方提示词工程概览)。
- A/B 测试提示词:提示词是产品文案的一种,值得 A/B——同一评测集上「严肃版 vs 亲切版」的差评率、完成率可以量化对比(线上评估方法见 评估与评测)。
- 别把产品逻辑全塞进提示词:确定性规则(权限、校验、路由)用代码实现,提示词只负责「表达层」——靠模型自觉的规则不是规则(同见 Agent 产品 的机制设计)。
提示词变更的发布流程模板:
| 步骤 | 动作 | 负责方 |
|---|---|---|
| 1 | 变更内容 + 变更理由记录(版本号递增) | PM + 研发 |
| 2 | 评测集全量回归,新旧对比(同一模型版本) | 研发 / 评测 |
| 3 | 边界与对抗样本重点跑(人设相关的边界最易碎) | 评测 |
| 4 | 小流量灰度(如 10%),对比线上信号(赞踩、转人工率) | 数据 / PM |
| 5 | 全量发布,日志记录 prompt 版本;异常 5 分钟回滚 | 研发 |
5. 信任设计
- 幻觉与引用:事实类回答必须引用来源——引用让用户能核实,也把「编造」变成可发现的问题。RAG 类产品的引用链路见 RAG 产品化实战;官方 Citations 机制可把「引用来源」做成结构化输出(Anthropic Citations)。
- 「说不知道」的话术:拒答不是「我不会」,而是「我知道什么、不知道什么、下一步怎么办」三件套——承认不知道 + 说明能力边界 + 给替代路径(换个问法 / 转人工 / 提供线索)。用户对「诚实的 AI」信任度高于「嘴硬编造的 AI」。
- 拒答分级:不是所有「不知道」都同一待遇——
- 完全拒答:领域外问题、无信息来源的问题,直接说明边界;
- 部分拒答:有相关信息但不完整,明说「我只能确认 A,B 无法确认」;
- 引导:信息不足但可追问,给出需要补充的字段(「请提供订单号,我来查」)。
- 能力边界明示:入口声明(「我能处理物流与退款问题」)、示例问题引导(把提问引向能力内)、拒答策略(边界外不硬答)。边界明示同时服务信任与成本——边界外问题越少流入模型,幻觉与 token 花费越少。
- 引用失败的常见模式:引用存在但内容对不上(检索对、生成错)、引用不存在(编造来源)、引用旧版本(知识更新滞后)——评测集要分别测这三类,而不是只测「有没有引用」。
敏感内容:医疗、法律、金融等场景的答复要带免责与边界说明;红线框架见 出海与合规。
信任修复:答错不可避免,重要的是答错之后——主动承认(「刚才的回答有误」)、给出正确信息与来源、必要时给补偿动作(优惠券、转人工)。信任修复的速度决定用户去留。
信任不是靠一次「答对」建立的,而是靠可复现的三个行为:透明(引用来源、承认不确定)、可控(可打断、可编辑、可转人工)、一致(边界稳定、人设稳定、说不知道就说不知道)。
6. 成本与体验权衡
对话产品成本 = 单次成本 × 调用量,而单次成本里上下文输入占大头(系统提示 + 历史 + 知识库),压上下文就是压成本:
- 模型选型分层:简单请求(分类、抽取、改写、FAQ 命中)走廉价小模型,复杂请求才调旗舰——路由层先分流,而不是旗舰模型一把梭(成本测算与降本手段见 LLM 成本测算)。
- 上下文缓存:系统提示、知识库前缀等稳定内容命中 prompt 缓存,命中部分按折扣计费——固定内容放 prompt 前缀、保持格式不变,就能持续吃折扣。
- 降级策略:模型超时 / 不可用 / 成本超限时,显式降级路径:简化模型 → 模板回复 → 转人工。降级是产品设计的一部分,不是事故状态(预算熔断见 LLM 成本测算)。
- 成本感知的输出设计:输出单价高于输入,控制输出长度(
max_tokens上限、格式约束)往往比压输入见效更快——但也别把回答压到「没信息量」,省了钱丢了体验。 - 成本看板:对话产品的成本随日活波动实时变化,要有按日 / 按功能维度的成本看板与预算熔断——成本是产品指标,不是财务的事(预算熔断见 LLM 成本测算)。
成本、延迟、质量构成三角,任何优化都要为另外两个留口:
| 优化手段 | 省什么 | 代价 | 适用场景 |
|---|---|---|---|
| 小模型分流 | 单价 | 复杂请求质量下降 | 意图分类、FAQ 命中、改写 |
| 上下文缓存 | 输入 token | 前缀必须保持稳定 | 系统提示 + 知识库前缀 |
| 历史摘要 | 输入 token | 摘要丢失细节 | 长会话 |
| 输出约束 | 输出 token | 回答可能过简 | 结构化输出、短答场景 |
| 降级转人工 | 模型调用 | 人工成本 | 低置信、高风险场景 |
7. 评测与迭代
对话质量的评测难在开放式输出没有唯一正确答案——「答得好不好」是程度问题。方法论详见 评估与评测,这里只列对话产品的要点:
- 评测集构成:按难度分层——典型(高频正常输入)、边界(模糊表达、缺信息)、对抗(诱导越界、敏感话题、领域外问题),每层都要有;只测「典型」的评测集测不出对话产品的真实风险。
- LLM-as-judge 的校准限制:judge 有位置偏差(先出现的答案被偏好)、长度偏差(长答案虚高)、自我偏好(偏好与自己同源的模型)三类系统性偏差;用一小批人工标注样本校准(与人工一致性 ≥ 80% 才可批量使用)。结构化任务(分类、抽取、摘要)judge 很稳,创意与深度推理以人工为准。
- 人工抽检:每周抽 20~50 条真实对话人工评分,覆盖低置信与低分样本——judge 漏掉的「像人但没用」的问题只能靠人发现。
- 线上信号:留存(次日 / 周留存)、会话长度(太短没价值、太长可能没解决)、赞踩与反馈、转人工率。评测必须连接业务结果:准确率涨不是目标,「问题解决率涨」才是(反例与完整走查见 AI 产品开发生命周期(CC/CD))。
- badcase 回流:每次上线后收集失败案例回填评测集——评测集是活的,不是上线前写死的一次性文档。
对话产品的指标分三层,从下往上逐层传导:
| 层 | 指标 | 回答的问题 |
|---|---|---|
| 体验层 | 赞踩率、拒答率、会话长度 | 用户当下觉得好不好 |
| 任务层 | 解决率、转人工率、任务完成率 | 事有没有办成 |
| 业务层 | 留存、付费转化、成本、满意度 | 产品活不活得下去 |
三层指标都要有:只盯体验层会「聊得开心但不解决事」,只盯业务层会「数字好看但用户骂」。
垂直对话助手的差异化
垂直助手拼的不是模型,而是场景深度:
- 领域知识库(RAG 接入):把私有知识变成可检索、可引用、可更新的回答底座(见 知识库问答 与 RAG 产品化实战)。
- 领域专属交互:引导式问答而非自由聊天——客服先收集订单号再处理,法律助手先问清事实再给建议。垂直场景的对话是「有结构的任务流」,不是闲聊。
- 业务流程闭环:不只是「答」,还能「办」——查单、改地址、路由工单。每多一个动作,就多一层权限、审计与人工接管的设计(代理权阶梯见 AI 产品开发生命周期(CC/CD))。
对应的评测差异:垂直助手不靠「答得好不好」吃饭,靠场景指标——解决率、转人工率、路由准确率、处理时长。通用助手看重「留不留得住」,垂直助手看重「办不办得成」。
| 维度 | 通用助手 | 垂直助手 |
|---|---|---|
| 任务 | 任意问题 | 一类任务做到极致 |
| 交互 | 自由聊天 | 引导式任务流 |
| 评测 | 体验指标(留存、会话长度) | 场景指标(解决率、转人工率) |
| 成本 | 模型调用为主 | 知识治理 + 人工兜底为主 |
| 信任 | 能力证明 | 边界守得住 + 出错可恢复 |
| 切入难度 | 高(拼模型与生态) | 低(拼领域理解),中小企业常见路径 |
垂直助手的失败半径与人工兜底
- 失败半径:垂直助手答错的代价通常比通用助手大——通用助手答错一句玩笑话无伤大雅,客服助手答错就是客诉。设计每一条输出前先问「答错的最坏结果是什么」,再决定要不要给建议、要不要确认、要不要转人工。
- 人工兜底是垂直助手的标配:转人工入口永远可见、低置信直接转人工、出错可接管——垂直助手的信任公式是「边界守得住 + 出错可恢复」(转人工与控制交接的完整设计见 客服自动化)。
垂直 → 通用:先窄后宽的扩张路径
- 垂直助手验证后向相邻场景扩张(客服 → 售后 → 会员运营),每扩一个场景补一轮知识库、边界与评测——不要一次性宣布「我们是通用助手」,场景没接住就是人设崩塌。
- 通用助手反向收敛:按使用分布把高频场景做成专属模式(自定义指令、专属会话),把「全能」切回「场景深度」。
常见坑
| 坑 | 症状 | 根因 | 解法 |
|---|---|---|---|
| 冷启动空窗 | 用户第一句话不知道说什么,首日流失高 | 没有开场引导与示例问题,空状态无人设计 | 示例问题 + 能力提示 + 30 秒成功入口(见上) |
| 记忆污染 | 一次误解被记住,之后每轮都在错误前提上回答 | 隐式记忆写入太激进,低置信推断也记 | 只记明确且可验证的信息;记忆可见可改可删 |
| 角色崩塌 | 边界外问题硬答、敏感内容乱说,人设崩 | 边界只在宣传里、没进系统提示词与评测集 | 双边界落地四件套(见「产品分类」) |
| 成本失控 | 对话越长 token 越贵,账单随留存一起涨 | 无上下文管理、无缓存、旗舰模型一把梭 | 分层路由 + 上下文缓存 + 输出约束 + 预算熔断 |
| 把「通用」当「万能」 | 垂直场景用了通用产品逻辑,用户要「解决问题」却只得到「聊天」 | 用通用助手的产品设计模板做垂直产品 | 按场景深度设计:知识库、引导式交互、流程闭环 |
| 一上来追求「像人」 | 拟人化话术 + 假装无所不知,被发现是 AI 后信任崩塌 | 把「像人」当目标,忽略诚实与边界 | 用户对「我是 AI、我有边界」的诚实反而更信任 |
| 忽略失败对话复盘 | 同类错误反复出现,评测分数却好看 | 只看分数不看失败样本,badcase 不回流 | 每周抽检低分对话,错误模式文档化并回填评测集(CC/CD) |
练习
选一个垂直场景(如「健身教练 AI」),画出用户前 5 分钟的使用流程:设计开场引导与示例问题,标出知识边界与场景边界的拒答话术,再列出 3 个线上场景指标。
来源说明
本文为原创整理,综合参考以下来源:
- Anthropic — Prompt Engineering Overview:系统提示词作为产品配置、提示词迭代方法(对话体验、系统提示词)
- Anthropic — Building Effective Agents:先简单后复杂、工作流优先原则(成本与体验权衡)
- Anthropic — Citations:回答引用来源的结构化机制(信任设计)
- Nielsen, 1994, 10 Usability Heuristics:系统状态可见性、用户控制与自由(冷启动与首次体验、中断与编辑)
- Steve Krug, 2014, Don't Make Me Think:首次体验「不思考就能用」(冷启动与首次体验)
- 站内 AI 产品开发生命周期(CC/CD) 与 评估与评测:评测与迭代口径
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用