AI 搜索
AI 搜索
AI 搜索把搜索结果从链接列表变成带引用的生成式答案:用户输入问题,系统检索多源资料,综合生成一段有依据的答案,并在每个关键论断后标注来源编号。Perplexity 是这一形态的开创者,常被称为「答案引擎(answer engine)」;秘塔 AI 搜索、天工 AI 搜索等同属一类。技术底座是 RAG 的开放网页特化:检索源从私有知识库换成公开网页,答案的引用必须可追溯到具体 URL。
本页从产品经理视角拆解这一形态:先划清它与传统搜索、知识库问答的边界,再拆检索底座、引用机制与检索到生成的管线,接着看商业模式与落地挑战,最后落到选型与评测判断。
与站内相邻页的分工
检索技术的原理细节(切块、召回、rerank)见 检索技术 与 高级 RAG。
私有知识库问答的产品设计见 知识库问答,RAG 从 demo 到生产的工程落地见 RAG 产品化实战。
商业模式的通用框架见 商业化与增长,本页只讲 AI 搜索形态下的特化。
形态定位
AI 搜索的形态本质是把「谁来做综合」从用户转移到系统:传统搜索把原始链接交给用户,用户自己打开网页、对比、判断;AI 搜索替用户完成综合,再让用户做最后一步验证。这一转移同时改变了价值来源与责任归属——答案质量成为产品价值,幻觉与误导成为产品责任。
与传统搜索(Google/百度)的边界
| 维度 | 传统搜索 | AI 搜索 |
|---|---|---|
| 输出 | 链接列表,用户自行综合 | 综合答案 + 引用编号 |
| 用户任务 | 打开多个网页对比判断 | 核对答案与来源 |
| 信息获取成本 | 高,逐页阅读 | 低,直接读答案 |
| 验证成本 | 低,一手来源就在眼前 | 高,要回原文核对 |
| 单次查询边际成本 | 极低,缓存 + 排序 | 高,检索 + LLM 推理 |
| 变现主路径 | 广告竞价 | 订阅 + 广告 + 内容分成 |
输出形态改变的不是「查得快一点」,而是用户每次查询的任务结构。传统搜索用户带走的是一组候选,判断留在用户侧;AI 搜索用户带走的是一个结论,判断部分前移到系统、留一个「核对」动作给用户。谁承担综合,谁就承担综合错误的责任——这是形态差异的第一后果。
与知识库问答的边界
两者同属 RAG 产品,区别在知识域与来源对象:
| 维度 | AI 搜索 | 知识库问答 |
|---|---|---|
| 知识域 | 开放网页,覆盖全网 | 私有知识库,域受限 |
| 来源对象 | URL + 发布方 + 日期 | 内部文档 + 段落 |
| 权限控制 | 无(公开信息) | 检索层权限过滤,安全底线 |
| 更新机制 | 实时抓取 / 索引快照 | 文档变更 → 索引同步流水线 |
| 引用对象 | 可点击的网页链接 | 可追溯到版本的内部文档 |
| 信任机制 | 来源可验证 + 时效可信 | 引用 + 拒答 + 权限 |
知识库问答答错按错误流程办事、信错条款签合同,代价在「私有知识的正确性」;AI 搜索答错把用户导向一个错误事实,代价在「公开信息的可信度」。两者对引用可验证的依赖一致,但 AI 搜索的引用验证面向公开网页,用户自己点开就能核对,知识库问答的引用验证依赖产品把来源映射到文档段落。权限设计是知识库问答的专属复杂度,AI 搜索通常不涉及,见 知识库问答 的权限控制一节。
与通用对话助手的边界
AI 搜索是任务导向的查询工具,不是闲聊助手:用户带着明确的信息缺口来,期望一段带来源的答案,不需要寒暄与开放式创作。差异落在三点:
- 时效性:AI 搜索必须处理「最新」信息,答案要有时间概念;通用助手默认回答训练截止日前的知识,见 RAG 基础 的「模型记忆 vs 检索」。
- 引用义务:AI 搜索每个论断都要有来源,无来源即缺陷;通用助手的闲聊回答不需要引用。
- 查询前置:AI 搜索在回答前先做查询理解与多源检索,用户输入是「问题」不是「指令」;通用助手把输入直接当对话上下文。
检索底座:三档索引架构
AI 搜索的「知识新鲜度」由检索底座决定。按工程形态分三档:联网实时检索、索引快照、受限库内检索。产品取舍的核心是覆盖、时效、成本与可控四者的平衡。
| 档位 | 工程做法 | 时效 | 覆盖 | 成本 | 可控性 |
|---|---|---|---|---|---|
| 联网实时检索 | 查询时调用搜索 API / 爬虫实时抓取 | 分钟级 | 全网,含最新发布 | 高,每次查询都有检索成本 | 低,依赖搜索 API 与源站可用性 |
| 索引快照 | 定期抓取构建自有网页索引,查询时查快照 | 天级 | 已抓取的网页子集 | 中,离线抓取 + 在线查询 | 中,索引质量自己可控 |
| 受限库内检索 | 从授权垂直数据源 / 私有知识库检索 | 随源更新 | 授权内容,窄但权威 | 低,数据由上游提供 | 高,来源与质量可预期 |
联网实时检索
查询时实时获取最新信息,适合新闻、突发、时效敏感问题。工程上是搜索 API(或自建爬虫)+ 结果缓存:同一查询短期重复命中走缓存,大幅降本。产品取舍:
- 覆盖全网但结果不稳定:同一问题两次查询来源可能不同,答案一致性难保证。
- 抓取延迟进入回答链路:实时抓取比查索引慢,首 token 延迟预算要留足。
- 源站封锁是常态风险:高频抓取会被 UA 封禁或限流,需要合规的抓取频率与退避策略。
索引快照
自建或租用网页索引,查询时在快照内检索。工程上需要增量抓取、新鲜度监控与失效处理——与知识库问答的索引运营同构,只是对象换成网页,见 RAG 产品化实战 的索引运营一节。产品取舍:
- 时效折中:快照天级更新,突发新闻查不到,需要「先查快照,未命中再实时补抓」的兜底链路。
- 覆盖可控:索引质量(去重、去垃圾站、可信度标注)由自己维护,答案来源比全开放检索更稳。
受限库内检索
只从授权的垂直数据源(官方数据库、期刊、结构化数据)检索。覆盖窄但权威、可控,适合医疗、法律、金融等对来源有硬要求的垂直 AI 搜索。产品取舍:
- 来源可信度高,引用即权威背书,幻觉风险显著低于开放网页。
- 覆盖依赖上游数据授权,商务成本高、扩展慢;「库内没有」的拒答率会高,需要引导用户换问题。
三档组合是常态
产品不选一档到底:Perplexity 类产品对时效敏感问题走实时检索,对稳定问题命中索引快照,垂直版再叠加库内源。
兜底顺序「快照 → 实时 → 拒答」是常见架构:快照给出稳定答案,实时补新鲜度,都拿不到就明确拒答。
引用与证据:AI 搜索的信任核心
引用机制是 AI 搜索区别于普通 RAG 对话的第一特征。普通 RAG 对话把引用当作加分项,AI 搜索把引用当作产品的定义:没有可验证来源的答案,对 AI 搜索等于没有答案。
引用编号机制
- 论断级引用:每个关键论断后标注编号
[1]、[2],文末列出对应来源,用户点击直达原文。 - 来源列表信息完整:标题、发布方、发布日期、URL 四项齐全;只有 URL 的来源列表无法支撑信任判断。
- 引用来源必须在本次检索集内:生成时强制模型只引用真实进入上下文的来源编号,编造的 URL 是独立缺陷类。
- 悬停预览:鼠标悬停编号展示被引用的原文片段,降低「点开全文找依据」的验证成本——这是 AI 搜索引用体验的关键细节。
编号机制与 RAG 基础页的引用实现一致,技术细节见 RAG 基础 的引用一节。
来源溯源与可验证性
- 用户点开来源能自己核对原文,不依赖系统解释——这是 AI 搜索信任的根基。
- 来源可信度分级:官方 / 权威媒体 / 长尾站点权重不同,答案优先采用高可信来源,冲突时按权威级取舍(知识库问答的同类做法见 知识库问答 的「来源可信度分级」)。
- 时间戳是来源的一部分:同一信息不同时间版本不同,引用要带「信息截至何时」,让用户判断时效。
引用与普通 RAG 对话的差异
| 维度 | 普通 RAG 对话 | AI 搜索 |
|---|---|---|
| 引用对象 | 文档 / 段落 | URL + 发布方 + 日期 |
| 来源域 | 私有知识库,数量可控 | 开放网页,海量且质量参差 |
| 可信度分级 | 文档按来源分级 | 需要站点级可信度模型 |
| 时效要求 | 低,文档版本即真相 | 高,信息随时会过期 |
| 引用验证 | 产品映射到段落 | 用户可直接点开 URL 核对 |
差异的后果:普通 RAG 对话的引用问题靠「块 → 源文档」映射就能解决;AI 搜索的引用问题多一层站点可信度与时效判断,且用户验证成本极低(点一下链接),引用错配会被立刻发现。
检索到生成的管线
一次 AI 搜索回答走五步:查询理解 → 多源检索 → 重排 → 综合生成 → 引用。每一步都有产品决策点,管线图是排查问题的地图。
1 2 3 4 | |
| 环节 | 做什么 | PM 决策点 | 常见失败 |
|---|---|---|---|
| 查询理解 | 改写、补全、拆子问题、意图分类 | 追问澄清还是直接搜;复杂问题是否拆多路 | 改写偏方向 |
| 多源检索 | 网页、新闻、学术、实时抓取多路召回 | 覆盖哪些源;垂直源是否接入 | 来源单一、漏最新 |
| 重排 | 相关性 + 时效 + 权威度综合排序 | 权威度权重;去重与合并同类来源 | 权威被长尾淹没 |
| 综合生成 | 多文档综合成结构化答案 | 答案结构;来源矛盾时怎么呈现 | 多源冲突被硬编 |
| 引用 | 论断打编号 + 文末来源列表 | 引用粒度;来源展示方式 | 张冠李戴 |
查询理解
用户的问题往往简短、含混、带口语,直接拿去检索经常搜不中。产品化的做法是检索前先处理查询:
- 改写与补全:展开缩写、纠错、补全意图,让检索词贴近真实信息缺口(技术取舍见 高级 RAG 的查询处理一节)。
- 复杂问题拆解:一个多跳问题拆成多个子查询分别检索再综合,比单次检索结果更稳。
- 追问 vs 直接搜:意图含糊时反问澄清还是直接给出「最可能答案 + 备选」,是产品决策——反问多一步交互,直接搜省时间但可能答偏。
多源检索
- 来源覆盖范围是产品定位:综合问答覆盖全网,垂直问答覆盖单一领域源(医学文献、法律条文、财报)。
- 多路召回是标配:网页 + 新闻 + 实时抓取分路召回再融合,避免单一路径的盲区。
- 实时抓取兜底新鲜度:索引快照未命中的时效敏感问题,走实时抓取补漏(见上文「三档索引架构」)。
重排
- 排序信号从「相关性」扩展为「相关性 + 时效 + 权威度」:AI 搜索的答案不是给最相关文档,而是给最可信且最新的依据。
- 来源去重:同一信息的多篇转载合并,避免答案被重复来源「投票」带偏。
- 权威度权重是产品决策:官方源优先,长尾源作为补充信息,权重失衡会导致答案偏向「有人这么写」但非主流的说法。
综合生成
- 答案结构由产品定义:要点列表、对比表格、步骤清单,按问题类型路由到不同模板。
- 来源矛盾的处理:不同来源说法冲突时,给出「主流说法 + 分歧点 + 各自来源」,不硬编一个「统一结论」。
- 输出长度控制:综合答案过长会稀释信息密度,按问题类型限长(定义类短答、对比类表格)。
引用
- 引用粒度:论断级引用优于段落级引用,用户能定位到「哪句话来自哪个来源」。
- 引用校验:生成后用程序校验答案里出现的编号都在本次检索来源集合内,越界编号视为引用错误。
- 来源展示:编号 + 文末完整来源列表 + 悬停预览,让验证成本降到最低(见上文「引用与证据」)。
商业模式
AI 搜索的商业模式在订阅、广告、内容分成三条路线上权衡,核心约束是单次搜索的高成本结构与来源生态的维护。
三条路线
| 路线 | 做法 | 价值锚点 | 风险 |
|---|---|---|---|
| 订阅 | 免费层 + Pro/Max/Enterprise 多档 | 时间节省 + 答案质量 + 引用验证 | 免费层成本黑洞 |
| 广告 | 赞助问答、相关问题推荐 | 用户注意力 + 查询场景 | 广告与引用可信度冲突 |
| 内容分成 | 引用内容产生收入时分成交付商(如出版商计划) | 来源生态 + 授权合规 | 分成比例与覆盖范围难定 |
订阅是主流起步路径:用户为「每次搜索省下的时间」付费,档位按用量与能力分层,企业档按席位 + 数据隐私承诺溢价。Perplexity 的免费层(每日限量 Pro 搜索)之上提供多档订阅与独立 API 计费,企业档主打数据不用于训练(以 Perplexity 官方帮助中心 为准,2026-08 引用)。
广告是规模化的必经之路:订阅撑不起免费用户的成本,广告把「查询场景」变成收入。风险是广告内容与引用结果混排,侵蚀「答案中立」的信任;产品要用明确区分(赞助标注、独立区块)守住引用可信度。
内容分成解决来源生态的可持续性:AI 搜索引用媒体内容却拿走流量,源站封锁与授权纠纷随之而来。Perplexity 出版商计划让引用内容的出版商在产生广告收入时获得分成,首批合作方包括 TIME、Fortune、Der Spiegel 等媒体(Perplexity 官方博客,2026-08 引用)。内容分成是「引用 + 广告」模式下的生态补丁,通用商业化框架见 商业化与增长。
成本结构
AI 搜索的单次成本高于传统搜索一个量级:
- 单次搜索成本 = 检索成本 + 重排成本 + LLM 推理成本,LLM 生成长答案是大头。
- 检索成本:实时抓取 / 搜索 API 按次计费;索引快照把成本前移到离线抓取,在线查询边际成本低。
- LLM 推理成本:答案越长越贵;综合生成 + 引用标注需要强模型,输入含多来源上下文,token 消耗大。
- 缓存是降本主杠杆:高频查询命中缓存可跳过检索与生成;免费层常见「每日限量 Pro 搜索」就是在限制不走缓存的深度查询。
成本测算与降本手段的通用方法见 LLM 成本测算。
免费层陷阱
- 每次查询都花钱:传统搜索免费层靠广告覆盖边际成本,AI 搜索免费层每 query 实打实烧推理钱,免费用户量越大亏损越大。
- 免费层限的是「深度查询」:限量 Pro 搜索、限答案长度、限并发,都是把「贵的那部分」留给付费层。
- 免费层是留存杠杆不是成本黑洞:免费体验要足以让用户感知「AI 搜索比传统搜索省时间」,才会转化为订阅;限得太多则免费用户无法建立付费动机。
落地挑战
幻觉与误导
AI 搜索的幻觉比普通 RAG 对话危害更直接:用户把答案当「搜索结果」采信,错了就按错的信息行动。
- 编造来源:模型引用不存在的 URL 或张冠李戴——引用校验(编号必须在检索集内)是第一道防线。
- 来源污染:低质站点、SEO 垃圾内容进入检索结果,答案「忠实」于一个错误来源——站点可信度分级与内容质量过滤是产品责任。
- 误导性内容:刻意传播的错误信息被检索召回,模型可能「忠实」地复述——需要内容安全与立场呈现的护栏,红线框架见 出海与合规。
- 拒答是护栏:多源冲突、权威来源缺失、信息无法验证时,明确拒答或呈现「证据不足」,比硬给答案安全。
时效性维护
- 信息会过期:价格、政策、职位、赛事结果,昨天的正确答案今天就是错的;答案要带「信息截至时间」。
- 索引新鲜度:快照索引天级更新,突发信息靠实时抓取兜底;「快照 → 实时 → 拒答」的兜底顺序决定时效表现。
- 失效处理:源站内容下架、链接失效后,缓存中的答案要继续展示还是降级,是产品决策——展示过期信息会误导,直接下架又损失信息价值。
源站封锁与 robots 合规
- robots.txt 合规:抓取必须遵守源站的 robots 协议,违规抓取既封 IP 又留法律风险;产品要维护「禁止抓取」名单与抓取频率控制。
- 内容墙与付费墙:部分源站只允许引用摘要、不允许抓取全文,产品的答案深度要随之调整。
- 授权与分成:长期依赖引用内容的商业模式,要把内容分成或授权协议纳入成本结构,而不是等源站发起封锁再补救(内容方视角见 出海与合规)。
搜索结果评估
AI 搜索的评估在 RAG 评测体系上增加引用正确率与时效准确率两个专属维度,方法论见 评估与评测。
| 指标 | 衡量什么 | 怎么测 |
|---|---|---|
| 答案相关性 | 是否答所问 | 人工判分或 LLM-as-judge |
| 答案忠实度 | 是否忠于检索来源 | 逐条核对论断能否由引用来源支持 |
| 引用正确率 | 引用的 URL 是否真的支撑论断 | 逐条核对「论断 → 来源」,单独统计「答案对但引用错」 |
| 时效准确率 | 答案是否为最新信息 | 对时效敏感问题核对信息日期 |
| 拒答正确率 | 该拒的拒、不该拒的不拒 | 评测集里应拒答样本的拒答率 + 应回答样本的误拒率 |
| 来源覆盖质量 | 是否依赖单一来源 / 低质来源 | 统计答案来源数量与站点可信度分布 |
评测集构建与 RAG 评测的完整方法见 RAG 基础 的评测集构建一节。
对 AI PM 的启示
自建 vs 套 API vs 聚合
做 AI 搜索(或给产品加 AI 搜索能力)有三条技术路径,选型取决于团队基因与壁垒诉求:
| 路径 | 做法 | 优势 | 劣势 | 适合 |
|---|---|---|---|---|
| 自建 | 自有爬虫 + 索引 + 检索 + 生成全栈 | 索引可控、成本自主、壁垒高 | 重投入,爬虫与索引运营复杂 | 有搜索基础设施的大厂 |
| 套 API | 搜索 API + LLM API 组合 | 上线快、成本可控、聚焦产品 | 检索成本被上游定价、差异化弱 | 创业与功能型产品 |
| 聚合 | 路由到多个 AI 搜索产品 / API | 轻、体验有保障 | 依赖上游、毛利薄、能力受限 | 试水与轻量工具 |
选型判断的三问:
- 检索能力是不是壁垒:答案质量主要由检索决定,检索不是壁垒时套 API 最快,见 LLM API 与供应商。
- 成本是否可持续:单次搜索成本随量线性涨,自建在规模起来后摊薄成本,套 API 的边际成本被上游定价锁定。
- 数据与生态诉求:要做内容分成、要掌控来源生态,就要自建索引并运营来源关系;纯套 API 拿不到这部分控制权。
评测方法
- 引用正确率单独跑:把「答案对但引用错」与「答案错」分开统计,两类缺陷修复路径不同。
- 时效敏感问题专项:评测集里专门放价格、政策、赛事结果类问题,核对答案的信息日期。
- 对抗样本进评测集:多源冲突、低质来源、越界问题都要有样本,防止「答得好」建立在单一来源上。
- 线上信号 + 离线评测互为补充:用户点踩、来源被质疑、拒答反馈回流评测集,形成闭环(完整方法见 评估与评测)。
练习
用任一 AI 搜索产品(Perplexity、秘塔等)连续测试 10 个时效敏感问题(价格、政策、最新事件),记录三类失败:① 信息过期——答案没标注时间;② 引用错配——点开来源对不上论断;③ 来源单一——多篇报道却只引了一篇。
再用同样的 10 个问题对比传统搜索引擎,记录「得到可信答案所需时间」,量化回答型 vs 列表型的体验差异。
常见坑
| 坑 | 症状 | 根因 | 解法 |
|---|---|---|---|
| 编造来源 | 引用 URL 不存在或对不上 | 生成时未强制引用检索集内来源 | 引用编号校验 + 来源集合白名单 |
| 来源污染 | 答案「忠实」于低质/SEO 内容 | 站点可信度分级缺失 | 可信度加权 + 低质源过滤 |
| 时效无标注 | 答案停留在旧版信息 | 无信息时间戳 | 答案带「截至时间」+ 时效敏感问题专项评测 |
| 免费层成本失控 | 免费用户量涨、亏损放大 | 每 query 都烧推理钱 | 限量深度查询 + 缓存 + 分层路由 |
| 源站封锁 | 抓取被 UA 封禁、链接失效 | robots 合规与抓取频率失控 | 合规抓取 + 禁止名单 + 授权协议 |
| 引用与广告混排 | 用户分不清答案与赞助内容 | 广告位侵蚀引用可信度 | 广告独立区块 + 明确赞助标注 |
| 只测答案对错 | 引用错配、时效过期测不出来 | 评测集缺引用与时效维度 | 引用正确率 + 时效准确率单独评测 |
来源说明
本文为原创整理,主要依据以下来源(截至 2026-08 均已核实可达,引用日期 2026-08):
- Perplexity 官方博客:Introducing the Perplexity Publishers Program——出版商计划与内容分成机制
- Perplexity 官方帮助中心:订阅套餐对比——免费层、订阅档位与数据隐私
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(arXiv 2005.11401)——RAG 范式原始论文,AI 搜索的技术底座
- dair-ai Prompt-Engineering-Guide:RAG 综述——负面拒答、鲁棒性评测维度
- Anthropic 官方工程博客:Building Effective Agents——「先找最简单的方案」的工程原则
- RAGAS 官方文档:Metrics——faithfulness、answer relevancy 等端到端指标
- 站内 RAG 基础、知识库问答、商业化与增长 与 评估与评测——RAG 技术与评估口径
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用