跳转至

AI 搜索

AI 搜索

AI 搜索把搜索结果从链接列表变成带引用的生成式答案:用户输入问题,系统检索多源资料,综合生成一段有依据的答案,并在每个关键论断后标注来源编号。Perplexity 是这一形态的开创者,常被称为「答案引擎(answer engine)」;秘塔 AI 搜索、天工 AI 搜索等同属一类。技术底座是 RAG 的开放网页特化:检索源从私有知识库换成公开网页,答案的引用必须可追溯到具体 URL。

本页从产品经理视角拆解这一形态:先划清它与传统搜索、知识库问答的边界,再拆检索底座、引用机制与检索到生成的管线,接着看商业模式与落地挑战,最后落到选型与评测判断。

与站内相邻页的分工

检索技术的原理细节(切块、召回、rerank)见 检索技术高级 RAG

私有知识库问答的产品设计见 知识库问答,RAG 从 demo 到生产的工程落地见 RAG 产品化实战

商业模式的通用框架见 商业化与增长,本页只讲 AI 搜索形态下的特化。

形态定位

AI 搜索的形态本质是把「谁来做综合」从用户转移到系统:传统搜索把原始链接交给用户,用户自己打开网页、对比、判断;AI 搜索替用户完成综合,再让用户做最后一步验证。这一转移同时改变了价值来源与责任归属——答案质量成为产品价值,幻觉与误导成为产品责任。

与传统搜索(Google/百度)的边界

维度传统搜索AI 搜索
输出链接列表,用户自行综合综合答案 + 引用编号
用户任务打开多个网页对比判断核对答案与来源
信息获取成本高,逐页阅读低,直接读答案
验证成本低,一手来源就在眼前高,要回原文核对
单次查询边际成本极低,缓存 + 排序高,检索 + LLM 推理
变现主路径广告竞价订阅 + 广告 + 内容分成

输出形态改变的不是「查得快一点」,而是用户每次查询的任务结构。传统搜索用户带走的是一组候选,判断留在用户侧;AI 搜索用户带走的是一个结论,判断部分前移到系统、留一个「核对」动作给用户。谁承担综合,谁就承担综合错误的责任——这是形态差异的第一后果。

与知识库问答的边界

两者同属 RAG 产品,区别在知识域与来源对象:

维度AI 搜索知识库问答
知识域开放网页,覆盖全网私有知识库,域受限
来源对象URL + 发布方 + 日期内部文档 + 段落
权限控制无(公开信息)检索层权限过滤,安全底线
更新机制实时抓取 / 索引快照文档变更 → 索引同步流水线
引用对象可点击的网页链接可追溯到版本的内部文档
信任机制来源可验证 + 时效可信引用 + 拒答 + 权限

知识库问答答错按错误流程办事、信错条款签合同,代价在「私有知识的正确性」;AI 搜索答错把用户导向一个错误事实,代价在「公开信息的可信度」。两者对引用可验证的依赖一致,但 AI 搜索的引用验证面向公开网页,用户自己点开就能核对,知识库问答的引用验证依赖产品把来源映射到文档段落。权限设计是知识库问答的专属复杂度,AI 搜索通常不涉及,见 知识库问答 的权限控制一节。

与通用对话助手的边界

AI 搜索是任务导向的查询工具,不是闲聊助手:用户带着明确的信息缺口来,期望一段带来源的答案,不需要寒暄与开放式创作。差异落在三点:

  • 时效性:AI 搜索必须处理「最新」信息,答案要有时间概念;通用助手默认回答训练截止日前的知识,见 RAG 基础 的「模型记忆 vs 检索」。
  • 引用义务:AI 搜索每个论断都要有来源,无来源即缺陷;通用助手的闲聊回答不需要引用。
  • 查询前置:AI 搜索在回答前先做查询理解与多源检索,用户输入是「问题」不是「指令」;通用助手把输入直接当对话上下文。

检索底座:三档索引架构

AI 搜索的「知识新鲜度」由检索底座决定。按工程形态分三档:联网实时检索、索引快照、受限库内检索。产品取舍的核心是覆盖、时效、成本与可控四者的平衡。

档位工程做法时效覆盖成本可控性
联网实时检索查询时调用搜索 API / 爬虫实时抓取分钟级全网,含最新发布高,每次查询都有检索成本低,依赖搜索 API 与源站可用性
索引快照定期抓取构建自有网页索引,查询时查快照天级已抓取的网页子集中,离线抓取 + 在线查询中,索引质量自己可控
受限库内检索从授权垂直数据源 / 私有知识库检索随源更新授权内容,窄但权威低,数据由上游提供高,来源与质量可预期

联网实时检索

查询时实时获取最新信息,适合新闻、突发、时效敏感问题。工程上是搜索 API(或自建爬虫)+ 结果缓存:同一查询短期重复命中走缓存,大幅降本。产品取舍:

  • 覆盖全网但结果不稳定:同一问题两次查询来源可能不同,答案一致性难保证。
  • 抓取延迟进入回答链路:实时抓取比查索引慢,首 token 延迟预算要留足。
  • 源站封锁是常态风险:高频抓取会被 UA 封禁或限流,需要合规的抓取频率与退避策略。

索引快照

自建或租用网页索引,查询时在快照内检索。工程上需要增量抓取、新鲜度监控与失效处理——与知识库问答的索引运营同构,只是对象换成网页,见 RAG 产品化实战 的索引运营一节。产品取舍:

  • 时效折中:快照天级更新,突发新闻查不到,需要「先查快照,未命中再实时补抓」的兜底链路。
  • 覆盖可控:索引质量(去重、去垃圾站、可信度标注)由自己维护,答案来源比全开放检索更稳。

受限库内检索

只从授权的垂直数据源(官方数据库、期刊、结构化数据)检索。覆盖窄但权威、可控,适合医疗、法律、金融等对来源有硬要求的垂直 AI 搜索。产品取舍:

  • 来源可信度高,引用即权威背书,幻觉风险显著低于开放网页。
  • 覆盖依赖上游数据授权,商务成本高、扩展慢;「库内没有」的拒答率会高,需要引导用户换问题。
三档组合是常态

产品不选一档到底:Perplexity 类产品对时效敏感问题走实时检索,对稳定问题命中索引快照,垂直版再叠加库内源。

兜底顺序「快照 → 实时 → 拒答」是常见架构:快照给出稳定答案,实时补新鲜度,都拿不到就明确拒答。

引用与证据:AI 搜索的信任核心

引用机制是 AI 搜索区别于普通 RAG 对话的第一特征。普通 RAG 对话把引用当作加分项,AI 搜索把引用当作产品的定义:没有可验证来源的答案,对 AI 搜索等于没有答案。

引用编号机制

  • 论断级引用:每个关键论断后标注编号 [1][2],文末列出对应来源,用户点击直达原文。
  • 来源列表信息完整:标题、发布方、发布日期、URL 四项齐全;只有 URL 的来源列表无法支撑信任判断。
  • 引用来源必须在本次检索集内:生成时强制模型只引用真实进入上下文的来源编号,编造的 URL 是独立缺陷类。
  • 悬停预览:鼠标悬停编号展示被引用的原文片段,降低「点开全文找依据」的验证成本——这是 AI 搜索引用体验的关键细节。

编号机制与 RAG 基础页的引用实现一致,技术细节见 RAG 基础 的引用一节。

来源溯源与可验证性

  • 用户点开来源能自己核对原文,不依赖系统解释——这是 AI 搜索信任的根基。
  • 来源可信度分级:官方 / 权威媒体 / 长尾站点权重不同,答案优先采用高可信来源,冲突时按权威级取舍(知识库问答的同类做法见 知识库问答 的「来源可信度分级」)。
  • 时间戳是来源的一部分:同一信息不同时间版本不同,引用要带「信息截至何时」,让用户判断时效。

引用与普通 RAG 对话的差异

维度普通 RAG 对话AI 搜索
引用对象文档 / 段落URL + 发布方 + 日期
来源域私有知识库,数量可控开放网页,海量且质量参差
可信度分级文档按来源分级需要站点级可信度模型
时效要求低,文档版本即真相高,信息随时会过期
引用验证产品映射到段落用户可直接点开 URL 核对

差异的后果:普通 RAG 对话的引用问题靠「块 → 源文档」映射就能解决;AI 搜索的引用问题多一层站点可信度与时效判断,且用户验证成本极低(点一下链接),引用错配会被立刻发现。

检索到生成的管线

一次 AI 搜索回答走五步:查询理解 → 多源检索 → 重排 → 综合生成 → 引用。每一步都有产品决策点,管线图是排查问题的地图。

1
2
3
4
用户问题 → 查询理解 → 多源检索 → 重排 → 综合生成 → 引用标注 → 答案
                │          │         │        │           │
            改写/拆解    网页/新闻   相关+时效  结构/矛盾    来源列表
            追问/路由    实时抓取    权威度     立场呈现     可点击核对
环节做什么PM 决策点常见失败
查询理解改写、补全、拆子问题、意图分类追问澄清还是直接搜;复杂问题是否拆多路改写偏方向
多源检索网页、新闻、学术、实时抓取多路召回覆盖哪些源;垂直源是否接入来源单一、漏最新
重排相关性 + 时效 + 权威度综合排序权威度权重;去重与合并同类来源权威被长尾淹没
综合生成多文档综合成结构化答案答案结构;来源矛盾时怎么呈现多源冲突被硬编
引用论断打编号 + 文末来源列表引用粒度;来源展示方式张冠李戴

查询理解

用户的问题往往简短、含混、带口语,直接拿去检索经常搜不中。产品化的做法是检索前先处理查询:

  • 改写与补全:展开缩写、纠错、补全意图,让检索词贴近真实信息缺口(技术取舍见 高级 RAG 的查询处理一节)。
  • 复杂问题拆解:一个多跳问题拆成多个子查询分别检索再综合,比单次检索结果更稳。
  • 追问 vs 直接搜:意图含糊时反问澄清还是直接给出「最可能答案 + 备选」,是产品决策——反问多一步交互,直接搜省时间但可能答偏。

多源检索

  • 来源覆盖范围是产品定位:综合问答覆盖全网,垂直问答覆盖单一领域源(医学文献、法律条文、财报)。
  • 多路召回是标配:网页 + 新闻 + 实时抓取分路召回再融合,避免单一路径的盲区。
  • 实时抓取兜底新鲜度:索引快照未命中的时效敏感问题,走实时抓取补漏(见上文「三档索引架构」)。

重排

  • 排序信号从「相关性」扩展为「相关性 + 时效 + 权威度」:AI 搜索的答案不是给最相关文档,而是给最可信且最新的依据。
  • 来源去重:同一信息的多篇转载合并,避免答案被重复来源「投票」带偏。
  • 权威度权重是产品决策:官方源优先,长尾源作为补充信息,权重失衡会导致答案偏向「有人这么写」但非主流的说法。

综合生成

  • 答案结构由产品定义:要点列表、对比表格、步骤清单,按问题类型路由到不同模板。
  • 来源矛盾的处理:不同来源说法冲突时,给出「主流说法 + 分歧点 + 各自来源」,不硬编一个「统一结论」。
  • 输出长度控制:综合答案过长会稀释信息密度,按问题类型限长(定义类短答、对比类表格)。

引用

  • 引用粒度:论断级引用优于段落级引用,用户能定位到「哪句话来自哪个来源」。
  • 引用校验:生成后用程序校验答案里出现的编号都在本次检索来源集合内,越界编号视为引用错误。
  • 来源展示:编号 + 文末完整来源列表 + 悬停预览,让验证成本降到最低(见上文「引用与证据」)。

商业模式

AI 搜索的商业模式在订阅、广告、内容分成三条路线上权衡,核心约束是单次搜索的高成本结构与来源生态的维护。

三条路线

路线做法价值锚点风险
订阅免费层 + Pro/Max/Enterprise 多档时间节省 + 答案质量 + 引用验证免费层成本黑洞
广告赞助问答、相关问题推荐用户注意力 + 查询场景广告与引用可信度冲突
内容分成引用内容产生收入时分成交付商(如出版商计划)来源生态 + 授权合规分成比例与覆盖范围难定

订阅是主流起步路径:用户为「每次搜索省下的时间」付费,档位按用量与能力分层,企业档按席位 + 数据隐私承诺溢价。Perplexity 的免费层(每日限量 Pro 搜索)之上提供多档订阅与独立 API 计费,企业档主打数据不用于训练(以 Perplexity 官方帮助中心 为准,2026-08 引用)。

广告是规模化的必经之路:订阅撑不起免费用户的成本,广告把「查询场景」变成收入。风险是广告内容与引用结果混排,侵蚀「答案中立」的信任;产品要用明确区分(赞助标注、独立区块)守住引用可信度。

内容分成解决来源生态的可持续性:AI 搜索引用媒体内容却拿走流量,源站封锁与授权纠纷随之而来。Perplexity 出版商计划让引用内容的出版商在产生广告收入时获得分成,首批合作方包括 TIME、Fortune、Der Spiegel 等媒体(Perplexity 官方博客,2026-08 引用)。内容分成是「引用 + 广告」模式下的生态补丁,通用商业化框架见 商业化与增长

成本结构

AI 搜索的单次成本高于传统搜索一个量级:

  • 单次搜索成本 = 检索成本 + 重排成本 + LLM 推理成本,LLM 生成长答案是大头。
  • 检索成本:实时抓取 / 搜索 API 按次计费;索引快照把成本前移到离线抓取,在线查询边际成本低。
  • LLM 推理成本:答案越长越贵;综合生成 + 引用标注需要强模型,输入含多来源上下文,token 消耗大。
  • 缓存是降本主杠杆:高频查询命中缓存可跳过检索与生成;免费层常见「每日限量 Pro 搜索」就是在限制不走缓存的深度查询。

成本测算与降本手段的通用方法见 LLM 成本测算

免费层陷阱

  • 每次查询都花钱:传统搜索免费层靠广告覆盖边际成本,AI 搜索免费层每 query 实打实烧推理钱,免费用户量越大亏损越大。
  • 免费层限的是「深度查询」:限量 Pro 搜索、限答案长度、限并发,都是把「贵的那部分」留给付费层。
  • 免费层是留存杠杆不是成本黑洞:免费体验要足以让用户感知「AI 搜索比传统搜索省时间」,才会转化为订阅;限得太多则免费用户无法建立付费动机。

落地挑战

幻觉与误导

AI 搜索的幻觉比普通 RAG 对话危害更直接:用户把答案当「搜索结果」采信,错了就按错的信息行动。

  • 编造来源:模型引用不存在的 URL 或张冠李戴——引用校验(编号必须在检索集内)是第一道防线。
  • 来源污染:低质站点、SEO 垃圾内容进入检索结果,答案「忠实」于一个错误来源——站点可信度分级与内容质量过滤是产品责任。
  • 误导性内容:刻意传播的错误信息被检索召回,模型可能「忠实」地复述——需要内容安全与立场呈现的护栏,红线框架见 出海与合规
  • 拒答是护栏:多源冲突、权威来源缺失、信息无法验证时,明确拒答或呈现「证据不足」,比硬给答案安全。

时效性维护

  • 信息会过期:价格、政策、职位、赛事结果,昨天的正确答案今天就是错的;答案要带「信息截至时间」。
  • 索引新鲜度:快照索引天级更新,突发信息靠实时抓取兜底;「快照 → 实时 → 拒答」的兜底顺序决定时效表现。
  • 失效处理:源站内容下架、链接失效后,缓存中的答案要继续展示还是降级,是产品决策——展示过期信息会误导,直接下架又损失信息价值。

源站封锁与 robots 合规

  • robots.txt 合规:抓取必须遵守源站的 robots 协议,违规抓取既封 IP 又留法律风险;产品要维护「禁止抓取」名单与抓取频率控制。
  • 内容墙与付费墙:部分源站只允许引用摘要、不允许抓取全文,产品的答案深度要随之调整。
  • 授权与分成:长期依赖引用内容的商业模式,要把内容分成或授权协议纳入成本结构,而不是等源站发起封锁再补救(内容方视角见 出海与合规)。

搜索结果评估

AI 搜索的评估在 RAG 评测体系上增加引用正确率时效准确率两个专属维度,方法论见 评估与评测

指标衡量什么怎么测
答案相关性是否答所问人工判分或 LLM-as-judge
答案忠实度是否忠于检索来源逐条核对论断能否由引用来源支持
引用正确率引用的 URL 是否真的支撑论断逐条核对「论断 → 来源」,单独统计「答案对但引用错」
时效准确率答案是否为最新信息对时效敏感问题核对信息日期
拒答正确率该拒的拒、不该拒的不拒评测集里应拒答样本的拒答率 + 应回答样本的误拒率
来源覆盖质量是否依赖单一来源 / 低质来源统计答案来源数量与站点可信度分布

评测集构建与 RAG 评测的完整方法见 RAG 基础 的评测集构建一节。

对 AI PM 的启示

自建 vs 套 API vs 聚合

做 AI 搜索(或给产品加 AI 搜索能力)有三条技术路径,选型取决于团队基因与壁垒诉求:

路径做法优势劣势适合
自建自有爬虫 + 索引 + 检索 + 生成全栈索引可控、成本自主、壁垒高重投入,爬虫与索引运营复杂有搜索基础设施的大厂
套 API搜索 API + LLM API 组合上线快、成本可控、聚焦产品检索成本被上游定价、差异化弱创业与功能型产品
聚合路由到多个 AI 搜索产品 / API轻、体验有保障依赖上游、毛利薄、能力受限试水与轻量工具

选型判断的三问:

  1. 检索能力是不是壁垒:答案质量主要由检索决定,检索不是壁垒时套 API 最快,见 LLM API 与供应商
  2. 成本是否可持续:单次搜索成本随量线性涨,自建在规模起来后摊薄成本,套 API 的边际成本被上游定价锁定。
  3. 数据与生态诉求:要做内容分成、要掌控来源生态,就要自建索引并运营来源关系;纯套 API 拿不到这部分控制权。

评测方法

  • 引用正确率单独跑:把「答案对但引用错」与「答案错」分开统计,两类缺陷修复路径不同。
  • 时效敏感问题专项:评测集里专门放价格、政策、赛事结果类问题,核对答案的信息日期。
  • 对抗样本进评测集:多源冲突、低质来源、越界问题都要有样本,防止「答得好」建立在单一来源上。
  • 线上信号 + 离线评测互为补充:用户点踩、来源被质疑、拒答反馈回流评测集,形成闭环(完整方法见 评估与评测)。
练习

用任一 AI 搜索产品(Perplexity、秘塔等)连续测试 10 个时效敏感问题(价格、政策、最新事件),记录三类失败:① 信息过期——答案没标注时间;② 引用错配——点开来源对不上论断;③ 来源单一——多篇报道却只引了一篇。

再用同样的 10 个问题对比传统搜索引擎,记录「得到可信答案所需时间」,量化回答型 vs 列表型的体验差异。

常见坑

症状根因解法
编造来源引用 URL 不存在或对不上生成时未强制引用检索集内来源引用编号校验 + 来源集合白名单
来源污染答案「忠实」于低质/SEO 内容站点可信度分级缺失可信度加权 + 低质源过滤
时效无标注答案停留在旧版信息无信息时间戳答案带「截至时间」+ 时效敏感问题专项评测
免费层成本失控免费用户量涨、亏损放大每 query 都烧推理钱限量深度查询 + 缓存 + 分层路由
源站封锁抓取被 UA 封禁、链接失效robots 合规与抓取频率失控合规抓取 + 禁止名单 + 授权协议
引用与广告混排用户分不清答案与赞助内容广告位侵蚀引用可信度广告独立区块 + 明确赞助标注
只测答案对错引用错配、时效过期测不出来评测集缺引用与时效维度引用正确率 + 时效准确率单独评测

来源说明

本文为原创整理,主要依据以下来源(截至 2026-08 均已核实可达,引用日期 2026-08):