多模态理解
多模态理解
多模态 AI 指模型能理解或生成多种信息形态:文本、图像、音频、视频。多模态理解(输入侧)是当前落地最成熟的 AI 能力之一:拍照识物、票据 OCR、会议纪要、视频审核等产品早已把看懂做成了稳定的用户体验;而多模态生成(输出侧)则在 2023 年后借助扩散模型与统一架构快速走向商用。梳理多模态理解的能力谱系、模型架构、主流现状、失败模式与评测方法,供 AI 产品经理建立多模态产品的技术直觉。生成类能力(图像/视频/语音)见 图像生成、视频生成、语音与音频。
读本文之前
本文假设读者已经了解大模型的基本概念(什么是 token、什么是 Transformer)。如果还没有,先读 大模型基础 与 Transformer 架构。
重心是「每种能力成熟到什么程度、会在哪里失败、产品上怎么用」,不是原理推导。
多模态理解的能力谱系
多模态理解不是一个单一能力,而是一组成熟度差异很大的子能力。把能力拆开看,才能知道哪些可以直接商用、哪些必须人审兜底:
| 模态 | 能力 | 成熟度 | 典型产品场景 |
|---|---|---|---|
| 图像 | 物体识别、场景分类、通用描述 | 高 | 拍照识物、商品搜索、相册分类 |
| 图像 | OCR(印刷体) | 高 | 票据识别、名片扫描、截图转文档 |
| 图像 | OCR(手写体、复杂版面) | 中 | 手写病历、表格还原、公式识别 |
| 图像 | 图表理解(表格/折线/柱状) | 中高 | 财报分析、科研论文问答、数据看板 |
| 文档 | PDF/扫描件/长文档理解 | 高 | 合同审核、资料总结、合规审查 |
| 视频 | 内容理解、摘要、审核初筛 | 中 | 短视频审核、教程总结、广告素材审查 |
| 视频 | 逐帧检测(违禁、缺陷、轨迹) | 中高 | 直播审核、质检流水线 |
| 视频 | 时序事件定位 | 中低 | 安防回查、体育事件切点、行为识别 |
| 音频 | 语音识别(ASR) | 高 | 会议纪要、字幕生成、语音搜索 |
| 音频 | 声纹识别、说话人分离 | 中 | 电话质检、多说话人会议记录 |
| 音频 | 情感与语气理解 | 中低 | 客服情绪预警、语音质检 |
图像:识别、描述、OCR、图表
- 识别与描述:识别常见物体、场景、人物动作并生成自然语言描述,是成熟度最高的能力,商拍图、社交图、监控画面都能处理;但细粒度识别(具体车型、植物品种、稀有鸟类)需要专门数据或检索兜底,不能只靠通用模型。
- OCR:印刷体已是可靠基础设施,票据、证件、名片、截图都有稳定方案;手写体、艺术字体、印章叠加、表格还原则明显掉点:翻拍的皱褶小票、扫描件上的水印、彩色底纹都会干扰识别,这类场景要设计置信度 + 人审。
- 图表理解:折线图趋势、柱状图对比、表格抽取是近年进步最快的方向之一,财报问答、论文图表解析已可用;但图表 + 上下文数值推导的多步推理仍会出错,金融场景需核对原始数字。
- 截图与 UI 理解:网页/App 截图的理解(找按钮、读弹窗、分析布局)是 Agent 产品与测试场景的高频需求,对界面元素的指代能力要求高,旗舰模型的进步明显,但不同产品截图风格差异大,建议自建 UI 用例集。
文档:PDF、表格、扫描件
长文档理解(几十上百页 PDF)的关键是找到关键页并跨页组织答案。模型本身能读,但检索哪几页、如何拼接证据往往决定成败:这与 RAG 基础 的思路同源,先定位再回答,而不是把整份文档硬塞进上下文。表格还原(保留行列结构)与扫描件版式重建是高频刚需,排版越复杂越需要专用文档解析管线,而非通用视觉模型。评估长文档能力时注意三类样本:跨页引用(答案散在多页)、密集表格(行列对齐)、扫描质量退化(歪斜、噪点)。
视频:内容理解、逐帧检测、时序事件
把视频理解拆成成熟度不同的子能力,不要用一张「视频」标签立项。
- 内容理解与摘要:抽帧 + 视觉语言模型,概括视频讲了什么、给短视频做标签与审核初筛。
- 逐帧检测与审核:逐帧检测违禁内容、产品缺陷、运动轨迹,成熟度较高,是审核与质检的标配;代价是计算量大,按需抽帧(每秒 1 帧还是 30 帧差一个数量级)。长尾违禁形态用规则库 + 模型 + 人工三层兜底。
- 时序事件定位:第几秒发生了什么需要跨帧推理与时间轴建模,成熟度明显低于静态理解与逐帧检测,安防、体育切点类产品要留人工复核。落地时先做有/无事件二分类,再做时间定位。
- 多模态融合理解:画面 + 字幕 + 音频一起理解(如短视频的画面配文是否违规)是视频审核的进阶形态。
长视频不要整段硬塞上下文。工程上按语义切段,每段抽代表帧,再做跨段检索或记忆压缩。预算敏感(会议纪要、课程总结)用音频转写 + 关键帧两段式;视觉细节重要(体育、安防)才为逐帧付费。
| 策略 | 做法 | 适用场景 | 代价 |
|---|---|---|---|
| 均匀抽帧 | 每秒取 1-2 帧 | 粗粒度摘要、审核初筛 | 漏掉瞬间动作 |
| 关键帧筛选 | 按场景切变取代表帧 | 事件定位、摘要 | 依赖切变质量 |
| 分段 + 记忆压缩 | 分段编码 + 记忆 token 递归 | 长视频问答 | 实现复杂 |
| 两段式 | 音频转写 + 帧摘要再喂模型 | 会议、教程类 | 丢失视觉细节 |
| 检索式 | 建帧索引,问答时只取相关段 | 素材库检索问答 | 需检索基建 |
视频生成、编辑与数字人见 视频生成。论文导读见 多模态前沿论文。
音频:ASR、翻译、声纹
- ASR:成熟度最高的音频能力,会议纪要、字幕、语音搜索均可直接商用;多语言混说、方言、专业术语是主要掉点。技术细节见 语音与音频。
- 翻译:语音到文本再翻译是成熟链路。Whisper 原生多语言转写;其
translate任务是语音译成英文,不是任意语对。跨语同传走 ASR + 机器翻译(必要时再加 TTS)。 - 声纹与说话人分离:区分谁在说话可用于会议记录分段与电话质检;多人重叠说话、远场录音下会退化,需要专用模型与数据。
- 环境音与音乐理解:听懂这是狗叫/警报/钢琴属于音频分类与检索(CLAP 类模型),用于安防告警、音乐版权识别,是与语音识别不同的另一条线。
规律一:静态信息理解成熟、动态与时序理解偏弱。单张图的识别/OCR 已接近商用极限,而视频的跨帧推理(谁先推了谁、事件发生在第几秒)仍容易出错。规律二:印刷体/标准场景成熟、退化场景脆弱:同样的 OCR,白底黑字近乎满分,翻拍的皱褶小票就明显掉点。产品设计时应先锚定自己场景的真实数据分布,而不是看榜单数字。
跨模态检索:以图搜图、拍照搜商品
多模态理解还有一个不显眼但最先产业化的分支:跨模态检索:用一种模态做查询,从另一种模态的库里找结果。以图搜商品(拍照比价)、以文搜图(用描述找历史素材)、以文搜视频(安防里用文字定位监控片段)都是成熟落地形态。技术基础是 CLIP 这类双编码器对齐出的共享嵌入空间:图与文分别编码成向量,相似度排序即检索结果;更复杂的检索(视频、音频)在此基础上扩展。
跨模态检索的架构重点不是让一个模型同时处理所有输入,而是让不同编码器产出可比较的向量:
flowchart LR
image_query["图像查询"] --> image_encoder["图像编码器"]
text_query["文本查询"] --> text_encoder["文本编码器"]
image_encoder --> space["共享嵌入空间"]
text_encoder --> space
catalog["商品 / 素材向量库"] --> search["相似度检索与排序"]
space --> search
search --> results["结果列表"]核心关系:查询与库内内容被编码到同一向量空间,系统再按相似度检索排序;检索类多模态产品因此比开放式问答更容易定义验收标准。
产品启示:检索类能力比问答类更早成熟、更好验收(结果可排序、可人工抽查),是多模态能力从哪个场景切入的稳妥起点;检索与问答结合(先检索再让模型基于结果回答)正是多模态版 RAG 基础 的形态:音频检索(用文字搜语音片段)是值得关注的新方向。
生成类能力(输出)
| 模态 | 代表产品/模型 | 关键点 |
|---|---|---|
| 文生图 | 即梦、Midjourney、FLUX、SD 系 | 版权风险、可控性(风格/布局)见 图像生成 |
| 文生视频 | 可灵、Sora、Runway、即梦 | 成本高、时长短、一致性弱,见 视频生成 |
| 语音合成(TTS) | GPT-4o 语音、各类 TTS API | 音色授权、情绪表达,见 语音与音频 |
| 音乐生成 | Suno、Udio 等 | 版权是最大风险,见 语音与音频 |
生成类能力整体成熟度低于理解类:图像生成已可商用(但可控性仍是痛点),视频生成处于可演示、难交付阶段,音乐生成则卡在版权而非技术。理解类产品与生成类产品的设计重心完全不同:理解类拼的是别错,生成类拼的是别翻车 + 可控,详见各分册。
三类核心任务的划分
把多模态任务按输入/输出形态归类,有助于产品立项时对齐预期:
| 任务类别 | 输入 → 输出 | 典型任务 | 成熟度 |
|---|---|---|---|
| 跨模态检索 | 一模态 → 另一模态的结果列表 | 以图搜商品、以文搜图、以文搜视频 | 高(图文)/中(视频) |
| 多模态理解与推理 | 多模态 → 文本/结构化结论 | VQA、图文审核、文档问答、图表分析 | 高(单图)/中(视频) |
| 跨模态生成 | 一模态 → 另一模态内容 | 文生图、文生视频、TTS | 中高(图)/中低(视频) |
| 跨模态对齐与转换 | 模态间语义对齐/风格转换 | 风格迁移、音画同步(口型)、语音驱动数字人 | 中高 |
同一个产品往往同时用到多类任务(拍照 → 检索相似款 → 生成换装图),但立项时应按主任务选能力基线,避免把什么都沾一点当成多模态都擅长。
多模态模型是怎么做的
从拼接式到原生多模态
理解模型为什么有时聪明、有时犯傻,关键是看清架构演进的两条路线:
- 拼接式(模块化):用现成的视觉编码器(如 ViT)把图像切成 patch 编码成向量,再用一个映射器把视觉向量映射进 LLM 的词嵌入空间,让 LLM 在文本 token 流里读图像。代表:LLaVA、BLIP-2、Qwen-VL 早期版本、Intern-VL 系。这条路线复用成熟组件、训练成本低,是 2022-2024 年开源视觉语言模型的主流。
- 原生多模态(统一 token 空间):从预训练起就把文本、图像、音频统一成 token 序列,让同一个 Transformer 直接吃所有模态。代表:GPT-4o、Gemini、Claude 视觉能力(具体实现以官方披露为准)、Qwen-VL 后期、GLM-V。这条路线模态交互更充分、端到端延迟更低,但训练数据与算力门槛极高。
三段式直觉:编码器 → 映射器 → LLM 主干
无论哪条路线,理解类模型都可以抽象成三段:
flowchart LR
input["图像 / 音频 / 视频 / 文档"] --> encoder["模态编码器:信号 → 向量序列"]
encoder --> connector["映射器:对齐到语义空间"]
connector --> backbone["LLM 主干:理解 / 推理 / 生成"]
backbone --> answer["文本或结构化结论"]核心关系:编码器负责感知,映射器负责跨模态对齐,LLM 主干负责语义推理与输出,三段共同决定多模态产品的上限。
两条架构路线的差异,集中在「模态向量何时进入统一主干」:
flowchart TB
subgraph modular["拼接式:模块化路线"]
m_input["图像 / 音频"] --> m_encoder["专用编码器"]
m_encoder --> m_connector["映射器"]
m_text["文本 token"] --> m_llm["LLM 主干"]
m_connector --> m_llm
m_llm --> m_output["文本回答"]
end
subgraph native["原生多模态:统一路线"]
n_input["文本 + 图像 + 音频"] --> n_tokenize["统一 token 化"]
n_tokenize --> n_transformer["统一 Transformer"]
n_transformer --> n_output["理解 / 推理 / 生成"]
end核心关系:拼接式路线复用专用编码器、训练门槛较低,原生路线从输入开始统一 token 化、模态交互更充分;两者都要用真实场景评测感知与推理质量。
- 模态编码器:把原始信号变成向量序列。图像用 ViT(切成 16×16 的 patch 逐个编码);音频先转成梅尔频谱图再编码(类似一张二维图),或直接用 Whisper 这类专用编码器;视频则是抽帧后逐帧走图像编码器再拼时间信息。编码器只负责把信号翻译成向量,不负责理解语义。
- 映射器(连接器):把非文本向量对齐到 LLM 的语义空间。最简单的线性投影(LLaVA 早期只用一层);进阶如 BLIP-2 的 Q-Former:用一组可学习的 query token 通过交叉注意力蒸馏出对 LLM 最有用的视觉信息,相当于一个信息瓶颈,只把关键内容喂给 LLM。
- LLM 主干:负责语义理解、推理与生成,是模型聪明的来源。多模态模型相当于在 LLM 外面长出了眼睛和耳朵;主干的推理能力直接决定多模态问答的上限:看到是一回事,看懂并答对是另一回事。
对齐是怎么学出来的
- 对比学习(CLIP 范式):拿海量图文对训练双编码器,让匹配的图文向量在嵌入空间里靠近、不匹配的远离。CLIP 用约 4 亿图文对训出的对齐空间,既支持零样本图文检索(不需要标注即可按语义搜图),其视觉编码器也成了后续无数模型的初始化权重。
- 图文匹配 + 掩码重建:BLIP 等模型额外训练这张图和这句话匹配吗的二分类,以及遮住图像 patch 让模型预测被遮内容,学更细粒度的对应关系;BLIP 的 CapFilt 机制还用于给海量图文对自动生成更高质量的描述,提升训练数据质量。
- 指令微调对齐:LLaVA 用视觉指令数据(图 + 问题 + 答案)微调,让模型学会看着图回答问题,这一步把感知能力和语言能力真正接起来,也是多模态对话能力的来源。
演进时间线:从 CLIP 到原生多模态
| 阶段 | 代表工作 | 关键贡献 |
|---|---|---|
| 2021 | CLIP | 对比学习对齐图文空间,零样本图文检索,视觉编码器成为标准零件 |
| 2022 | BLIP / BLIP-2 | 统一理解与生成;Q-Former 用可学习 query 从图像里蒸馏关键信息,信息瓶颈思想 |
| 2023 | LLaVA | 线性投影 + 视觉指令微调,证明冻结视觉编码器 + 微调 LLM 就能做多模态对话 |
| 2023 | GPT-4V | 闭源旗舰把多模态视觉对话做成产品级,推理能力决定多模态上限 |
| 2024-2026 | GPT-4o、Gemini、Claude、Qwen-VL 后期 | 原生多模态 + 音频/视频输入 + 超长上下文,统一 token 成为主流方向 |
这条时间线的产品含义:架构代际更替很快,但编码器感知 + 主干推理的分工至今成立:视觉感知不足的模型,靠更强的推理也补不回来;反过来,推理弱的小模型,感知再强也答不好复杂问题。
训练视角:预训练与微调、冻结与解冻
- 预训练管对齐,微调管任务:预训练用大规模弱标注图文对(如 LAION-5B 约 58 亿对)把不同模态拉进同一语义空间,成本极高(千亿参数模型单次预训练可达数百万美元量级);微调用垂直数据(医疗影像、票据、质检图)把通用模型适配到具体任务,成本低一两个数量级,常配合 LoRA 等参数高效微调(只更新不到 1% 的参数)。
- 视觉编码器冻结还是微调:数据分布接近通用场景(自然图像)时冻结编码器即可,省算力且避免遗忘;垂直领域(医学影像、遥感、工业质检)与细粒度任务(OCR、小目标检测)需要解冻编码器联合微调,否则特征对不上任务。折中方案是部分解冻(只微调编码器最后几层)或对编码器加 LoRA。
- 高分辨率输入的处理:ViT 的注意力复杂度随 patch 数量平方增长,4K 图直接编码会爆显存。工程上常用动态分块(把大图切成 448×448 子图分别编码再拼接)、多尺度编码(低清抓全局、高清抓细节)、token 压缩(池化/Q-Former 式抽取)等手段,这些策略直接决定小字看得清不清:OCR 与文档场景选型时,高分辨率支持比榜单分数更值得看。
- 多模态训练的数据配比:纯文本数据不能丢:多模态训练中混入一定比例纯文本语料,防止语言能力退化(灾难性遗忘);混合图文交错数据(图在文中)则让模型学会跨模态引用。
为什么 2024-2025 后旗舰普遍原生多模态
- 端到端低延迟:拼接式要过视觉编码器 → 映射器 → LLM 多段管线,实时语音对话(如 GPT-4o 语音模式)需要更短的感知到响应的链路,统一 token 空间天然更顺。
- 交错输入与多模态推理:原生模型能自然处理文本 + 图 + 表格混排的复杂输入,并在推理中自由引用不同模态的信息。
- Scaling Law 更顺:统一 token 后,同一个 Transformer 的规模、数据、算力可以直接堆,不再受编码器与 LLM 各自为政的接口瓶颈限制。
- 对产品经理的含义:原生多模态是方向,但拼接式开源模型(如 Qwen-VL、Intern-VL)在垂直场景经微调后依然能打,选型不必唯架构论,以实测为准。
主流多模态模型现状
以下为 2026-08 现状概览,模型与价格变动频繁,一切以各厂商官方页面为准:
| 厂商 | 代表模型 | 能力定位 | 价格量级(以官方页面为准) |
|---|---|---|---|
| OpenAI | GPT-5.6 系(主线);GPT-4o 为 omni 先例 | 旗舰视觉推理;4o 把语音+图像+实时对话收进同一模型 | 与文本同价按 token 计,图像按分辨率折成 token |
| Anthropic | Claude 5(Fable/Opus/Sonnet)+ Haiku 4.5 | 全系支持图像输入;Haiku 4.5 为 200K 上下文,其余多为 1M | 图像按 token 计,量级与文本一致 |
| Gemini 3.x | 原生多模态,超长上下文(视频/音频小时级输入) | Flash 档低价,Pro 档中高价 | |
| 开源 | Qwen-VL / Qwen3-VL | Apache 2.0,可本地部署,中文场景强 | 权重免费,自付推理成本 |
| 开源 | Intern-VL | 高分辨率文档/细粒度视觉,开源可商用 | 权重免费 |
| 开源 | GLM-V 系 | 智谱开源视觉语言模型,工具调用强 | 权重免费(许可证以官方为准) |
- GPT-5.6 主线 / GPT-4o 先例:GPT-5.6 家族是 2026-08-23 快照里的文本与视觉推理主线;GPT-4o(omni)仍是「语音+图像+实时对话收进同一模型」的公开先例,系统卡强调端到端语音,不是当前选型表上的默认档。o 系列(o1/o3)是推理专用线,不是多模态 omni。多模态输入按 token 计费,图像大小决定 token 数(GPT-4o 系统卡)。现行档位与价格见 模型能力与边界 的 2026-08-23 快照。
- Claude 视觉:Claude 5 家族(Fable/Opus/Sonnet)与 Haiku 4.5 均支持文本与图像输入;Haiku 4.5 上下文为 200K,其余多为 1M。官方文档给出图像分块、尺寸与 token 换算建议;视觉能力定位是文档、截图、界面与图表理解,适合企业知识场景(Claude 视觉文档)。
- Gemini:原生多模态 + 百万级上下文,可直接输入视频与长音频做检索式理解;Flash 档价格显著低于 Pro 档,适合大量调用(Gemini 多模态文档)。
- 开源三强:Qwen-VL(阿里,Apache 2.0)、Intern-VL(上海 AI Lab,细粒度视觉)、GLM-V(智谱)均可本地部署,中文场景与文档理解表现接近商用闭源,是私有化部署的主力选择(以各官方仓库为准)。
文本-图像统一模型的趋势:2025-2026 年起,旗舰模型逐渐把理解 + 生成收进同一套参数(如统一多模态模型内部用扩散或自回归做图像输出),对产品经理的意义是一套 API 同时搞定看懂和画图,成本与延迟的权衡方式也会变化。选型时把视觉输入质量、多模态推理、价格延迟三个维度放进自己的评测集实测,而不是看厂商发布会。
按任务形态的模型选型对照
| 任务形态 | 推荐起点 | 理由 |
|---|---|---|
| 单图问答、通用描述 | 旗舰快模型或开源 7B-32B 档 | 性价比高,差距集中在刁钻用例 |
| 细粒度文档/OCR | 高分辨率视觉模型(Intern-VL 类)或专用解析管线 | 分辨率与版面还原能力优先 |
| 长视频/长音频理解 | 原生多模态 + 长上下文(如 Gemini 类) | 直接输入 vs 抽帧的取舍看成本 |
| 实时语音对话 | 端到端语音模型或级联管线 | 延迟预算主导,见 语音与音频 |
| 私有化/敏感数据 | 开源视觉语言模型本地部署 | 数据不出域,能力经微调可接近闭源 |
选型要点速查
- 只做 OCR/票据/文档:不必上旗舰视觉模型:专用文档解析管线(版面分析 + OCR + 表格还原)更便宜更准,通用多模态模型做兜底与校验。
- 做通用图文问答/审核:旗舰或开源视觉语言模型均可,中文场景优先测中文图文对;成本敏感就测 Flash/快模型档位。
- 做视频/音频长输入理解:优先看原生多模态 + 长上下文(Gemini 类),抽帧与分段策略直接影响成本与效果。
- 数据敏感/私有化:开源三强(Qwen-VL、Intern-VL、GLM-V)本地部署,配合 模型能力与边界 的「多模型路由与混合部署」。
- 实时语音交互:端到端语音模型或级联管线,延迟预算见 语音与音频。
多模态检索:从理解到搜索
检索是多模态理解最先跑通商业闭环的形态,值得单独说:
- 以图搜图 / 拍照搜商品:电商标配:用户拍一张图,系统用视觉编码器提取特征,在商品库向量检索出同款/相似款;工程关键是特征怎么提(颜色纹理特征 vs 语义特征)与库怎么排(相似度 + 业务排序)。
- 以文搜图 / 以文搜视频:用自然语言检索素材库,内容平台与素材平台的刚需;视频检索要先做镜头切分 + 代表帧索引,把视频转成可检索的图集合。
- 多模态组合检索:文本 + 图一起作为查询(和这张图风格类似但不要红色),依赖统一嵌入空间的组合能力,成熟度在提升。
- 评价指标:Recall@K(前 K 个结果里命中的比例)、MRR(首个正确结果的排名):产品上线前用人工标注的查询集测,别只看演示效果。
典型行业应用
- 内容审核:图文、短视频、直播的多模态审核是理解类最刚需的场景:画面(违禁物、暴力、色情)+ 文字(违禁词、广告导流)+ 音频(辱骂、敏感词)三路并行,模型初筛 + 规则命中 + 人工复核的分层架构是标配;模型负责召回,规则与人工负责精判。
- 文档解析:合同、票据、财报的版面分析 + OCR + 结构化抽取,把 PDF 变成可检索的数据库,是 RAG 的输入侧;复杂版面(表格嵌套、印章、手写批注)是难点,常见方案是通用多模态模型 + 专用解析引擎双通道。
- 工业质检:拍照检测产品缺陷(划痕、缺件、装配错误),视觉理解 + 规则过滤 + 人工复判;行业特点是误报成本高(把良品当次品也是损失),要按漏检率/误报率双指标验收。
- 自动驾驶与具身:多模态感知(图像/雷达/音频)融合理解是自动驾驶与机器人的基础,属于高可靠场景,与通用多模态模型的能力边界差异大,不在本文展开。
行业 × 能力速查表
| 行业 | 主任务 | 关键能力 | 常见兜底设计 |
|---|---|---|---|
| 金融 | 票据/合同理解、财报问答 | 高精度 OCR、表格还原 | 金额字段双重校验、人审 |
| 医疗 | 影像辅助判断、病历结构化 | 垂直微调、高分辨率 | 医生终审、不作为诊断依据 |
| 内容平台 | 图文/视频审核、素材检索 | 多路理解、向量检索 | 规则命中 + 人工复核 |
| 电商 | 拍照搜商品、商品图生成 | 检索 + 生成 + 一致性 | 相似度过滤、人工选品 |
| 安防 | 视频事件定位、轨迹分析 | 时序理解、逐帧检测 | 事件复核、告警分级 |
| 教育 | 拍照搜题、讲义解析 | 公式/图表理解 | 答案溯源、防作弊策略 |
练习
挑一个你熟悉的场景(如拍照识别发票并自动录入报销系统),画出:输入形态 → 模型能力拆解(OCR/结构化/金额校验各自用什么)→ 失败模式清单 → 人审兜底策略,并估算单张成本。
能力边界与失败模式
多模态模型的失败有规律可循,产品设计前先背熟这几类:
- 计数失败:问图里有几个苹果,模型常常数错,尤其是小物体、重叠物体。计数类需求要设计约束输出或人工复核。
- 空间关系错乱:「猫在桌子下面还是上面?」「左边的人还是右边的人?」:位置关系判断不稳定,涉及空间推理的问答要谨慎。
- 小字与退化 OCR:低分辨率、模糊、反光、艺术字体的文字识别明显掉点;密集表格的单元格对齐也容易错位。
- 幻觉细节:模型会脑补图中不存在的内容:给一张没有时钟的照片描述「墙上的钟显示三点」,或把人物手中的物体说成另一个东西。多模态幻觉通常分三类:类别幻觉(描述出图中没有的物体)、属性幻觉(物体存在但颜色/大小/材质说错)、关系幻觉(位置/动作关系说错)。来源包括训练数据的统计偏差(常见物体更可能被猜出来)、视觉编码器感知不足、以及 LLM 语言先验过强:模型用常识补全了它没看清的部分。
- 图像推理的陷阱:需要多步视觉推理(读图表后计算、对比两幅图差异)时,模型可能跳过真正的视觉证据、直接套用语言先验作答;示意图与真实照片混在一起时更容易翻车。
- 指代与局部理解:第二张图左上角那个按钮这类带坐标/区域的指代,模型可能答非所问:对 UI 截图、多图对比场景要专门测。
- 长文档的中间丢失:几十上百页的 PDF,模型容易记住开头结尾、漏掉中间页,跨页引用也会串页:需要检索定位 + 分页引用机制兜底(见 RAG 基础)。
- 什么时候必须人审兜底:涉及钱(票据金额、合同条款)、安全(审核放行)、法律(证据认定)、医疗(影像判断)的场景,一律人审兜底;生成内容对外发布前也要过审。
不要用 prompt 硬扛能力短板
同一张图反复改 prompt 仍识别错时,多半是模型视觉能力的边界,而不是提示词的问题。此时优先换更强模型、提高输入分辨率、换专用 OCR/文档解析管线,而不是继续调 prompt。
缓解幻觉的工程手段:输入侧(提高分辨率、增强视觉编码器、多视图验证)、训练侧(反事实负样本、对比学习)、推理侧(对比解码:同时跑原始图与扰动图,不一致时抑制语言先验;或让模型先描述再问答,把感知和推理拆开)。产品侧最实用的是结构约束:要求模型输出引用图像区域、给看不清出口、低置信强制转人工。
失败模式的验收清单
产品验收时按下面的清单逐项测,比跑几个随机问题看效果可靠得多:
| 失败类型 | 怎么测 | 验收底线 |
|---|---|---|
| 计数 | 3-20 个同类物体的图,问数量 | 小物体(≤5 像素)场景允许误差,关键计数必须全对 |
| 空间关系 | 左/右/上/下/前/后问答各 10 例 | 对称场景(两人并肩)可放宽,方向性指令必须对 |
| 小字 OCR | 手机拍屏幕、低清截图 | 印刷体错字率按业务容忍度定,金额/编号零容忍 |
| 幻觉 | 空场景图(纯色墙)问有什么 | 必须回答没有检测到物体,不得编造 |
| 多步推理 | 图表 + 数值计算题 | 计算过程可复核,答案错误可容忍但必须给引用 |
多模态评测
- MMMU:大学级别多学科多模态理解基准(艺术、科学、人文等 6 大学科),考察跨学科知识与视觉推理(论文)。
- MMBench:多模态理解综合基准,覆盖感知、推理、关系、属性等能力维度,细分 20 余个子任务。
- MM-Vet:考察视觉理解与语言能力的组合运用(识别 + 知识 + 推理),更接近真实用户提问形态。
- MME:感知与认知两大赛道、14 个子任务(存在性、计数、位置、颜色、OCR 等),常用作细粒度能力体检。
- 幻觉专项:POPE(把对象存在性幻觉做成是/否问答)、CHAIR(评估图像描述里有多少物体是图里没有的),选模型时值得单独跑。
评测多模态产品的实操建议
- 从真实用户请求里收集 50-100 条图 + 问题样本,覆盖常规、退化(模糊/反光/低清)与刁钻(计数/空间/小字)三类。
- 定义自己的通过标准:答案正确、引用图像证据、不乱编细节,分开打标。
- 同一用例集跑 2-3 个候选模型/分辨率档位,记录错误类型分布(幻觉、漏答、错位),不要只看总准确率。
- 上线后定期回归:模型更新会改变视觉行为,评测集要常跑常新;方法与 评估与评测 一致。
读榜单的注意点
- 榜单饱和:主流基准(MMMU、MMBench 等)上旗舰模型差距已很小(个位数百分点),高 2 分不等于你的场景好 2 分;基准的区分度集中在难样本,而难样本往往不是你的用户样本。
- 输入策略影响结果:同一模型,图传 512 与传 2K、单图与多图拼接,分数可以差很多:复现榜单要连输入分辨率、分块策略一起复现。
- 幻觉类指标单独看:总准确率高可能掩盖幻觉问题;幻觉在开放式描述任务里最严重,在是/否任务里较轻,评测任务形态要对齐你的产品形态。
- 检索类指标单独看:问答准 ≠ 检索准,检索产品要单测 Recall@K/MRR,别拿问答榜推断检索能力。
产品设计要点
- 输入侧优先:理解类能力成熟度远高于生成类,多数产品先做看懂再考虑生成;看懂本身就能撑起票据、审核、纪要、搜索等一批产品。
- 组合场景:多模态的最优用法是组合:拍照 → 识别 → 总结 → 生成报告,把感知 + 推理 + 生成串成工作流,而不是让单次调用包办一切。典型组合:
- 报销:拍照(OCR 识别票据)→ 抽取结构化字段(金额/日期/类目)→ 规则校验(发票真伪、重复报销)→ 生成报销单。
- 会议:录音(ASR 转写)→ 说话人分离 → 摘要与待办抽取 → 生成纪要与跟进任务。
- 电商:拍照(识别商品)→ 检索同款 → 比价/关联推荐 → 生成换装或场景图。
- 审核:画面 + 字幕 + 音频三路理解 → 规则命中 → 人工复核队列。
- 成本差异:图像/视频 token 成本远高于文本,且随分辨率上升;长视频、多帧输入尤其要算账。控制手段:压缩输入(裁剪、降采样、只传关键帧)、限制输出长度、用量分级(免费档低清、付费档高清)。
- 合规重点:人脸(肖像权、人脸识别的合规边界)、声音(音色授权)、版权素材(训练数据与生成物权属)是三条红线;涉及个人信息与敏感场景还要过数据安全评估,详见 合规与安全。
- 延迟预算:视觉输入的首 token 延迟与 token 数正相关,实时场景(拍照问答、语音助手)要实测,必要时用低清输入 + 预取常用上下文;语音助手类产品参考 语音与音频 的延迟预算。
- 降级设计:模态缺失(用户传了模糊图、传错格式、图被截断)是常态,产品要设计识别不了就明说 + 引导重传,而不是硬答;多模态产品的体验差距往往在退化输入上拉开。
- 数据闭环:把用户上传的图 + 纠错反馈沉淀成评测集与微调数据:多模态产品的竞争力会越来越依赖场景数据资产,越早开始积累越有利。
- 安全护栏:输入图与输出文本都要过内容安全(违禁、隐私);看图说话可能把敏感信息带出来(证件照、聊天截图),产品要设计脱敏与权限控制。
常见坑
- 扫描件 OCR 质量参差,合同类产品要设计人审兜底与置信度拒绝:低置信直接转人工,而不是硬给结果。
- 文生图难以精确控制细节(手指、文字、长文本),文案类物料要人工终审,见 图像生成。
- 视频生成时长受限且不连贯,慎用于商业场景,见 视频生成。
- 多模态模型的失败往往不报错:它不会说我看不清,而是自信地编一个答案。置信度信号不可信,要用输出结构(要求引用图像区域、给低置信出口)和业务流程(复核、人工)来兜底。
- 拿公开榜单当选型依据:基准与你的用户分布几乎必然不同,自建用例集实测才是准绳。
- 忽略输入预处理:同样的图,压缩成 JPEG 后文字糊了、旋转后识别率下降,输入侧清洗(去噪、纠偏、超分)常比换模型更见效。
- 对多模态过度承诺:有些产品把支持上传图片当成多模态智能,实际只是存了个附件:真正的多模态产品要让模型看到图片内容,并在回答里引用视觉证据。
- 把理解和检索混为一谈:知识类问答用 RAG 检索命中率更可控,别让模型硬读整库;理解模型负责读懂,检索系统负责找到,各司其职。
- 忽略成本增长的分辨率陷阱:同一张图,从 512 升到 2K,token 数可能涨 10 倍:更清楚不等于更有用,按任务需要给分辨率分级。
- 忘记多模态不等于视频会议式堆料:把图、文、音一股脑全塞给模型而不设计任务边界,成本和延迟双高;先拆任务、再定模态,是每页文档都该有的产品纪律。
未来趋势
- 统一多模态(一个模型包办看懂 + 生成 + 语音):API 形态收敛,产品只需对接一个端点;能力与定价会重新洗牌。
- 超长上下文多模态:小时级视频/音频直接输入做检索式理解,喂整段会议录像替代先转写再总结的管线。
- 多模态 Agent:模型主动调用视觉/检索/生成工具完成多步任务(拍照 → 查库存 → 生成报价单),感知-推理-行动闭环。
- 端侧多模态:小模型上手机,拍照问答、实时翻译离线可用;能力弱于云端,但隐私与延迟优势明显。
- 多模态安全与治理:深度伪造检测、生成内容标识、跨模态偏见(模型对特定肤色/性别的视觉判断偏差)会从合规问题变成产品能力:能证明我们的内容可溯源、无偏见本身就是 to B 卖点。
给产品经理的最终建议
多模态产品的失败大多出在没测对场景、没留兜底、没算清成本,而不是模型不够强。把本文的失败模式清单、评测方法与成本意识用到立项与验收里,比追最新的模型发布更有价值。
来源说明
本文为原创整理,概念、架构与模型信息参考以下来源,访问验证日期 2026-08-23;模型能力与价格变动频繁,以各官方页面为准。
- GPT-4o 系统卡:omni 先例(端到端语音与多模态);现行型号见 模型能力与边界。
- Claude 视觉能力文档:Claude 5 系图像输入与 token 换算。
- Gemini 多模态文档:Gemini 原生多模态与长上下文输入。
- MMMU 论文:大学级多模态理解基准。
- Whisper:多语言转写;
translate任务为译成英文。 - 多模态前沿论文:视觉语言模型与原生多模态的论文导读。
- AIGC 面试书多模态系列笔记(
sources/mm/):仅供维护者交叉验证(CLIP/BLIP-2 对齐、三段式架构、幻觉类型),读者以 CLIP 论文与各厂商官方文档为准。 - 站内:大模型基础、Transformer 架构、模型能力与边界、评估与评测、RAG 基础。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用