多模态理解
多模态理解
多模态 AI 指模型能理解或生成多种信息形态:文本、图像、音频、视频。多模态理解(输入侧)是当前落地最成熟的 AI 能力之一:拍照识物、票据 OCR、会议纪要、视频审核等产品早已把「看懂」做成了稳定的用户体验;而多模态生成(输出侧)则在 2023 年后借助扩散模型与统一架构快速走向商用。本文梳理多模态理解的能力谱系、模型架构、主流现状、失败模式与评测方法,供 AI 产品经理建立多模态产品的技术直觉。生成类能力(图像/视频/语音)见 图像生成、视频生成、语音与音频。
读本文之前
本文假设读者已经了解大模型的基本概念(什么是 token、什么是 Transformer)。如果还没有,先读 大模型基础 与 Transformer 架构。本文的重心不是原理推导,而是「每种能力成熟到什么程度、会在哪里失败、产品上怎么用」。
多模态理解的能力谱系
「多模态理解」不是一个单一能力,而是一组成熟度差异很大的子能力。把能力拆开看,才能知道哪些可以直接商用、哪些必须人审兜底:
| 模态 | 能力 | 成熟度 | 典型产品场景 |
|---|---|---|---|
| 图像 | 物体识别、场景分类、通用描述 | 高 | 拍照识物、商品搜索、相册分类 |
| 图像 | OCR(印刷体) | 高 | 票据识别、名片扫描、截图转文档 |
| 图像 | OCR(手写体、复杂版面) | 中 | 手写病历、表格还原、公式识别 |
| 图像 | 图表理解(表格/折线/柱状) | 中高 | 财报分析、科研论文问答、数据看板 |
| 文档 | PDF/扫描件/长文档理解 | 高 | 合同审核、资料总结、合规审查 |
| 视频 | 内容理解、摘要、审核 | 中 | 短视频审核、教程总结、广告素材审查 |
| 视频 | 逐帧分析、时序事件定位 | 中低 | 安防回查、体育事件切点、行为识别 |
| 音频 | 语音识别(ASR)、翻译 | 高 | 会议纪要、字幕生成、语音搜索 |
| 音频 | 声纹识别、说话人分离 | 中 | 电话质检、多说话人会议记录 |
| 音频 | 情感与语气理解 | 中低 | 客服情绪预警、语音质检 |
图像:识别、描述、OCR、图表
- 识别与描述:识别常见物体、场景、人物动作并生成自然语言描述,是成熟度最高的能力,商拍图、社交图、监控画面都能处理;但细粒度识别(具体车型、植物品种、稀有鸟类)需要专门数据或检索兜底,不能只靠通用模型。
- OCR:印刷体已是「可靠基础设施」,票据、证件、名片、截图都有稳定方案;手写体、艺术字体、印章叠加、表格还原则明显掉点——翻拍的皱褶小票、扫描件上的水印、彩色底纹都会干扰识别,这类场景要设计「置信度 + 人审」。
- 图表理解:折线图趋势、柱状图对比、表格抽取是近年进步最快的方向之一,财报问答、论文图表解析已可用;但「图表 + 上下文数值推导」的多步推理仍会出错,金融场景需核对原始数字。
- 截图与 UI 理解:网页/App 截图的理解(找按钮、读弹窗、分析布局)是 Agent 产品与测试场景的高频需求,对界面元素的指代能力要求高,旗舰模型的进步明显,但不同产品截图风格差异大,建议自建 UI 用例集。
文档:PDF、表格、扫描件
长文档理解(几十上百页 PDF)的关键不是「看懂一页」,而是「找到关键页并跨页组织答案」。模型本身能读,但检索哪几页、如何拼接证据往往决定成败——这与 RAG 基础 的思路同源:先定位再回答,而不是把整份文档硬塞进上下文。表格还原(保留行列结构)与扫描件版式重建是高频刚需,排版越复杂越需要专用文档解析管线,而非通用视觉模型。评估长文档能力时注意三类样本:跨页引用(答案散在多页)、密集表格(行列对齐)、扫描质量退化(歪斜、噪点)。
视频:内容理解、逐帧分析、时序事件
- 内容理解与摘要:抽帧 + 视觉语言模型,能概括「视频讲了什么」、给短视频做标签与审核初筛。
- 逐帧分析:逐帧检测(违禁内容、产品缺陷、运动轨迹)成熟度较高,是审核与质检的标配;代价是计算量大,工程上要按需抽帧(每秒 1 帧还是 30 帧差一个数量级的成本)。
- 时序事件定位:「第几秒发生了什么」需要跨帧推理与时间轴建模,成熟度明显低于静态理解,安防、体育切点类产品要留人工复核。更细的视频技术见 视频生成 的「视频理解」一节。
- 多模态融合理解:画面 + 字幕 + 音频一起理解(如短视频的「画面配文是否违规」)是视频审核的进阶形态,比单看画面更准,也更接近人看视频的方式。
音频:ASR、翻译、声纹
- ASR:成熟度最高的音频能力,会议纪要、字幕、语音搜索均可直接商用;多语言混说、方言、专业术语是主要掉点。技术细节见 语音与音频。
- 翻译:语音到文本再翻译已是成熟链路(Whisper 原生支持多语言转写与翻译),实时同传的延迟与准确率仍在提升中。
- 声纹与说话人分离:区分「谁在说话」可用于会议记录分段与电话质检;多人重叠说话、远场录音下会退化,需要专用模型与数据。
- 环境音与音乐理解:听懂「这是狗叫/警报/钢琴」属于音频分类与检索(CLAP 类模型),用于安防告警、音乐版权识别,是与语音识别不同的另一条线。
规律一:静态信息理解成熟、动态与时序理解偏弱。单张图的识别/OCR 已接近商用极限,而视频的跨帧推理(谁先推了谁、事件发生在第几秒)仍容易出错。规律二:印刷体/标准场景成熟、退化场景脆弱——同样的 OCR,白底黑字近乎满分,翻拍的皱褶小票就明显掉点。产品设计时应先锚定自己场景的真实数据分布,而不是看榜单数字。
跨模态检索:以图搜图、拍照搜商品
多模态理解还有一个「不显眼但最先产业化」的分支——跨模态检索:用一种模态做查询,从另一种模态的库里找结果。以图搜商品(拍照比价)、以文搜图(用描述找历史素材)、以文搜视频(安防里用文字定位监控片段)都是成熟落地形态。技术基础是 CLIP 这类双编码器对齐出的共享嵌入空间:图与文分别编码成向量,相似度排序即检索结果;更复杂的检索(视频、音频)在此基础上扩展。
产品启示:检索类能力比问答类更早成熟、更好验收(结果可排序、可人工抽查),是「多模态能力从哪个场景切入」的稳妥起点;检索与问答结合(先检索再让模型基于结果回答)正是多模态版 RAG 基础 的形态——音频检索(用文字搜语音片段)是值得关注的新方向。
生成类能力(输出)
| 模态 | 代表产品/模型 | 关键点 |
|---|---|---|
| 文生图 | 即梦、Midjourney、FLUX、SD 系 | 版权风险、可控性(风格/布局)见 图像生成 |
| 文生视频 | 可灵、Sora、Runway、即梦 | 成本高、时长短、一致性弱,见 视频生成 |
| 语音合成(TTS) | GPT-4o 语音、各类 TTS API | 音色授权、情绪表达,见 语音与音频 |
| 音乐生成 | Suno、Udio 等 | 版权是最大风险,见 语音与音频 |
生成类能力整体成熟度低于理解类:图像生成已可商用(但可控性仍是痛点),视频生成处于「可演示、难交付」阶段,音乐生成则卡在版权而非技术。理解类产品与生成类产品的设计重心完全不同:理解类拼的是「别错」,生成类拼的是「别翻车 + 可控」,详见各分册。
三类核心任务的划分
把多模态任务按「输入/输出形态」归类,有助于产品立项时对齐预期:
| 任务类别 | 输入 → 输出 | 典型任务 | 成熟度 |
|---|---|---|---|
| 跨模态检索 | 一模态 → 另一模态的结果列表 | 以图搜商品、以文搜图、以文搜视频 | 高(图文)/中(视频) |
| 多模态理解与推理 | 多模态 → 文本/结构化结论 | VQA、图文审核、文档问答、图表分析 | 高(单图)/中(视频) |
| 跨模态生成 | 一模态 → 另一模态内容 | 文生图、文生视频、TTS、图像描述 | 中高(图)/中低(视频) |
| 跨模态对齐与转换 | 模态间语义对齐/风格转换 | 风格迁移、音画同步(口型)、语音驱动数字人 | 中高 |
同一个产品往往同时用到多类任务(拍照 → 检索相似款 → 生成换装图),但立项时应按「主任务」选能力基线,避免把「什么都沾一点」当成「多模态都擅长」。
多模态模型是怎么做的
从拼接式到原生多模态
理解「模型为什么有时聪明、有时犯傻」,关键是看清架构演进的两条路线:
- 拼接式(模块化):用现成的视觉编码器(如 ViT)把图像切成 patch 编码成向量,再用一个「映射器」把视觉向量映射进 LLM 的词嵌入空间,让 LLM 在文本 token 流里「读」图像。代表:LLaVA、BLIP-2、Qwen-VL 早期版本、Intern-VL 系。这条路线复用成熟组件、训练成本低,是 2022-2024 年开源视觉语言模型的主流。
- 原生多模态(统一 token 空间):从预训练起就把文本、图像、音频统一成 token 序列,让同一个 Transformer 直接吃所有模态。代表:GPT-4o、Gemini、Claude 视觉能力(具体实现以官方披露为准)、Qwen-VL 后期、GLM-V。这条路线模态交互更充分、端到端延迟更低,但训练数据与算力门槛极高。
三段式直觉:编码器 → 映射器 → LLM 主干
无论哪条路线,理解类模型都可以抽象成三段:
- 模态编码器:把原始信号变成向量序列。图像用 ViT(切成 16×16 的 patch 逐个编码);音频先转成梅尔频谱图再编码(类似一张二维图),或直接用 Whisper 这类专用编码器;视频则是抽帧后逐帧走图像编码器再拼时间信息。编码器只负责「把信号翻译成向量」,不负责理解语义。
- 映射器(连接器):把非文本向量对齐到 LLM 的语义空间。最简单的线性投影(LLaVA 早期只用一层);进阶如 BLIP-2 的 Q-Former——用一组可学习的 query token 通过交叉注意力「蒸馏」出对 LLM 最有用的视觉信息,相当于一个信息瓶颈,只把关键内容喂给 LLM。
- LLM 主干:负责语义理解、推理与生成,是模型「聪明」的来源。多模态模型相当于在 LLM 外面长出了眼睛和耳朵;主干的推理能力直接决定多模态问答的上限——「看到」是一回事,「看懂并答对」是另一回事。
对齐是怎么学出来的
- 对比学习(CLIP 范式):拿海量「图文对」训练双编码器,让匹配的图文向量在嵌入空间里靠近、不匹配的远离。CLIP 用约 4 亿图文对训出的对齐空间,既支持零样本图文检索(不需要标注即可按语义搜图),其视觉编码器也成了后续无数模型的初始化权重。
- 图文匹配 + 掩码重建:BLIP 等模型额外训练「这张图和这句话匹配吗」的二分类,以及遮住图像 patch 让模型预测被遮内容,学更细粒度的对应关系;BLIP 的 CapFilt 机制还用于给海量图文对自动生成更高质量的描述,提升训练数据质量。
- 指令微调对齐:LLaVA 用视觉指令数据(图 + 问题 + 答案)微调,让模型学会「看着图回答问题」,这一步把感知能力和语言能力真正接起来,也是「多模态对话」能力的来源。
演进时间线:从 CLIP 到原生多模态
| 阶段 | 代表工作 | 关键贡献 |
|---|---|---|
| 2021 | CLIP | 对比学习对齐图文空间,零样本图文检索,视觉编码器成为标准零件 |
| 2022 | BLIP / BLIP-2 | 统一理解与生成;Q-Former 用可学习 query 从图像里「蒸馏」关键信息,信息瓶颈思想 |
| 2023 | LLaVA | 线性投影 + 视觉指令微调,证明「冻结视觉编码器 + 微调 LLM」就能做多模态对话 |
| 2023 | GPT-4V | 闭源旗舰把多模态视觉对话做成产品级,推理能力决定多模态上限 |
| 2024-2026 | GPT-4o、Gemini、Claude、Qwen-VL 后期 | 原生多模态 + 音频/视频输入 + 超长上下文,统一 token 成为主流方向 |
这条时间线的产品含义:架构代际更替很快,但「编码器感知 + 主干推理」的分工至今成立——视觉感知不足的模型,靠更强的推理也补不回来;反过来,推理弱的小模型,感知再强也答不好复杂问题。
训练视角:预训练与微调、冻结与解冻
- 预训练管对齐,微调管任务:预训练用大规模弱标注图文对(如 LAION-5B 约 58 亿对)把不同模态拉进同一语义空间,成本极高(千亿参数模型单次预训练可达数百万美元量级);微调用垂直数据(医疗影像、票据、质检图)把通用模型适配到具体任务,成本低一两个数量级,常配合 LoRA 等参数高效微调(只更新不到 1% 的参数)。
- 视觉编码器冻结还是微调:数据分布接近通用场景(自然图像)时冻结编码器即可,省算力且避免遗忘;垂直领域(医学影像、遥感、工业质检)与细粒度任务(OCR、小目标检测)需要解冻编码器联合微调,否则特征对不上任务。折中方案是部分解冻(只微调编码器最后几层)或对编码器加 LoRA。
- 高分辨率输入的处理:ViT 的注意力复杂度随 patch 数量平方增长,4K 图直接编码会爆显存。工程上常用动态分块(把大图切成 448×448 子图分别编码再拼接)、多尺度编码(低清抓全局、高清抓细节)、token 压缩(池化/Q-Former 式抽取)等手段,这些策略直接决定「小字看得清不清」——OCR 与文档场景选型时,「高分辨率支持」比「榜单分数」更值得看。
- 多模态训练的数据配比:纯文本数据不能丢——多模态训练中混入一定比例纯文本语料,防止语言能力退化(灾难性遗忘);混合图文交错数据(图在文中)则让模型学会跨模态引用。
为什么 2024-2025 后旗舰普遍原生多模态
- 端到端低延迟:拼接式要过「视觉编码器 → 映射器 → LLM」多段管线,实时语音对话(如 GPT-4o 语音模式)需要更短的感知到响应的链路,统一 token 空间天然更顺。
- 交错输入与多模态推理:原生模型能自然处理「文本 + 图 + 表格混排」的复杂输入,并在推理中自由引用不同模态的信息。
- Scaling Law 更顺:统一 token 后,同一个 Transformer 的规模、数据、算力可以直接堆,不再受「编码器与 LLM 各自为政」的接口瓶颈限制。
- 对产品经理的含义:原生多模态是方向,但拼接式开源模型(如 Qwen-VL、Intern-VL)在垂直场景经微调后依然能打,选型不必唯架构论,以实测为准。
主流多模态模型现状
以下为 2026-08 现状概览,模型与价格变动频繁,一切以各厂商官方页面为准:
| 厂商 | 代表模型 | 能力定位 | 价格量级(以官方页面为准) |
|---|---|---|---|
| OpenAI | GPT-4o / GPT-5 系 | 文本 + 图像 + 音频输入,实时语音对话;旗舰视觉推理 | 与文本同价按 token 计,图像按分辨率折成 token |
| Anthropic | Claude 5 系(Opus/Sonnet/Haiku) | 全系支持图像输入,长文档与截图理解强 | 图像按 token 计,量级与文本一致 |
| Gemini 3.x | 原生多模态,超长上下文(视频/音频小时级输入) | Flash 档低价,Pro 档中高价 | |
| 开源 | Qwen-VL / Qwen3-VL | Apache 2.0,可本地部署,中文场景强 | 权重免费,自付推理成本 |
| 开源 | Intern-VL | 高分辨率文档/细粒度视觉,开源可商用 | 权重免费 |
| 开源 | GLM-V 系 | 智谱开源视觉语言模型,工具调用强 | 权重免费(许可证以官方为准) |
- GPT-4o/GPT-5 系:OpenAI 的「o」系列把语音输入、图像输入、实时对话统一进一个模型,系统卡强调端到端语音能力;多模态输入按 token 计费,图像大小决定 token 数(GPT-4o 系统卡)。
- Claude 视觉:Claude 5 家族全系支持文本与图像输入,官方文档给出图像分块、尺寸与 token 换算建议;视觉能力定位是「文档、截图、界面与图表理解」,适合企业知识场景(Claude 视觉文档)。
- Gemini:原生多模态 + 百万级上下文,可直接输入视频与长音频做检索式理解;Flash 档价格显著低于 Pro 档,适合大量调用(Gemini 多模态文档)。
- 开源三强:Qwen-VL(阿里,Apache 2.0)、Intern-VL(上海 AI Lab,细粒度视觉)、GLM-V(智谱)均可本地部署,中文场景与文档理解表现接近商用闭源,是私有化部署的主力选择(以各官方仓库为准)。
文本-图像统一模型的趋势:2025-2026 年起,旗舰模型逐渐把「理解 + 生成」收进同一套参数(如统一多模态模型内部用扩散或自回归做图像输出),对产品经理的意义是一套 API 同时搞定看懂和画图,成本与延迟的权衡方式也会变化。选型时把「视觉输入质量」「多模态推理」「价格延迟」三个维度放进自己的评测集实测,而不是看厂商发布会。
按任务形态的模型选型对照
| 任务形态 | 推荐起点 | 理由 |
|---|---|---|
| 单图问答、通用描述 | 旗舰快模型或开源 7B-32B 档 | 性价比高,差距集中在刁钻用例 |
| 细粒度文档/OCR | 高分辨率视觉模型(Intern-VL 类)或专用解析管线 | 分辨率与版面还原能力优先 |
| 长视频/长音频理解 | 原生多模态 + 长上下文(如 Gemini 类) | 直接输入 vs 抽帧的取舍看成本 |
| 实时语音对话 | 端到端语音模型或级联管线 | 延迟预算主导,见 语音与音频 |
| 私有化/敏感数据 | 开源视觉语言模型本地部署 | 数据不出域,能力经微调可接近闭源 |
选型要点速查
- 只做 OCR/票据/文档:不必上旗舰视觉模型——专用文档解析管线(版面分析 + OCR + 表格还原)更便宜更准,通用多模态模型做兜底与校验。
- 做通用图文问答/审核:旗舰或开源视觉语言模型均可,中文场景优先测中文图文对;成本敏感就测 Flash/快模型档位。
- 做视频/音频长输入理解:优先看原生多模态 + 长上下文(Gemini 类),抽帧与分段策略直接影响成本与效果。
- 数据敏感/私有化:开源三强(Qwen-VL、Intern-VL、GLM-V)本地部署,配合 模型能力与边界 的本地化权衡。
- 实时语音交互:端到端语音模型或级联管线,延迟预算见 语音与音频。
多模态检索:从理解到搜索
检索是多模态理解最先跑通商业闭环的形态,值得单独说:
- 以图搜图 / 拍照搜商品:电商标配——用户拍一张图,系统用视觉编码器提取特征,在商品库向量检索出同款/相似款;工程关键是「特征怎么提」(颜色纹理特征 vs 语义特征)与「库怎么排」(相似度 + 业务排序)。
- 以文搜图 / 以文搜视频:用自然语言检索素材库,内容平台与素材平台的刚需;视频检索要先做「镜头切分 + 代表帧索引」,把视频转成可检索的图集合。
- 多模态组合检索:文本 + 图一起作为查询(「和这张图风格类似但不要红色」),依赖统一嵌入空间的组合能力,成熟度在提升。
- 评价指标:Recall@K(前 K 个结果里命中的比例)、MRR(首个正确结果的排名)——产品上线前用人工标注的查询集测,别只看演示效果。
典型行业应用
- 内容审核:图文、短视频、直播的多模态审核是「理解类」最刚需的场景——画面(违禁物、暴力、色情)+ 文字(违禁词、广告导流)+ 音频(辱骂、敏感词)三路并行,模型初筛 + 规则命中 + 人工复核的分层架构是标配;模型负责召回,规则与人工负责精判。
- 文档解析:合同、票据、财报的版面分析 + OCR + 结构化抽取,把 PDF 变成可检索的数据库,是 RAG 的输入侧;复杂版面(表格嵌套、印章、手写批注)是难点,常见方案是「通用多模态模型 + 专用解析引擎」双通道。
- 工业质检:拍照检测产品缺陷(划痕、缺件、装配错误),视觉理解 + 规则过滤 + 人工复判;行业特点是误报成本高(把良品当次品也是损失),要按「漏检率/误报率」双指标验收。
- 自动驾驶与具身:多模态感知(图像/雷达/音频)融合理解是自动驾驶与机器人的基础,属于高可靠场景,与通用多模态模型的能力边界差异大,不在本文展开。
行业 × 能力速查表
| 行业 | 主任务 | 关键能力 | 常见兜底设计 |
|---|---|---|---|
| 金融 | 票据/合同理解、财报问答 | 高精度 OCR、表格还原 | 金额字段双重校验、人审 |
| 医疗 | 影像辅助判断、病历结构化 | 垂直微调、高分辨率 | 医生终审、不作为诊断依据 |
| 内容平台 | 图文/视频审核、素材检索 | 多路理解、向量检索 | 规则命中 + 人工复核 |
| 电商 | 拍照搜商品、商品图生成 | 检索 + 生成 + 一致性 | 相似度过滤、人工选品 |
| 安防 | 视频事件定位、轨迹分析 | 时序理解、逐帧检测 | 事件复核、告警分级 |
| 教育 | 拍照搜题、讲义解析 | 公式/图表理解 | 答案溯源、防作弊策略 |
练习
挑一个你熟悉的场景(如「拍照识别发票并自动录入报销系统」),画出:输入形态 → 模型能力拆解(OCR/结构化/金额校验各自用什么)→ 失败模式清单 → 人审兜底策略,并估算单张成本。
能力边界与失败模式
多模态模型的失败有规律可循,产品设计前先背熟这几类:
- 计数失败:问「图里有几个苹果」,模型常常数错,尤其是小物体、重叠物体。计数类需求要设计约束输出或人工复核。
- 空间关系错乱:「猫在桌子下面还是上面?」「左边的人还是右边的人?」——位置关系判断不稳定,涉及空间推理的问答要谨慎。
- 小字与退化 OCR:低分辨率、模糊、反光、艺术字体的文字识别明显掉点;密集表格的单元格对齐也容易错位。
- 幻觉细节:模型会「脑补」图中不存在的内容——给一张没有时钟的照片描述「墙上的钟显示三点」,或把人物手中的物体说成另一个东西。多模态幻觉通常分三类:类别幻觉(描述出图中没有的物体)、属性幻觉(物体存在但颜色/大小/材质说错)、关系幻觉(位置/动作关系说错)。来源包括训练数据的统计偏差(常见物体更可能被「猜」出来)、视觉编码器感知不足、以及 LLM 语言先验过强——模型用「常识」补全了它没看清的部分。
- 图像推理的陷阱:需要多步视觉推理(读图表后计算、对比两幅图差异)时,模型可能跳过真正的视觉证据、直接套用语言先验作答;示意图与真实照片混在一起时更容易翻车。
- 指代与局部理解:「第二张图左上角那个按钮」这类带坐标/区域的指代,模型可能答非所问——对 UI 截图、多图对比场景要专门测。
- 长文档的「中间丢失」:几十上百页的 PDF,模型容易记住开头结尾、漏掉中间页,跨页引用也会串页——需要检索定位 + 分页引用机制兜底(见 RAG 基础)。
- 什么时候必须人审兜底:涉及钱(票据金额、合同条款)、安全(审核放行)、法律(证据认定)、医疗(影像判断)的场景,一律人审兜底;生成内容对外发布前也要过审。
不要用 prompt 硬扛能力短板
同一张图反复改 prompt 仍识别错时,多半是模型视觉能力的边界,而不是提示词的问题。此时优先换更强模型、提高输入分辨率、换专用 OCR/文档解析管线,而不是继续调 prompt。
缓解幻觉的工程手段:输入侧(提高分辨率、增强视觉编码器、多视图验证)、训练侧(反事实负样本、对比学习)、推理侧(对比解码——同时跑原始图与扰动图,不一致时抑制语言先验;或让模型先描述再问答,把感知和推理拆开)。产品侧最实用的是结构约束:要求模型输出引用图像区域、给「看不清」出口、低置信强制转人工。
失败模式的验收清单
产品验收时按下面的清单逐项测,比「跑几个随机问题看效果」可靠得多:
| 失败类型 | 怎么测 | 验收底线 |
|---|---|---|
| 计数 | 3-20 个同类物体的图,问数量 | 小物体(≤5 像素)场景允许误差,关键计数必须全对 |
| 空间关系 | 「左/右/上/下/前/后」问答各 10 例 | 对称场景(两人并肩)可放宽,方向性指令必须对 |
| 小字 OCR | 手机拍屏幕、低清截图 | 印刷体错字率按业务容忍度定,金额/编号零容忍 |
| 幻觉 | 空场景图(纯色墙)问「有什么」 | 必须回答「没有检测到物体」,不得编造 |
| 多步推理 | 图表 + 数值计算题 | 计算过程可复核,答案错误可容忍但必须给引用 |
多模态评测
- MMMU:大学级别多学科多模态理解基准(艺术、科学、人文等 6 大学科),考察跨学科知识与视觉推理(论文)。
- MMBench:多模态理解综合基准,覆盖感知、推理、关系、属性等能力维度,细分 20 余个子任务。
- MM-Vet:考察视觉理解与语言能力的组合运用(识别 + 知识 + 推理),更接近真实用户提问形态。
- MME:感知与认知两大赛道、14 个子任务(存在性、计数、位置、颜色、OCR 等),常用作细粒度能力体检。
- 幻觉专项:POPE(把对象存在性幻觉做成是/否问答)、CHAIR(评估图像描述里有多少物体是图里没有的),选模型时值得单独跑。
评测多模态产品的实操建议
- 从真实用户请求里收集 50-100 条「图 + 问题」样本,覆盖常规、退化(模糊/反光/低清)与刁钻(计数/空间/小字)三类。
- 定义自己的通过标准:答案正确、引用图像证据、不乱编细节,分开打标。
- 同一用例集跑 2-3 个候选模型/分辨率档位,记录错误类型分布(幻觉、漏答、错位),不要只看总准确率。
- 上线后定期回归——模型更新会改变视觉行为,评测集要常跑常新;方法与 评估与评测 一致。
读榜单的注意点
- 榜单饱和:主流基准(MMMU、MMBench 等)上旗舰模型差距已很小(个位数百分点),「高 2 分」不等于「你的场景好 2 分」;基准的区分度集中在难样本,而难样本往往不是你的用户样本。
- 输入策略影响结果:同一模型,图传 512 与传 2K、单图与多图拼接,分数可以差很多——复现榜单要连「输入分辨率、分块策略」一起复现。
- 幻觉类指标单独看:总准确率高可能掩盖幻觉问题;幻觉在「开放式描述」任务里最严重,在「是/否」任务里较轻,评测任务形态要对齐你的产品形态。
- 检索类指标单独看:问答准 ≠ 检索准,检索产品要单测 Recall@K/MRR,别拿问答榜推断检索能力。
产品设计要点
- 输入侧优先:理解类能力成熟度远高于生成类,多数产品先做「看懂」再考虑「生成」;看懂本身就能撑起票据、审核、纪要、搜索等一批产品。
- 组合场景:多模态的最优用法是组合——拍照 → 识别 → 总结 → 生成报告,把「感知 + 推理 + 生成」串成工作流,而不是让单次调用包办一切。典型组合:
- 报销:拍照(OCR 识别票据)→ 抽取结构化字段(金额/日期/类目)→ 规则校验(发票真伪、重复报销)→ 生成报销单。
- 会议:录音(ASR 转写)→ 说话人分离 → 摘要与待办抽取 → 生成纪要与跟进任务。
- 电商:拍照(识别商品)→ 检索同款 → 比价/关联推荐 → 生成换装或场景图。
- 审核:画面 + 字幕 + 音频三路理解 → 规则命中 → 人工复核队列。
- 成本差异:图像/视频 token 成本远高于文本,且随分辨率上升;长视频、多帧输入尤其要算账。控制手段:压缩输入(裁剪、降采样、只传关键帧)、限制输出长度、用量分级(免费档低清、付费档高清)。
- 合规重点:人脸(肖像权、人脸识别的合规边界)、声音(音色授权)、版权素材(训练数据与生成物权属)是三条红线;涉及个人信息与敏感场景还要过数据安全评估,详见 合规与安全。
- 延迟预算:视觉输入的首 token 延迟与 token 数正相关,实时场景(拍照问答、语音助手)要实测,必要时用低清输入 + 预取常用上下文;语音助手类产品参考 语音与音频 的延迟预算。
- 降级设计:模态缺失(用户传了模糊图、传错格式、图被截断)是常态,产品要设计「识别不了就明说 + 引导重传」而不是硬答;多模态产品的体验差距往往在退化输入上拉开。
- 数据闭环:把用户上传的图 + 纠错反馈沉淀成评测集与微调数据——多模态产品的竞争力会越来越依赖「场景数据资产」,越早开始积累越有利。
- 安全护栏:输入图与输出文本都要过内容安全(违禁、隐私);「看图说话」可能把敏感信息带出来(证件照、聊天截图),产品要设计脱敏与权限控制。
常见坑
- 扫描件 OCR 质量参差,合同类产品要设计「人审兜底」与「置信度拒绝」——低置信直接转人工,而不是硬给结果。
- 文生图难以精确控制细节(手指、文字、长文本),文案类物料要人工终审,见 图像生成。
- 视频生成时长受限且不连贯,慎用于商业场景,见 视频生成。
- 多模态模型的失败往往不报错——它不会说「我看不清」,而是自信地编一个答案。置信度信号不可信,要用输出结构(要求引用图像区域、给低置信出口)和业务流程(复核、人工)来兜底。
- 拿公开榜单当选型依据——基准与你的用户分布几乎必然不同,自建用例集实测才是准绳。
- 忽略输入预处理:同样的图,压缩成 JPEG 后文字糊了、旋转后识别率下降,输入侧清洗(去噪、纠偏、超分)常比换模型更见效。
- 对「多模态」过度承诺:有些产品把「支持上传图片」当成「多模态智能」,实际只是存了个附件——真正的多模态产品要让模型看到图片内容,并在回答里引用视觉证据。
- 把「理解」和「检索」混为一谈:知识类问答用 RAG 检索命中率更可控,别让模型硬读整库;理解模型负责「读懂」,检索系统负责「找到」,各司其职。
- 忽略成本增长的「分辨率陷阱」:同一张图,从 512 升到 2K,token 数可能涨 10 倍——「更清楚」不等于「更有用」,按任务需要给分辨率分级。
- 忘记「多模态不等于视频会议式堆料」:把图、文、音一股脑全塞给模型而不设计任务边界,成本和延迟双高;先拆任务、再定模态,是每页文档都该有的产品纪律。
未来趋势
- 统一多模态(一个模型包办看懂 + 生成 + 语音):API 形态收敛,产品只需对接一个端点;能力与定价会重新洗牌。
- 超长上下文多模态:小时级视频/音频直接输入做检索式理解,「喂整段会议录像」替代「先转写再总结」的管线。
- 多模态 Agent:模型主动调用视觉/检索/生成工具完成多步任务(拍照 → 查库存 → 生成报价单),「感知-推理-行动」闭环。
- 端侧多模态:小模型上手机,拍照问答、实时翻译离线可用;能力弱于云端,但隐私与延迟优势明显。
- 多模态安全与治理:深度伪造检测、生成内容标识、跨模态偏见(模型对特定肤色/性别的视觉判断偏差)会从「合规问题」变成「产品能力」——能证明「我们的内容可溯源、无偏见」本身就是 to B 卖点。
给产品经理的最终建议
多模态产品的失败大多不是「模型不够强」,而是「没测对场景、没留兜底、没算清成本」。把本文的失败模式清单、评测方法与成本意识用到立项与验收里,比追最新的模型发布更有价值。
来源说明
本文为原创整理,概念、架构与模型信息参考以下来源,访问验证日期 2026-08-23;模型能力与价格变动频繁,以各官方页面为准。
- GPT-4o 系统卡:端到端多模态与实时语音能力说明。
- Claude 视觉能力文档:Claude 5 系图像输入与 token 换算。
- Gemini 多模态文档:Gemini 原生多模态与长上下文输入。
- MMMU 论文:大学级多模态理解基准。
- Whisper:语音识别开源方案(音频编码器参考)。
- 多模态架构与幻觉综述内容参考 AIGC 面试书多模态系列笔记(预取资料
sources/mm/):CLIP/BLIP-2 对齐机制、编码器-映射器-主干三段式、幻觉类型与缓解方法。 - 站内:大模型基础、Transformer 架构、模型能力与边界、评估与评测、RAG 基础。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用