跳转至

多模态理解

多模态理解

多模态 AI 指模型能理解或生成多种信息形态:文本、图像、音频、视频。多模态理解(输入侧)是当前落地最成熟的 AI 能力之一:拍照识物、票据 OCR、会议纪要、视频审核等产品早已把「看懂」做成了稳定的用户体验;而多模态生成(输出侧)则在 2023 年后借助扩散模型与统一架构快速走向商用。本文梳理多模态理解的能力谱系、模型架构、主流现状、失败模式与评测方法,供 AI 产品经理建立多模态产品的技术直觉。生成类能力(图像/视频/语音)见 图像生成视频生成语音与音频

读本文之前

本文假设读者已经了解大模型的基本概念(什么是 token、什么是 Transformer)。如果还没有,先读 大模型基础Transformer 架构。本文的重心不是原理推导,而是「每种能力成熟到什么程度、会在哪里失败、产品上怎么用」。

多模态理解的能力谱系

「多模态理解」不是一个单一能力,而是一组成熟度差异很大的子能力。把能力拆开看,才能知道哪些可以直接商用、哪些必须人审兜底:

模态能力成熟度典型产品场景
图像物体识别、场景分类、通用描述拍照识物、商品搜索、相册分类
图像OCR(印刷体)票据识别、名片扫描、截图转文档
图像OCR(手写体、复杂版面)手写病历、表格还原、公式识别
图像图表理解(表格/折线/柱状)中高财报分析、科研论文问答、数据看板
文档PDF/扫描件/长文档理解合同审核、资料总结、合规审查
视频内容理解、摘要、审核短视频审核、教程总结、广告素材审查
视频逐帧分析、时序事件定位中低安防回查、体育事件切点、行为识别
音频语音识别(ASR)、翻译会议纪要、字幕生成、语音搜索
音频声纹识别、说话人分离电话质检、多说话人会议记录
音频情感与语气理解中低客服情绪预警、语音质检

图像:识别、描述、OCR、图表

  • 识别与描述:识别常见物体、场景、人物动作并生成自然语言描述,是成熟度最高的能力,商拍图、社交图、监控画面都能处理;但细粒度识别(具体车型、植物品种、稀有鸟类)需要专门数据或检索兜底,不能只靠通用模型。
  • OCR:印刷体已是「可靠基础设施」,票据、证件、名片、截图都有稳定方案;手写体、艺术字体、印章叠加、表格还原则明显掉点——翻拍的皱褶小票、扫描件上的水印、彩色底纹都会干扰识别,这类场景要设计「置信度 + 人审」。
  • 图表理解:折线图趋势、柱状图对比、表格抽取是近年进步最快的方向之一,财报问答、论文图表解析已可用;但「图表 + 上下文数值推导」的多步推理仍会出错,金融场景需核对原始数字。
  • 截图与 UI 理解:网页/App 截图的理解(找按钮、读弹窗、分析布局)是 Agent 产品与测试场景的高频需求,对界面元素的指代能力要求高,旗舰模型的进步明显,但不同产品截图风格差异大,建议自建 UI 用例集。

文档:PDF、表格、扫描件

长文档理解(几十上百页 PDF)的关键不是「看懂一页」,而是「找到关键页并跨页组织答案」。模型本身能读,但检索哪几页、如何拼接证据往往决定成败——这与 RAG 基础 的思路同源:先定位再回答,而不是把整份文档硬塞进上下文。表格还原(保留行列结构)与扫描件版式重建是高频刚需,排版越复杂越需要专用文档解析管线,而非通用视觉模型。评估长文档能力时注意三类样本:跨页引用(答案散在多页)、密集表格(行列对齐)、扫描质量退化(歪斜、噪点)。

视频:内容理解、逐帧分析、时序事件

  • 内容理解与摘要:抽帧 + 视觉语言模型,能概括「视频讲了什么」、给短视频做标签与审核初筛。
  • 逐帧分析:逐帧检测(违禁内容、产品缺陷、运动轨迹)成熟度较高,是审核与质检的标配;代价是计算量大,工程上要按需抽帧(每秒 1 帧还是 30 帧差一个数量级的成本)。
  • 时序事件定位:「第几秒发生了什么」需要跨帧推理与时间轴建模,成熟度明显低于静态理解,安防、体育切点类产品要留人工复核。更细的视频技术见 视频生成 的「视频理解」一节。
  • 多模态融合理解:画面 + 字幕 + 音频一起理解(如短视频的「画面配文是否违规」)是视频审核的进阶形态,比单看画面更准,也更接近人看视频的方式。

音频:ASR、翻译、声纹

  • ASR:成熟度最高的音频能力,会议纪要、字幕、语音搜索均可直接商用;多语言混说、方言、专业术语是主要掉点。技术细节见 语音与音频
  • 翻译:语音到文本再翻译已是成熟链路(Whisper 原生支持多语言转写与翻译),实时同传的延迟与准确率仍在提升中。
  • 声纹与说话人分离:区分「谁在说话」可用于会议记录分段与电话质检;多人重叠说话、远场录音下会退化,需要专用模型与数据。
  • 环境音与音乐理解:听懂「这是狗叫/警报/钢琴」属于音频分类与检索(CLAP 类模型),用于安防告警、音乐版权识别,是与语音识别不同的另一条线。

规律一:静态信息理解成熟、动态与时序理解偏弱。单张图的识别/OCR 已接近商用极限,而视频的跨帧推理(谁先推了谁、事件发生在第几秒)仍容易出错。规律二:印刷体/标准场景成熟、退化场景脆弱——同样的 OCR,白底黑字近乎满分,翻拍的皱褶小票就明显掉点。产品设计时应先锚定自己场景的真实数据分布,而不是看榜单数字。

跨模态检索:以图搜图、拍照搜商品

多模态理解还有一个「不显眼但最先产业化」的分支——跨模态检索:用一种模态做查询,从另一种模态的库里找结果。以图搜商品(拍照比价)、以文搜图(用描述找历史素材)、以文搜视频(安防里用文字定位监控片段)都是成熟落地形态。技术基础是 CLIP 这类双编码器对齐出的共享嵌入空间:图与文分别编码成向量,相似度排序即检索结果;更复杂的检索(视频、音频)在此基础上扩展。

产品启示:检索类能力比问答类更早成熟、更好验收(结果可排序、可人工抽查),是「多模态能力从哪个场景切入」的稳妥起点;检索与问答结合(先检索再让模型基于结果回答)正是多模态版 RAG 基础 的形态——音频检索(用文字搜语音片段)是值得关注的新方向。

生成类能力(输出)

模态代表产品/模型关键点
文生图即梦、Midjourney、FLUX、SD 系版权风险、可控性(风格/布局)见 图像生成
文生视频可灵、Sora、Runway、即梦成本高、时长短、一致性弱,见 视频生成
语音合成(TTS)GPT-4o 语音、各类 TTS API音色授权、情绪表达,见 语音与音频
音乐生成Suno、Udio 等版权是最大风险,见 语音与音频

生成类能力整体成熟度低于理解类:图像生成已可商用(但可控性仍是痛点),视频生成处于「可演示、难交付」阶段,音乐生成则卡在版权而非技术。理解类产品与生成类产品的设计重心完全不同:理解类拼的是「别错」,生成类拼的是「别翻车 + 可控」,详见各分册。

三类核心任务的划分

把多模态任务按「输入/输出形态」归类,有助于产品立项时对齐预期:

任务类别输入 → 输出典型任务成熟度
跨模态检索一模态 → 另一模态的结果列表以图搜商品、以文搜图、以文搜视频高(图文)/中(视频)
多模态理解与推理多模态 → 文本/结构化结论VQA、图文审核、文档问答、图表分析高(单图)/中(视频)
跨模态生成一模态 → 另一模态内容文生图、文生视频、TTS、图像描述中高(图)/中低(视频)
跨模态对齐与转换模态间语义对齐/风格转换风格迁移、音画同步(口型)、语音驱动数字人中高

同一个产品往往同时用到多类任务(拍照 → 检索相似款 → 生成换装图),但立项时应按「主任务」选能力基线,避免把「什么都沾一点」当成「多模态都擅长」。

多模态模型是怎么做的

从拼接式到原生多模态

理解「模型为什么有时聪明、有时犯傻」,关键是看清架构演进的两条路线:

  • 拼接式(模块化):用现成的视觉编码器(如 ViT)把图像切成 patch 编码成向量,再用一个「映射器」把视觉向量映射进 LLM 的词嵌入空间,让 LLM 在文本 token 流里「读」图像。代表:LLaVA、BLIP-2、Qwen-VL 早期版本、Intern-VL 系。这条路线复用成熟组件、训练成本低,是 2022-2024 年开源视觉语言模型的主流。
  • 原生多模态(统一 token 空间):从预训练起就把文本、图像、音频统一成 token 序列,让同一个 Transformer 直接吃所有模态。代表:GPT-4o、Gemini、Claude 视觉能力(具体实现以官方披露为准)、Qwen-VL 后期、GLM-V。这条路线模态交互更充分、端到端延迟更低,但训练数据与算力门槛极高。

三段式直觉:编码器 → 映射器 → LLM 主干

无论哪条路线,理解类模型都可以抽象成三段:

  1. 模态编码器:把原始信号变成向量序列。图像用 ViT(切成 16×16 的 patch 逐个编码);音频先转成梅尔频谱图再编码(类似一张二维图),或直接用 Whisper 这类专用编码器;视频则是抽帧后逐帧走图像编码器再拼时间信息。编码器只负责「把信号翻译成向量」,不负责理解语义。
  2. 映射器(连接器):把非文本向量对齐到 LLM 的语义空间。最简单的线性投影(LLaVA 早期只用一层);进阶如 BLIP-2 的 Q-Former——用一组可学习的 query token 通过交叉注意力「蒸馏」出对 LLM 最有用的视觉信息,相当于一个信息瓶颈,只把关键内容喂给 LLM。
  3. LLM 主干:负责语义理解、推理与生成,是模型「聪明」的来源。多模态模型相当于在 LLM 外面长出了眼睛和耳朵;主干的推理能力直接决定多模态问答的上限——「看到」是一回事,「看懂并答对」是另一回事。

对齐是怎么学出来的

  • 对比学习(CLIP 范式):拿海量「图文对」训练双编码器,让匹配的图文向量在嵌入空间里靠近、不匹配的远离。CLIP 用约 4 亿图文对训出的对齐空间,既支持零样本图文检索(不需要标注即可按语义搜图),其视觉编码器也成了后续无数模型的初始化权重。
  • 图文匹配 + 掩码重建:BLIP 等模型额外训练「这张图和这句话匹配吗」的二分类,以及遮住图像 patch 让模型预测被遮内容,学更细粒度的对应关系;BLIP 的 CapFilt 机制还用于给海量图文对自动生成更高质量的描述,提升训练数据质量。
  • 指令微调对齐:LLaVA 用视觉指令数据(图 + 问题 + 答案)微调,让模型学会「看着图回答问题」,这一步把感知能力和语言能力真正接起来,也是「多模态对话」能力的来源。

演进时间线:从 CLIP 到原生多模态

阶段代表工作关键贡献
2021CLIP对比学习对齐图文空间,零样本图文检索,视觉编码器成为标准零件
2022BLIP / BLIP-2统一理解与生成;Q-Former 用可学习 query 从图像里「蒸馏」关键信息,信息瓶颈思想
2023LLaVA线性投影 + 视觉指令微调,证明「冻结视觉编码器 + 微调 LLM」就能做多模态对话
2023GPT-4V闭源旗舰把多模态视觉对话做成产品级,推理能力决定多模态上限
2024-2026GPT-4o、Gemini、Claude、Qwen-VL 后期原生多模态 + 音频/视频输入 + 超长上下文,统一 token 成为主流方向

这条时间线的产品含义:架构代际更替很快,但「编码器感知 + 主干推理」的分工至今成立——视觉感知不足的模型,靠更强的推理也补不回来;反过来,推理弱的小模型,感知再强也答不好复杂问题。

训练视角:预训练与微调、冻结与解冻

  • 预训练管对齐,微调管任务:预训练用大规模弱标注图文对(如 LAION-5B 约 58 亿对)把不同模态拉进同一语义空间,成本极高(千亿参数模型单次预训练可达数百万美元量级);微调用垂直数据(医疗影像、票据、质检图)把通用模型适配到具体任务,成本低一两个数量级,常配合 LoRA 等参数高效微调(只更新不到 1% 的参数)。
  • 视觉编码器冻结还是微调:数据分布接近通用场景(自然图像)时冻结编码器即可,省算力且避免遗忘;垂直领域(医学影像、遥感、工业质检)与细粒度任务(OCR、小目标检测)需要解冻编码器联合微调,否则特征对不上任务。折中方案是部分解冻(只微调编码器最后几层)或对编码器加 LoRA。
  • 高分辨率输入的处理:ViT 的注意力复杂度随 patch 数量平方增长,4K 图直接编码会爆显存。工程上常用动态分块(把大图切成 448×448 子图分别编码再拼接)、多尺度编码(低清抓全局、高清抓细节)、token 压缩(池化/Q-Former 式抽取)等手段,这些策略直接决定「小字看得清不清」——OCR 与文档场景选型时,「高分辨率支持」比「榜单分数」更值得看。
  • 多模态训练的数据配比:纯文本数据不能丢——多模态训练中混入一定比例纯文本语料,防止语言能力退化(灾难性遗忘);混合图文交错数据(图在文中)则让模型学会跨模态引用。

为什么 2024-2025 后旗舰普遍原生多模态

  • 端到端低延迟:拼接式要过「视觉编码器 → 映射器 → LLM」多段管线,实时语音对话(如 GPT-4o 语音模式)需要更短的感知到响应的链路,统一 token 空间天然更顺。
  • 交错输入与多模态推理:原生模型能自然处理「文本 + 图 + 表格混排」的复杂输入,并在推理中自由引用不同模态的信息。
  • Scaling Law 更顺:统一 token 后,同一个 Transformer 的规模、数据、算力可以直接堆,不再受「编码器与 LLM 各自为政」的接口瓶颈限制。
  • 对产品经理的含义:原生多模态是方向,但拼接式开源模型(如 Qwen-VL、Intern-VL)在垂直场景经微调后依然能打,选型不必唯架构论,以实测为准。

主流多模态模型现状

以下为 2026-08 现状概览,模型与价格变动频繁,一切以各厂商官方页面为准:

厂商代表模型能力定位价格量级(以官方页面为准)
OpenAIGPT-4o / GPT-5 系文本 + 图像 + 音频输入,实时语音对话;旗舰视觉推理与文本同价按 token 计,图像按分辨率折成 token
AnthropicClaude 5 系(Opus/Sonnet/Haiku)全系支持图像输入,长文档与截图理解强图像按 token 计,量级与文本一致
GoogleGemini 3.x原生多模态,超长上下文(视频/音频小时级输入)Flash 档低价,Pro 档中高价
开源Qwen-VL / Qwen3-VLApache 2.0,可本地部署,中文场景强权重免费,自付推理成本
开源Intern-VL高分辨率文档/细粒度视觉,开源可商用权重免费
开源GLM-V 系智谱开源视觉语言模型,工具调用强权重免费(许可证以官方为准)
  • GPT-4o/GPT-5 系:OpenAI 的「o」系列把语音输入、图像输入、实时对话统一进一个模型,系统卡强调端到端语音能力;多模态输入按 token 计费,图像大小决定 token 数(GPT-4o 系统卡)。
  • Claude 视觉:Claude 5 家族全系支持文本与图像输入,官方文档给出图像分块、尺寸与 token 换算建议;视觉能力定位是「文档、截图、界面与图表理解」,适合企业知识场景(Claude 视觉文档)。
  • Gemini:原生多模态 + 百万级上下文,可直接输入视频与长音频做检索式理解;Flash 档价格显著低于 Pro 档,适合大量调用(Gemini 多模态文档)。
  • 开源三强:Qwen-VL(阿里,Apache 2.0)、Intern-VL(上海 AI Lab,细粒度视觉)、GLM-V(智谱)均可本地部署,中文场景与文档理解表现接近商用闭源,是私有化部署的主力选择(以各官方仓库为准)。

文本-图像统一模型的趋势:2025-2026 年起,旗舰模型逐渐把「理解 + 生成」收进同一套参数(如统一多模态模型内部用扩散或自回归做图像输出),对产品经理的意义是一套 API 同时搞定看懂和画图,成本与延迟的权衡方式也会变化。选型时把「视觉输入质量」「多模态推理」「价格延迟」三个维度放进自己的评测集实测,而不是看厂商发布会。

按任务形态的模型选型对照

任务形态推荐起点理由
单图问答、通用描述旗舰快模型或开源 7B-32B 档性价比高,差距集中在刁钻用例
细粒度文档/OCR高分辨率视觉模型(Intern-VL 类)或专用解析管线分辨率与版面还原能力优先
长视频/长音频理解原生多模态 + 长上下文(如 Gemini 类)直接输入 vs 抽帧的取舍看成本
实时语音对话端到端语音模型或级联管线延迟预算主导,见 语音与音频
私有化/敏感数据开源视觉语言模型本地部署数据不出域,能力经微调可接近闭源

选型要点速查

  • 只做 OCR/票据/文档:不必上旗舰视觉模型——专用文档解析管线(版面分析 + OCR + 表格还原)更便宜更准,通用多模态模型做兜底与校验。
  • 做通用图文问答/审核:旗舰或开源视觉语言模型均可,中文场景优先测中文图文对;成本敏感就测 Flash/快模型档位。
  • 做视频/音频长输入理解:优先看原生多模态 + 长上下文(Gemini 类),抽帧与分段策略直接影响成本与效果。
  • 数据敏感/私有化:开源三强(Qwen-VL、Intern-VL、GLM-V)本地部署,配合 模型能力与边界 的本地化权衡。
  • 实时语音交互:端到端语音模型或级联管线,延迟预算见 语音与音频

多模态检索:从理解到搜索

检索是多模态理解最先跑通商业闭环的形态,值得单独说:

  • 以图搜图 / 拍照搜商品:电商标配——用户拍一张图,系统用视觉编码器提取特征,在商品库向量检索出同款/相似款;工程关键是「特征怎么提」(颜色纹理特征 vs 语义特征)与「库怎么排」(相似度 + 业务排序)。
  • 以文搜图 / 以文搜视频:用自然语言检索素材库,内容平台与素材平台的刚需;视频检索要先做「镜头切分 + 代表帧索引」,把视频转成可检索的图集合。
  • 多模态组合检索:文本 + 图一起作为查询(「和这张图风格类似但不要红色」),依赖统一嵌入空间的组合能力,成熟度在提升。
  • 评价指标:Recall@K(前 K 个结果里命中的比例)、MRR(首个正确结果的排名)——产品上线前用人工标注的查询集测,别只看演示效果。

典型行业应用

  • 内容审核:图文、短视频、直播的多模态审核是「理解类」最刚需的场景——画面(违禁物、暴力、色情)+ 文字(违禁词、广告导流)+ 音频(辱骂、敏感词)三路并行,模型初筛 + 规则命中 + 人工复核的分层架构是标配;模型负责召回,规则与人工负责精判。
  • 文档解析:合同、票据、财报的版面分析 + OCR + 结构化抽取,把 PDF 变成可检索的数据库,是 RAG 的输入侧;复杂版面(表格嵌套、印章、手写批注)是难点,常见方案是「通用多模态模型 + 专用解析引擎」双通道。
  • 工业质检:拍照检测产品缺陷(划痕、缺件、装配错误),视觉理解 + 规则过滤 + 人工复判;行业特点是误报成本高(把良品当次品也是损失),要按「漏检率/误报率」双指标验收。
  • 自动驾驶与具身:多模态感知(图像/雷达/音频)融合理解是自动驾驶与机器人的基础,属于高可靠场景,与通用多模态模型的能力边界差异大,不在本文展开。

行业 × 能力速查表

行业主任务关键能力常见兜底设计
金融票据/合同理解、财报问答高精度 OCR、表格还原金额字段双重校验、人审
医疗影像辅助判断、病历结构化垂直微调、高分辨率医生终审、不作为诊断依据
内容平台图文/视频审核、素材检索多路理解、向量检索规则命中 + 人工复核
电商拍照搜商品、商品图生成检索 + 生成 + 一致性相似度过滤、人工选品
安防视频事件定位、轨迹分析时序理解、逐帧检测事件复核、告警分级
教育拍照搜题、讲义解析公式/图表理解答案溯源、防作弊策略
练习

挑一个你熟悉的场景(如「拍照识别发票并自动录入报销系统」),画出:输入形态 → 模型能力拆解(OCR/结构化/金额校验各自用什么)→ 失败模式清单 → 人审兜底策略,并估算单张成本。

能力边界与失败模式

多模态模型的失败有规律可循,产品设计前先背熟这几类:

  • 计数失败:问「图里有几个苹果」,模型常常数错,尤其是小物体、重叠物体。计数类需求要设计约束输出或人工复核。
  • 空间关系错乱:「猫在桌子下面还是上面?」「左边的人还是右边的人?」——位置关系判断不稳定,涉及空间推理的问答要谨慎。
  • 小字与退化 OCR:低分辨率、模糊、反光、艺术字体的文字识别明显掉点;密集表格的单元格对齐也容易错位。
  • 幻觉细节:模型会「脑补」图中不存在的内容——给一张没有时钟的照片描述「墙上的钟显示三点」,或把人物手中的物体说成另一个东西。多模态幻觉通常分三类:类别幻觉(描述出图中没有的物体)、属性幻觉(物体存在但颜色/大小/材质说错)、关系幻觉(位置/动作关系说错)。来源包括训练数据的统计偏差(常见物体更可能被「猜」出来)、视觉编码器感知不足、以及 LLM 语言先验过强——模型用「常识」补全了它没看清的部分。
  • 图像推理的陷阱:需要多步视觉推理(读图表后计算、对比两幅图差异)时,模型可能跳过真正的视觉证据、直接套用语言先验作答;示意图与真实照片混在一起时更容易翻车。
  • 指代与局部理解:「第二张图左上角那个按钮」这类带坐标/区域的指代,模型可能答非所问——对 UI 截图、多图对比场景要专门测。
  • 长文档的「中间丢失」:几十上百页的 PDF,模型容易记住开头结尾、漏掉中间页,跨页引用也会串页——需要检索定位 + 分页引用机制兜底(见 RAG 基础)。
  • 什么时候必须人审兜底:涉及钱(票据金额、合同条款)、安全(审核放行)、法律(证据认定)、医疗(影像判断)的场景,一律人审兜底;生成内容对外发布前也要过审。
不要用 prompt 硬扛能力短板

同一张图反复改 prompt 仍识别错时,多半是模型视觉能力的边界,而不是提示词的问题。此时优先换更强模型、提高输入分辨率、换专用 OCR/文档解析管线,而不是继续调 prompt。

缓解幻觉的工程手段:输入侧(提高分辨率、增强视觉编码器、多视图验证)、训练侧(反事实负样本、对比学习)、推理侧(对比解码——同时跑原始图与扰动图,不一致时抑制语言先验;或让模型先描述再问答,把感知和推理拆开)。产品侧最实用的是结构约束:要求模型输出引用图像区域、给「看不清」出口、低置信强制转人工。

失败模式的验收清单

产品验收时按下面的清单逐项测,比「跑几个随机问题看效果」可靠得多:

失败类型怎么测验收底线
计数3-20 个同类物体的图,问数量小物体(≤5 像素)场景允许误差,关键计数必须全对
空间关系「左/右/上/下/前/后」问答各 10 例对称场景(两人并肩)可放宽,方向性指令必须对
小字 OCR手机拍屏幕、低清截图印刷体错字率按业务容忍度定,金额/编号零容忍
幻觉空场景图(纯色墙)问「有什么」必须回答「没有检测到物体」,不得编造
多步推理图表 + 数值计算题计算过程可复核,答案错误可容忍但必须给引用

多模态评测

  • MMMU:大学级别多学科多模态理解基准(艺术、科学、人文等 6 大学科),考察跨学科知识与视觉推理(论文)。
  • MMBench:多模态理解综合基准,覆盖感知、推理、关系、属性等能力维度,细分 20 余个子任务。
  • MM-Vet:考察视觉理解与语言能力的组合运用(识别 + 知识 + 推理),更接近真实用户提问形态。
  • MME:感知与认知两大赛道、14 个子任务(存在性、计数、位置、颜色、OCR 等),常用作细粒度能力体检。
  • 幻觉专项:POPE(把对象存在性幻觉做成是/否问答)、CHAIR(评估图像描述里有多少物体是图里没有的),选模型时值得单独跑。
评测多模态产品的实操建议
  1. 从真实用户请求里收集 50-100 条「图 + 问题」样本,覆盖常规、退化(模糊/反光/低清)与刁钻(计数/空间/小字)三类。
  2. 定义自己的通过标准:答案正确、引用图像证据、不乱编细节,分开打标。
  3. 同一用例集跑 2-3 个候选模型/分辨率档位,记录错误类型分布(幻觉、漏答、错位),不要只看总准确率。
  4. 上线后定期回归——模型更新会改变视觉行为,评测集要常跑常新;方法与 评估与评测 一致。

读榜单的注意点

  • 榜单饱和:主流基准(MMMU、MMBench 等)上旗舰模型差距已很小(个位数百分点),「高 2 分」不等于「你的场景好 2 分」;基准的区分度集中在难样本,而难样本往往不是你的用户样本。
  • 输入策略影响结果:同一模型,图传 512 与传 2K、单图与多图拼接,分数可以差很多——复现榜单要连「输入分辨率、分块策略」一起复现。
  • 幻觉类指标单独看:总准确率高可能掩盖幻觉问题;幻觉在「开放式描述」任务里最严重,在「是/否」任务里较轻,评测任务形态要对齐你的产品形态。
  • 检索类指标单独看:问答准 ≠ 检索准,检索产品要单测 Recall@K/MRR,别拿问答榜推断检索能力。

产品设计要点

  • 输入侧优先:理解类能力成熟度远高于生成类,多数产品先做「看懂」再考虑「生成」;看懂本身就能撑起票据、审核、纪要、搜索等一批产品。
  • 组合场景:多模态的最优用法是组合——拍照 → 识别 → 总结 → 生成报告,把「感知 + 推理 + 生成」串成工作流,而不是让单次调用包办一切。典型组合:
    • 报销:拍照(OCR 识别票据)→ 抽取结构化字段(金额/日期/类目)→ 规则校验(发票真伪、重复报销)→ 生成报销单。
    • 会议:录音(ASR 转写)→ 说话人分离 → 摘要与待办抽取 → 生成纪要与跟进任务。
    • 电商:拍照(识别商品)→ 检索同款 → 比价/关联推荐 → 生成换装或场景图。
    • 审核:画面 + 字幕 + 音频三路理解 → 规则命中 → 人工复核队列。
  • 成本差异:图像/视频 token 成本远高于文本,且随分辨率上升;长视频、多帧输入尤其要算账。控制手段:压缩输入(裁剪、降采样、只传关键帧)、限制输出长度、用量分级(免费档低清、付费档高清)。
  • 合规重点:人脸(肖像权、人脸识别的合规边界)、声音(音色授权)、版权素材(训练数据与生成物权属)是三条红线;涉及个人信息与敏感场景还要过数据安全评估,详见 合规与安全
  • 延迟预算:视觉输入的首 token 延迟与 token 数正相关,实时场景(拍照问答、语音助手)要实测,必要时用低清输入 + 预取常用上下文;语音助手类产品参考 语音与音频 的延迟预算。
  • 降级设计:模态缺失(用户传了模糊图、传错格式、图被截断)是常态,产品要设计「识别不了就明说 + 引导重传」而不是硬答;多模态产品的体验差距往往在退化输入上拉开。
  • 数据闭环:把用户上传的图 + 纠错反馈沉淀成评测集与微调数据——多模态产品的竞争力会越来越依赖「场景数据资产」,越早开始积累越有利。
  • 安全护栏:输入图与输出文本都要过内容安全(违禁、隐私);「看图说话」可能把敏感信息带出来(证件照、聊天截图),产品要设计脱敏与权限控制。

常见坑

  • 扫描件 OCR 质量参差,合同类产品要设计「人审兜底」与「置信度拒绝」——低置信直接转人工,而不是硬给结果。
  • 文生图难以精确控制细节(手指、文字、长文本),文案类物料要人工终审,见 图像生成
  • 视频生成时长受限且不连贯,慎用于商业场景,见 视频生成
  • 多模态模型的失败往往不报错——它不会说「我看不清」,而是自信地编一个答案。置信度信号不可信,要用输出结构(要求引用图像区域、给低置信出口)和业务流程(复核、人工)来兜底。
  • 拿公开榜单当选型依据——基准与你的用户分布几乎必然不同,自建用例集实测才是准绳。
  • 忽略输入预处理:同样的图,压缩成 JPEG 后文字糊了、旋转后识别率下降,输入侧清洗(去噪、纠偏、超分)常比换模型更见效。
  • 对「多模态」过度承诺:有些产品把「支持上传图片」当成「多模态智能」,实际只是存了个附件——真正的多模态产品要让模型看到图片内容,并在回答里引用视觉证据。
  • 把「理解」和「检索」混为一谈:知识类问答用 RAG 检索命中率更可控,别让模型硬读整库;理解模型负责「读懂」,检索系统负责「找到」,各司其职。
  • 忽略成本增长的「分辨率陷阱」:同一张图,从 512 升到 2K,token 数可能涨 10 倍——「更清楚」不等于「更有用」,按任务需要给分辨率分级。
  • 忘记「多模态不等于视频会议式堆料」:把图、文、音一股脑全塞给模型而不设计任务边界,成本和延迟双高;先拆任务、再定模态,是每页文档都该有的产品纪律。

未来趋势

  • 统一多模态(一个模型包办看懂 + 生成 + 语音):API 形态收敛,产品只需对接一个端点;能力与定价会重新洗牌。
  • 超长上下文多模态:小时级视频/音频直接输入做检索式理解,「喂整段会议录像」替代「先转写再总结」的管线。
  • 多模态 Agent:模型主动调用视觉/检索/生成工具完成多步任务(拍照 → 查库存 → 生成报价单),「感知-推理-行动」闭环。
  • 端侧多模态:小模型上手机,拍照问答、实时翻译离线可用;能力弱于云端,但隐私与延迟优势明显。
  • 多模态安全与治理:深度伪造检测、生成内容标识、跨模态偏见(模型对特定肤色/性别的视觉判断偏差)会从「合规问题」变成「产品能力」——能证明「我们的内容可溯源、无偏见」本身就是 to B 卖点。
给产品经理的最终建议

多模态产品的失败大多不是「模型不够强」,而是「没测对场景、没留兜底、没算清成本」。把本文的失败模式清单、评测方法与成本意识用到立项与验收里,比追最新的模型发布更有价值。

来源说明

本文为原创整理,概念、架构与模型信息参考以下来源,访问验证日期 2026-08-23;模型能力与价格变动频繁,以各官方页面为准。

  1. GPT-4o 系统卡:端到端多模态与实时语音能力说明。
  2. Claude 视觉能力文档:Claude 5 系图像输入与 token 换算。
  3. Gemini 多模态文档:Gemini 原生多模态与长上下文输入。
  4. MMMU 论文:大学级多模态理解基准。
  5. Whisper:语音识别开源方案(音频编码器参考)。
  6. 多模态架构与幻觉综述内容参考 AIGC 面试书多模态系列笔记(预取资料 sources/mm/):CLIP/BLIP-2 对齐机制、编码器-映射器-主干三段式、幻觉类型与缓解方法。
  7. 站内:大模型基础Transformer 架构模型能力与边界评估与评测RAG 基础