多模态前沿论文
多模态前沿论文
多模态理解 已介绍图像、文档、视频、音频能力及产品评测。本页按照论文路线整理多模态基础模型如何完成模态对齐、知识迁移、长时序理解和统一生成。
多模态模型的四个研究问题
多模态模型需要同时解决:
- 表示:图像 patch、音频帧、视频片段如何变成可计算 token;
- 对齐:视觉表示如何与语言空间建立对应;
- 融合:不同模态何时、在哪一层交换信息;
- 生成:模型能否只理解输入,也能生成文本、图像、音频或动作。
“支持图片输入”只说明接口存在,不说明模型具有统一的多模态表示。判断架构时要看视觉编码器是否冻结、连接器如何训练、语言模型是否参与联合训练,以及输出端是否能够生成多个模态。
CLIP:用对比学习对齐图文
CLIP 使用大规模图文对进行对比学习,使匹配的图像和文本在表示空间中靠近,不匹配的组合远离。它的主要贡献是证明弱标注的互联网图文数据可以学习具有迁移性的视觉语义表示。
CLIP 更接近跨模态表示和检索模型,不是完整的图像问答或图像生成模型。它擅长:
- 零样本分类;
- 图文检索;
- 相似度计算;
- 为生成模型提供文本条件或评分。
它的边界是对细粒度空间关系、文字识别、计数和复杂组合推理的支持有限。对比相似度高不等于模型理解了因果关系。
Flamingo:冻结模型之间的跨模态连接
Flamingo 研究如何把视觉输入接入大语言模型,并通过交错的图像—文本序列完成 few-shot 多模态任务。其路线的重要特点是利用已有视觉模型和语言模型,再训练连接跨模态信息的模块。
这种设计降低了从头训练多模态模型的成本,但会受到:
- 视觉编码器表示上限;
- 连接器信息瓶颈;
- 视觉 token 数量;
- 图文交错数据质量;
- 模态之间时间和指代关系的影响。
BLIP-2 与 LLaVA:轻量连接器和视觉指令微调
BLIP-2 使用 Q-Former 从冻结的视觉编码器中提取与语言任务相关的视觉特征,再连接冻结语言模型。它展示了一个重要工程方向:通过小型连接器把视觉知识迁移到强语言模型,而不必更新全部参数。
LLaVA 将视觉编码器、投影层和语言模型组合,并使用视觉指令数据进行训练。它推动了开源视觉语言助手的发展,也暴露出数据质量和评测污染的重要性:模型可能依赖图片描述模板,而非真正理解图像。
视觉语言模型的训练阶段
| 阶段 | 目标 | 常见参数状态 |
|---|---|---|
| 表示预训练 | 建立视觉或图文表示 | 视觉、语言模型可能独立训练 |
| 模态连接 | 让视觉特征进入语言空间 | 主要训练连接器 |
| 视觉指令微调 | 学会看图回答和遵循格式 | 更新连接器,部分更新语言模型 |
| 多模态后训练 | 提升拒答、推理和工具使用 | 结合偏好、规则或任务数据 |
原生多模态与交错 token
拼接式模型通常是“视觉编码器 + 连接器 + LLM”。原生多模态模型则尝试让文本、图像、音频和视频在统一训练目标或统一序列中共同建模。
原生方案的研究重点包括:
- 模态专属 tokenizer 与共享词表;
- 图文、音频和视频 token 的交错顺序;
- 不同模态的时间分辨率;
- 模态缺失和跨模态生成;
- 统一 next-token prediction 与模态专属损失。
Emu3 探索把多模态输入输出统一为离散 token 序列。Janus 研究视觉理解与视觉生成的统一架构,同时使用理解和生成所需的不同视觉表示路径。
统一并不意味着所有模态共享完全相同的编码器。更重要的问题是:模型是否能在同一任务中稳定地组合图像、语言、视频和动作信息。
视频与音频的长时序问题
视频比图像多出时间维度,音频还具有更高采样率和更细时间结构。直接把所有帧、patch 或音频帧送入 Transformer 会造成 token 数量和注意力成本快速增长。
常见压缩方法包括:
- 降低帧率;
- 合并相邻 patch;
- 使用时间池化;
- 提取关键帧或事件片段;
- 使用分层时序编码;
- 先做局部编码,再做跨片段汇聚。
代表工作包括:Video-LLaVA 把图像与视频投影进共享语言空间;Gemini 1.5 用超长上下文直接吃视频和音频小时级输入;语音转写与时间对齐仍常以 Whisper 一类 ASR 为级联底座。原生多模态旗舰把部分级联收进同一套参数,但长视频成本仍由帧率、分辨率和注意力长度决定。
评测不能只问「是否看懂视频」,还要区分:
- 单帧识别;
- 事件顺序;
- 长时段状态变化;
- 音画同步;
- 跨镜头指代;
- 对未来事件的预测。
VLM Grounding 与视觉推理
视觉 grounding 要求模型把语言中的实体、关系或动作对应到图像区域、坐标、时间片段或可执行对象。它比图像描述更接近操作和 Agent 场景。
需要分别评估:
- 物体是否识别正确;
- 边界框、点或区域是否定位准确;
- 空间关系是否理解;
- 视觉证据是否支持文本结论;
- 遮挡、分辨率和布局变化下是否稳定。
ImageBind 研究把图像、文本、音频、深度、热成像和 IMU 等模态映射到共享空间。共享空间适合检索和关联,但不自动解决细粒度推理、生成和动作控制。
自监督世界表征
V-JEPA 代表预测式视觉表征路线:模型在潜在表示空间预测被遮挡或未来的表示,而不是逐像素生成所有内容。它关注的是环境结构和可预测信息,而非视觉细节的像素级重建。与世界模型、具身闭环的关系见 世界模型与具身智能。
这条路线与世界模型、视频理解和具身智能相连,但视觉表征模型本身不等于完整环境模型。还要补充动作条件、奖励、策略和控制闭环,才能支持交互式决策。
统一评测与产品验收
| 能力 | 典型问题 | 不能只看什么 |
|---|---|---|
| OCR 与文档 | 文字、表格、版面是否正确 | 图片描述流畅度 |
| 空间理解 | 左右、前后、距离和区域 | 分类准确率 |
| 视频理解 | 事件顺序和跨帧状态 | 单帧问答 |
| 音频理解 | 说话内容、时间和说话人 | 文本转写单项分数 |
| 多模态推理 | 视觉证据能否支持结论 | 语言模型单项能力 |
| 多模态生成 | 输出是否符合条件 | 视觉观感平均分 |
给 AI 产品经理的结论
多模态产品的首要决策不是“选一个能看图的模型”,而是确定输入的时间、空间和证据结构。高风险文档、工业检测、医疗影像和机器人任务需要保留可定位的视觉证据、置信度和人工复核路径。模型输出越接近动作或业务决策,越不能只用语言流畅度验收。
来源说明
本文为原创整理,引用日期:2026-09-04。基础能力和产品方法参见 多模态理解。主要来源包括 CLIP、Flamingo、BLIP-2、LLaVA、Video-LLaVA、Gemini 1.5、Whisper、ImageBind、V-JEPA、Emu3 与 Janus。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用