视频生成
视频生成
视频生成是生成式 AI 里看起来最接近魔法、落地却最难的方向:2024 年 Sora 的技术演示最长约 60 秒(以 OpenAI 技术报告 为准),与商用默认时长不是同一件事。直到 2026 年,生成一段高保真商业成片依然困难。梳理视频生成为什么难、架构路线、典型模型现状、视频理解、编辑与数字人,以及产品视角的适用场景与边界。建议先读 图像生成 掌握扩散模型基础:视频生成的大部分技术栈与图像同源。
视频生成为什么难
视频生成 = 图像生成 + 时间维度,难点也正来自这个 +时间:
与图像生成的核心差异
| 维度 | 图像生成 | 视频生成 |
|---|---|---|
| 输出 | 单张静态图 | 帧序列 + 时间轴 |
| 一致性 | 单图内一致即可 | 跨帧身份/位置/运动一致 |
| 成本 | 单张几十步去噪 | 帧数 × 步数,高一个量级 |
| 数据 | 图文对(十亿级) | 视频文本对(稀缺、难标注) |
| 验收 | 单图人眼即可 | 必须看完整运动,多轮抽检 |
| 失败 | 局部崩坏可重绘 | 局部崩坏往往整段作废 |
一句话:图像生成是画对一张画,视频生成是导对一场戏:后者对一致性、成本与验收的要求完全不同,产品设计时不要用图像生成的预期去套视频生成。
- 时空一致性:物体必须跨帧保持身份与形态:同一张脸不能在第 3 帧换人,杯子放下后不能在第 20 帧自己飞走。模型要在长序列上维持谁是谁、在哪、在干嘛的一致,这是视频生成最核心的技术难点,也是与图像生成最大的差异:图像错了可以重画,视频错了整段作废。
- 计算成本比图像高一个量级:视频是帧的堆叠,训练与推理的显存、算力、数据量都随帧数线性甚至超线性上涨;生成 10 秒 1080p 视频的算力远大于生成一张图,推理时间从几十秒到几分钟不等。
- 数据稀缺且难标注:高质量、带详细文本描述的连续视频远比图文对稀缺;视频要切镜头(去掉转场)、滤低质、写密集字幕,数据工程成本极高:可以说视频生成的上限被高质量视频数据卡着。
- 物理与因果直觉:运动要符合常识:重力、遮挡、动作连贯、物体交互。模型实际上是在学世界如何运作,这也是 Sora 技术报告自称世界模拟器的原因;同时也意味着任何违反物理直觉的生成都会被一眼识破。
评估指标:视频有自己的尺子
图像指标(FID、CLIP Score 等)只能衡量单帧质量,视频要额外看动起来对不对。纳入产品评测闭环见 评估与评测:业务可用率优先于 FVD。
| 指标 | 衡量什么 | 说明 |
|---|---|---|
| FVD(Frechet Video Distance) | 生成视频与真实视频的分布距离 | 视频版 FID,同时看帧质量与时间连贯 |
| 运动一致性 | 物体跨帧运动是否连贯、符合物理 | 轨迹平滑性、速度/加速度合理性 |
| 指令遵循 | 生成内容与提示词的对齐度 | 主体、数量、动作是否正确 |
| 时序连贯 | 帧间是否突变、闪烁、穿帮 | 镜头稳定、遮挡合理 |
| 人工评估 | 感官质量、物理模拟、封面质量 | CogVideoX 论文式的四维打分是常见做法 |
| 业务指标 | 可用率、返工率、生成失败率 | 决定产品能不能上线 |
视频生成指标与真实视频数据集对比才有意义:拿动得慢 = 更连贯当优化目标,会得到静态幻灯片;人工评估仍是最终准绳,而且要看运动质量,而不是只看首帧截图。
常见失败模式
| 失败模式 | 表现 | 常见于 |
|---|---|---|
| 身份漂移 | 人物/物体中途变样(换脸、换衣) | 长镜头、出画再入画 |
| 肢体崩坏 | 手指、关节扭曲,动作不自然 | 复杂动作、多人交互 |
| 物体穿模/瞬移 | 物体穿透、位置跳变 | 遮挡、快速运动 |
| 物理违例 | 液体、布料、碰撞不符合直觉 | 复杂物理场景 |
| 文字乱码 | 画面中的文字闪烁、拼错 | 含字幕/招牌的场景 |
| 首帧失控 | 首帧即崩坏,整段作废 | 文生视频(无参考图) |
这些失败模式就是产品验收清单的来源:逐条设计用例、逐条打标比随机看几条视频可靠得多。
架构路线
时空扩散:视频扩散模型
把图像扩散扩展到时间维:在视频 VAE 压缩后的潜空间里做 3D 扩散,去噪网络同时处理空间与时间(空间注意力 + 时间注意力)。视频扩散的奠基工作是 Ho 等人的 Video Diffusion Models。工程上的早期代表是 Stable Video Diffusion(SVD,2023):基于 SD 2.1 插入时间卷积与时间注意力层,三阶段训练(图像预训练 → 低清视频预训练 → 高清微调),并加入 FPS / 运动强度等微调节。SVD 证明视频扩散微调后能做多视角生成,与 VDM 论文是两条文献,不要读成同一篇。
- 视频 VAE:把连续帧压缩成低维时空 latent,压缩比与重建质量是核心权衡;3D VAE 的质量直接决定最终画质上限。
- 时间模块的两种做法:插入独立时间注意力(早期路线)vs 联合时空注意力(时空一体);前者省显存、后者一致性更好,当前旗舰倾向后者。
- 采样与蒸馏:与图像同源(DDIM、Flow Matching 等),但视频的步数 × 帧数让采样成本放大,少步采样与蒸馏在视频上收益更大;Flow Matching(可灵等采用)相比传统噪声预测在少步采样下更稳,是 2024 年后的主流选择。
DiT:Diffusion Transformer(Sora 类架构)
用 Transformer 替代 U-Net 做去噪主干。Sora 的公开技术报告勾勒的路线是:
- 视频压缩网络(3D VAE):把视频在时间与空间两个维度同时压缩,得到时空 patch。
- Patch 化 + DiT:把 patch 展开成 token 序列,交给扩散 Transformer 去噪;视频与图像统一成 patch 集合,从而可以混合分辨率、时长、宽高比训练,也可以生成任意分辨率(横屏到竖屏)。
- 条件输入:文本/图像条件(类似 CLIP 的对齐机制)引导去噪方向;OpenAI 还用内部模型给视频写详细描述(详细字幕是提升文本对齐的关键数据工程),并把用户短提示词自动扩写。
DiT 的价值是让 Scaling Law 在视频上成立:模型越大、数据越多、效果越好:Transformer 架构在视频生成领域延续了 LLM 的扩展性(Sora 技术报告)。
flowchart LR
video["视频 / 图像输入"] --> vae["3D VAE:时空压缩"]
vae --> patches["时空 patch / token"]
text["文本或参考条件"] --> dit["DiT:时空去噪 Transformer"]
patches --> dit
dit --> sample["迭代采样 / Flow Matching"]
sample --> decode["VAE 解码"]
decode --> output["连续视频"]核心关系:视频先被压缩成时空 token,DiT 在文本或参考条件引导下联合建模空间与时间,再解码为连续帧。
自回归视频生成
把视频帧 token 化(VQ-VAE),像语言模型一样逐 token 预测下一帧/下一段。架构简单、可复用 LLM 基建,适合与文本统一建模;但生成质量与长程一致性弱于扩散路线,目前不是主流,主要出现在统一多模态模型的探索中。它的意义不在当下效果,而在视频生成与语言模型共用一套架构的可能性:这与多模态理解的原生化是同一个趋势的两面。
图像模型延展:图生视频
基于成熟文生图模型插入时间模块,输入一张图 + 运动描述生成短视频。成本低、上手快,是开源社区与商业产品的常见起点(如 SVD、AnimateDiff 路线);由于首帧由用户给定,一致性风险大幅前置,图生视频的质量普遍好于文生视频:这也直接影响了产品设计。先出图、再让图动起来,比从零生成整段视频稳得多。
各路线选型速览
| 路线 | 代表 | 优点 | 局限 | 适合 |
|---|---|---|---|---|
| 时空扩散(3D U-Net) | SVD、AnimateDiff | 成熟、可组合图生视频 | 长程一致性一般 | 图生视频、短视频 |
| DiT | Sora、可灵、Open-Sora | 可扩展、Scaling Law 生效 | 算力需求高 | 旗舰级生成 |
| 自回归 | 统一多模态探索 | 与 LLM 架构统一 | 质量与速度弱 | 前沿探索 |
| 图像延展 | 各类图生视频 | 成本低、易上手 | 运动幅度有限 | 快速原型、批量素材 |
训练与数据工程
视频模型的竞争,一半在架构、一半在数据。数据工程是反馈最显著的优化点:
- 数据筛选:排除低质视频(过度编辑、转场频繁、运动不连贯、讲座式、文字主导、屏幕噪声),用光流与美学分数动态调阈值:什么数据进训练集决定模型上限。
- 镜头切分:级联剪辑检测(多帧率、多阈值)识别转场与淡入淡出,确保训练样本是连续运动而不是剪辑拼接。
- 密集字幕标注:视频普遍缺高质量文本描述,标准链路是生成短字幕 → 逐帧生成密集描述 → LLM 总结成最终标签,并用小模型蒸馏分担标注成本:Sora 与 DALL-E 3 都强调详细字幕是文本对齐的关键数据工程。
- 三阶段训练范式(SVD 确立):图像预训练(空间基础)→ 低清视频预训练(运动表征)→ 高清微调(质量提升);后续模型普遍沿用这一由静到动、由粗到精的路径。
- 数据配比:混合图像与视频训练是常见做法(图像补足空间细节、视频提供运动先验);纯视频训练易在单帧质量上吃亏。
- 长宽比与时长多样性:训练数据要覆盖横竖屏、不同时长与运动幅度,否则模型只会生成训练时见过的版式。
- 对产品经理的含义:视频生成的能力差距,相当部分来自数据与标注而不是模型骨架;同样调用量下,自建高质量垂直数据(你的场景视频)微调,效果可能显著优于通用模型。
典型模型现状
以下为 2026-08 现状概览,时长/分辨率/价格变动频繁,以各官方页面为准:
| 模型/产品 | 厂商 | 能力量级(以官方为准) | 备注 |
|---|---|---|---|
| Sora | OpenAI | 1080p、最长数十秒、文/图/视频输入与编辑(Remix/Storyboard/Blend 等) | 首批落地已开放,定位创意工具 |
| Veo | 高清长视频、原生音频、横竖屏与电影感镜头 | 闭源旗舰对照;能力与配额以官方页面为准 | |
| 可灵(Kling) | 快手 | 高清长视频、多主体一致性 | 中文场景强,ConceptMaster 方案公开 |
| Runway | Runway | 文生视频/图生视频 + 专业编辑工具 | 面向创作者工具链 |
| 即梦 / 清影 | 字节 / 智谱 | 短视频快速生成、中文友好 | 与图像生成共用生态 |
| Open-Sora | 开源社区 | 开源 DiT 视频模型路线 | 可本地部署,能力弱于商业旗舰 |
- 共性现状:主流产品普遍支持 1080p、时长从几秒到几十秒,图生视频质量普遍好于文生视频;文字渲染、多人交互、复杂物理(液体、布料、碰撞)仍是弱项;生成时长与分辨率的提升同时带来成本与等待的线性增长,产品要在这个三角里取舍。
- Sora 的产品形态:支持文/图/视频多模态输入,并围绕生成提供编辑工具链(Remix 重混、Re-cut 截取延伸、Storyboard 分镜、Loop 循环、Blend 融合、风格预设),生成 + 编辑一体化是旗舰产品的共同形态(以官方为准)。
- 可灵的技术路线:3D VAE + DiT(时空注意力 + 文本交叉注意力)+ T5-XXL 文本编码 + Flow Matching 采样,多主体一致性(ConceptMaster)是其公开的技术亮点:让多个角色/物体在镜头里保持各自身份正是行业级难题(以官方为准)。
- 国内产品:即梦(字节)、清影(智谱)等与图像生成共用生态,中文提示词理解与文生图 → 图生视频衔接顺滑,价格与功能以官方页面为准。
- 开源路线:Open-Sora 等开源项目复刻 DiT + 3D VAE 路线,能力落后商业旗舰约一代,但胜在可私有化与二次开发(以各官方仓库为准);先跑通开源再决定是否上商业 API 是常见选型路径。
选型对比维度
| 维度 | 要问的问题 |
|---|---|
| 时长与分辨率 | 支持多长、多清晰?价格随哪个参数涨? |
| 文生 vs 图生 | 图生视频质量差异多大?有没有首帧参考能力? |
| 一致性 | 多主体/长镜头表现如何?有没有公开一致性的评测? |
| 编辑能力 | 是否支持局部编辑、延伸、融合?还是只能整段生成? |
| 中文与合规 | 中文提示词理解;内容审核与数据政策是否符合要求? |
| 价格与等待 | 单条约多少钱、多久出片?批量有没有优惠? |
视频理解
生成页不展开理解能力。逐帧审核、时序定位、长视频抽帧与成本策略见 多模态理解 的视频一节。理解编码器与生成压缩网络同源,进步会互相外溢,但产品验收仍按任务拆开:生成看运动一致性与指令遵循,理解看事件召回与时间轴误差。
视频编辑与数字人
这些是比从零生成更成熟的商用场景,本质是在已有素材上做受控改动:
- 局部编辑与风格迁移:文本驱动的局部修改(换背景、换物体、去物)、风格迁移(真人转动画)、深度条件编辑:常用 DDIM 反演把原视频映射回噪声空间,在去噪过程中注入编辑条件,保住原结构只改目标属性;ControlNet 类结构控制在视频上同样适用(注入姿态/深度条件,如 ControlVideo)。
- 数字人:
- 口型同步:给定音频驱动口型,让虚拟人说任意内容,是口播、客服、直播的基础能力;口型与音频的同步精度(音画对齐)是体验关键,延迟补偿要按帧调。
- 动作驱动:用动捕数据或参考视频驱动虚拟人动作;上半身动作 + 口型 + 手势组合是口播场景的常见形态。
- 声音合成:配合 语音与音频 的 TTS 与音色克隆,数字人 = 虚拟形象 + 声音 + 动作三件套;三者的一致感(形象、语气、动作节奏匹配)决定真实感。
- 商用成熟度:营销口播、数字人客服、直播电商已规模商用;音色授权与深度伪造监管是合规重点:克隆真人形象与声音必须授权,生成内容要可标识。
- 虚拟试衣:人体视频生成的重要落地:给定衣服图与人物视频,把衣服穿上并保持动作自然,电商试衣场景潜力大,但遮挡、材质、动态褶皱仍是难点;当前成熟形态多为静态试衣 + 简单动作,动态复杂动作仍需打磨。
数字人技术分层与产品取舍
| 层 | 技术 | 成熟度 | 产品注意 |
|---|---|---|---|
| 形象 | 3D 建模 / 2D 视频数字人 / 真人克隆 | 高 | 真人克隆需授权;2D 数字人成本低、更新快 |
| 声音 | TTS + 音色克隆 | 高 | 音色授权、语气一致性,见 语音与音频 |
| 口型 | 音频驱动口型(音画对齐) | 中高 | 延迟补偿、口型误差的恐怖谷 |
| 动作 | 动捕 / 视频驱动 / 程序化 | 中 | 手势与表情是真实感关键 |
| 交互 | 实时对话(打断、多轮) | 中 | 参考 语音与音频 的延迟预算 |
产品取舍:to B 口播用 2D 数字人 + 成熟 TTS 最快上线;直播电商要实时交互,对延迟与打断的要求上一个台阶;品牌级虚拟代言人则走 3D 高精 + 定制训练,成本最高、差异也最大。
数字人产品的真实感是一条 U 形曲线:不像真人时用户当它是卡通,接近真人但差一点时进入恐怖谷,用户反而反感;上线前做用户观感测试,比技术指标更能发现问题。
视频编辑的常用技术手段
- DDIM 反演:把输入视频反演回噪声空间,在去噪过程中注入编辑条件:先变回噪声再重画的思路保住了原结构,只改目标属性。
- 结构条件注入:ControlNet 类控制(姿态/深度/边缘)在视频上同样适用,配合时间一致性约束避免逐帧抖动。
- 关键帧 + 补帧:只对关键帧做重绘/生成,中间帧用光流或插值补全:成本可控,是编辑类产品的主流工程取舍。
- 逐帧一致性检查:编辑后的视频要做跨帧一致性自动检测(闪烁、突变、身份漂移),这是编辑产品比生成产品更依赖的质检环节。
典型工作流拆解
flowchart LR
asset["首帧 / 产品素材"] --> motion["运动与镜头描述"]
motion --> generate["图生视频 / 文生视频"]
asset --> generate
generate --> candidates["多条候选"]
candidates --> inspect["完整运动检查"]
inspect -->|合格| edit["剪辑 / 配音 / 字幕"]
inspect -->|不合格| retry["降时长 / 降分辨率 / 重生成"]
retry --> generate
edit --> audit["授权 / 内容审核 / 标识"]
audit --> publish["发布"]核心关系:视频产品先固定素材与首帧,再生成运动,经过完整时序质检、编辑和合规审核后发布。
口播数字人视频
- 文案 → TTS 生成配音(选音色、调语速,见 语音与音频)。
- 选择/克隆形象 → 口型驱动 + 动作模板(镜头、手势)。
- 渲染合成:形象 + 配音 + 字幕/BGM 合成一条视频。
- 审核:内容合规、形象授权、口型对齐检查。
- 批量变体:同一文案换音色/形象/背景,生成 A/B 版本投放。
电商产品动态视频
- 产品白底图(可来自 图像生成 的工作流)→ 图生视频。
- 运动描述:旋转展示、场景化动态(桌面、户外、使用场景)。
- 生成多条候选(不同运动/场景)→ 人工挑片。
- 拼接 + 配乐 + 字幕 → 投放;不满意局部用关键帧 + 重生成返工。
两个工作流的共同纪律:先确定首帧/素材,再谈运动;每步有检查点,失败有返工路径。
产品视角
适用场景
- 营销素材:广告片初稿、多版本 A/B 素材、电商短视频批量生成:AI 出草稿与变体,人工精修定稿;AI 出 20 版、投放团队选 2 版比 AI 直接交付 1 版现实得多。典型路径:产品图 → 动态展示(旋转/环绕/场景化)→ 多版配色与文案 → 投放测试。
- 产品预览:虚拟场景演示、效果图动起来(家装、建筑漫游),接受度较高,因为示意属性天然容忍不完美;先静态后动态的两段式(静态渲染确认构图,再让 AI 加运动)能把返工成本压到最低。
- 短视频辅助:口播数字人、图文转视频、剪辑辅助(长视频切条),是当前最稳的落地形态:把 AI 放在辅助位置而不是全自动生成位置。
- 教育与培训:讲义动画化、操作演示生成、虚拟讲师,接受度高,是低成本出视频场景的代表。
不适场景
高保真商业成片(品牌 TVC、电影镜头)、对物理真实性和一致性要求极高的场景:AI 直接生成大概率翻车,应定位为前期概念与草稿而不是成品;医疗、安防等对误报零容忍的领域,AI 生成内容只做辅助示意。另一个容易被忽视的不适场景是事实性内容(新闻、教程中的数字与操作):画面细节会被脑补,事实类视频必须人工核对每个事实点,或干脆不用生成画面。
成本与延迟
- 单条视频成本随分辨率、时长、步数上升,商业 API 按条计费,量级远高于图像(以官方页面为准);批量场景要排队架构与异步任务设计:提交任务 → 轮询结果而不是同步等待。
- 生成耗时从几十秒到几分钟,交互设计上要管理等待预期(进度条、先出首帧预览);先出图再动起来的两段式管线可以把图不好看的失败前置到低成本的图像阶段。
- 成本算例(量级参考):同样时长与分辨率下,视频单条成本 = 帧数 × 单帧生成成本 + 时序建模开销,通常比图像贵一个数量级以上;批量投放(多版本 A/B)要先把生成成本 × 转化收益的账算清楚,再决定出几版。
一致性边界
长镜头(人物多次进出画面)、多人交互、复杂动作仍弱;规避策略:短镜头、单主体、图生视频起步,用先图后动把一致性风险前置消化;同一主体批量出多条视频时,用固定首帧 + 固定提示词模板保持基线一致。要主动向用户/客户说明一致性边界。预期管理是视频生成产品最重要的非技术工作之一,把边界写在产品文档里,能避免客户拿一致性要求当 bug 投诉。
版权与内容安全
- 深度伪造监管:生成真人视频需要授权与标识,主流平台强制内容水印/溯源(C2PA 类机制);相关法规持续收紧,产品要预留标识能力(不可见水印、元数据)。
- 训练数据版权:视频生成模型的训练数据争议与图像同源,商用评估法律风险。
- 内容审核:生成视频上线前必须过内容安全审核,和平台内容治理同一套标准:生成即审核应做成管线内步骤,而不是发布前补一刀。
- 素材版权:输入的参考素材(图片、BGM、模板)本身的授权也要查:AI 生成的视频不豁免素材侵权,输入端与输出端各查一遍。
- 数字人专项合规:数字人直播/口播涉及形象 + 声音双重授权,且多平台要求数字人内容显著标识;平台政策变化快,上线前逐平台核对规则。
产品化的落地清单
- 定位:想清楚草稿工具还是成品工具,并按定位设预期
- 成本:按条成本 × 月用量算过账,批量场景有异步队列
- 质量:可用率/返工率基线 + 人工抽检流程,运动质量有人看
- 一致性:单主体/短镜头起步,固定首帧与模板策略就位
- 合规:形象与音色授权、水印与标识、数字人平台规则核对
- 审核:生成即审核的管线内步骤上线
视频生成的三个「不要」
不要承诺全自动出成片(一致性不支持);不要用生成视频做事实性内容(细节会编);不要忽略水印与标识(合规会找上门)。
给产品经理的最终建议
视频生成落地的正确姿势:定位草稿与素材工具、先图后动、短镜头单主体、每步有检查点、合规与标识前置。
用可用率 + 返工率 + 一致性问题清单验收,而不是用演示片定方案:这条纪律比追任何新模型都值钱。
练习
为一个口播数字人营销视频产品画一条生成管线(素材输入 → 数字人驱动 → 审核 → 发布),标出每步的成本与失败点,并说明你会如何设计人工终审环节。
进阶题:设计 10 条一致性验收用例(人物出画再入画、多人同框、物体遮挡),并定义每条通过/失败标准;再估算日生成 500 条、每条 10 秒 1080p 的月成本量级,给出你推荐的降本路径。
常见坑与排错
- 拿首帧当成品验收:视频的失败藏在运动里(手指扭动、影子漂移、物体穿模),只看首帧截图验收会被骗:验收必须看完整运动。
- 时长硬撑:模型只保证短片段稳定,强行拉长视频会越到后面越崩;短片段 + 剪辑拼接比一条长视频可靠得多。
- 运动幅度与质量成反比:提示词要求剧烈运动时,崩的概率显著上升;静态/微动场景可用性高,动作越大越要人工盯。
- 忽略音频轨:很多产品只做画面不做声音,成品像默片;配音、BGM、口型对齐要提前规划,见 语音与音频。
- 批处理不做一致性约束:同一批视频(同一产品不同场景)各生成各的,产品外观漂移:固定首帧、固定提示词模板、同一参考图是标配。
- 不设失败重试与降级:生成失败(黑屏、崩坏、超时)要有自动重试与降级策略(降分辨率/降时长),否则线上体验不可控。
- 忽略分辨率与码率的工程链:生成 1080p 不等于交付 1080p:转码、码率、平台压缩会再损一遍画质;生成规格 × 交付规格要分开定义。
- 把演示片段当能力基线:模型演示都是精心挑选的样本,真实场景的长尾(复杂背景、小众物体、多语言)要自建用例集实测,别拿演示片写进方案。
- 跨平台规则不一致:同一段生成视频在不同平台的内容政策、标识要求、水印规则不同,一份素材全网发在合规上不成立。
- 忽视生成日志与溯源:谁在什么时间、用什么提示词生成了哪条视频,要有日志可查:出了合规问题,查不到比有问题更致命。
- 不做效果回归:模型升级或提示词模板改动后,要重跑同一批验收用例,防止这次升级把运动质量搞崩了:视频模型迭代快,回归是常态工作。
- 把生成时长当体验上限:几分钟的生成等待不设计进度反馈与首帧预览,用户会在等待中流失;异步任务 + 通知 + 预览图是标准体验。
- 忽略并发与队列:批量生成高峰期的排队时间会远超单条生成时间,峰值并发 × 单条时长的容量规划要提前做,否则线上体验崩在投放季。
- 提示词照搬图像经验:视频提示词要写运动与镜头(缓慢推进、人物向左走、镜头跟随),只写静态画面描述会得到动不起来的视频。
未来趋势
- 时长与分辨率继续爬升:长镜头一致性是各家的主战场,分钟级可用会从旗舰下放到大众产品。
- 多模态输入驱动:文案 + 图 + 音频 + 风格参考一次生成,脚本到成片的自动化程度提升。
- 可控性追平图像:ControlNet 类结构控制、角色一致性在视频上普及,视频版可控生成是下一个产品红利。
- 端侧与实时:视频生成的轻量化与流式生成,让实时换装、实时特效成为可能,直播与社交场景打开新空间。
- 评估标准化:视频评测(FVD 之外的运动质量、一致性指标)会随行业成熟而标准化,可复现的验收基准是产品与供应商博弈的关键工具。
- 世界模型叙事:生成模型向可交互世界模拟演进,游戏与仿真场景是长期想象,短期仍以内容生产力为主。
- 多模态统一:文本、图像、视频、音频在同一套模型里互相引用(图驱动视频、语音驱动形象),一次描述、全形态产出逐步成为现实。
来源说明
本文为原创整理,原理与模型信息参考以下来源,访问验证日期 2026-08-23;模型能力与价格变动频繁,以各官方页面为准。
- Video Diffusion Models:视频扩散模型奠基论文。
- Sora 技术报告:视频压缩网络 + DiT 架构与世界模拟器定位。
- DDPM:扩散模型原理基础(视频扩散同源)。
- AIGC 面试书视频系列笔记(
sources/video/):仅供维护者交叉验证,读者以 VDM、Sora 技术报告等公开来源为准。 - 站内:图像生成、多模态理解、语音与音频、模型能力与边界。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用