跳转至

视频生成

视频生成

视频生成是生成式 AI 里「看起来最接近魔法」、落地却最难的方向:2024 年 Sora 用一段 60 秒连贯视频震撼行业,但直到 2026 年,「生成一段高保真商业成片」依然是未完成的事。本文梳理视频生成为什么难、架构路线、典型模型现状、视频理解、编辑与数字人,以及产品视角的适用场景与边界。建议先读 图像生成 掌握扩散模型基础——视频生成的大部分技术栈与图像同源。

视频生成为什么难

视频生成 = 图像生成 + 时间维度,难点也正来自这个「+时间」:

与图像生成的核心差异

维度图像生成视频生成
输出单张静态图帧序列 + 时间轴
一致性单图内一致即可跨帧身份/位置/运动一致
成本单张几十步去噪帧数 × 步数,高一个量级
数据图文对(十亿级)视频文本对(稀缺、难标注)
验收单图人眼即可必须看完整运动,多轮抽检
失败局部崩坏可重绘局部崩坏往往整段作废

一句话:图像生成是「画对一张画」,视频生成是「导对一场戏」——后者对一致性、成本与验收的要求完全不同,产品设计时不要用图像生成的预期去套视频生成。

  • 时空一致性:物体必须跨帧保持身份与形态——同一张脸不能在第 3 帧换人,杯子放下后不能在第 20 帧自己飞走。模型要在长序列上维持「谁是谁、在哪、在干嘛」的一致,这是视频生成最核心的技术难点,也是与图像生成最大的差异:图像错了可以重画,视频错了整段作废。
  • 计算成本比图像高一个量级:视频是帧的堆叠,训练与推理的显存、算力、数据量都随帧数线性甚至超线性上涨;生成 10 秒 1080p 视频的算力远大于生成一张图,推理时间从几十秒到几分钟不等。
  • 数据稀缺且难标注:高质量、带详细文本描述的连续视频远比图文对稀缺;视频要切镜头(去掉转场)、滤低质、写密集字幕,数据工程成本极高——可以说视频生成的上限被「高质量视频数据」卡着。
  • 物理与因果直觉:运动要符合常识——重力、遮挡、动作连贯、物体交互。模型实际上是在学「世界如何运作」,这也是 Sora 技术报告自称「世界模拟器」的原因;同时也意味着任何违反物理直觉的生成都会被一眼识破。

评估指标:视频有自己的尺子

图像指标(FID、CLIP Score 等)只能衡量单帧质量,视频要额外看「动起来对不对」:

指标衡量什么说明
FVD(Frechet Video Distance)生成视频与真实视频的分布距离视频版 FID,同时看帧质量与时间连贯
运动一致性物体跨帧运动是否连贯、符合物理轨迹平滑性、速度/加速度合理性
指令遵循生成内容与提示词的对齐度主体、数量、动作是否正确
时序连贯帧间是否突变、闪烁、穿帮镜头稳定、遮挡合理
人工评估感官质量、物理模拟、封面质量CogVideoX 论文式的四维打分是常见做法
业务指标可用率、返工率、生成失败率决定产品能不能上线

注意:视频生成指标与「真实视频数据集」对比才有意义——拿「动得慢 = 更连贯」当优化目标,会得到静态幻灯片;人工评估仍是最终准绳,而且要看「运动质量」而不是只看首帧截图。

常见失败模式

失败模式表现常见于
身份漂移人物/物体中途变样(换脸、换衣)长镜头、出画再入画
肢体崩坏手指、关节扭曲,动作不自然复杂动作、多人交互
物体穿模/瞬移物体穿透、位置跳变遮挡、快速运动
物理违例液体、布料、碰撞不符合直觉复杂物理场景
文字乱码画面中的文字闪烁、拼错含字幕/招牌的场景
首帧失控首帧即崩坏,整段作废文生视频(无参考图)

这些失败模式就是产品验收清单的来源——「逐条设计用例、逐条打标」比随机看几条视频可靠得多。

架构路线

时空扩散:视频扩散模型

把图像扩散扩展到时间维:在视频 VAE 压缩后的潜空间里做 3D 扩散,去噪网络同时处理空间与时间(空间注意力 + 时间注意力)。早期代表 Stable Video Diffusion(SVD,2023):基于 SD 2.1 插入时间卷积与时间注意力层,三阶段训练——图像预训练(建立空间视觉基础)→ 低清视频预训练(学通用运动表征)→ 高清微调;还提出微调节(FPS/运动强度控制)与图生视频的线性增加引导,并证明视频扩散模型微调后能做多视角生成(Video Diffusion Models)。

  • 视频 VAE:把连续帧压缩成低维时空 latent,压缩比与重建质量是核心权衡;3D VAE 的质量直接决定最终画质上限。
  • 时间模块的两种做法:插入独立时间注意力(早期路线)vs 联合时空注意力(时空一体);前者省显存、后者一致性更好,当前旗舰倾向后者。
  • 采样与蒸馏:与图像同源(DDIM、Flow Matching 等),但视频的「步数 × 帧数」让采样成本放大,少步采样与蒸馏在视频上收益更大;Flow Matching(可灵等采用)相比传统噪声预测在少步采样下更稳,是 2024 年后的主流选择。

DiT:Diffusion Transformer(Sora 类架构)

用 Transformer 替代 U-Net 做去噪主干。Sora 的公开技术报告勾勒的路线是:

  1. 视频压缩网络(3D VAE):把视频在时间与空间两个维度同时压缩,得到「时空 patch」。
  2. Patch 化 + DiT:把 patch 展开成 token 序列,交给扩散 Transformer 去噪;视频与图像统一成「patch 集合」,从而可以混合分辨率、时长、宽高比训练,也可以生成任意分辨率(横屏到竖屏)。
  3. 条件输入:文本/图像条件(类似 CLIP 的对齐机制)引导去噪方向;OpenAI 还用内部模型给视频写详细描述(详细字幕是提升文本对齐的关键数据工程),并把用户短提示词自动扩写。

DiT 的价值是让 Scaling Law 在视频上成立:模型越大、数据越多、效果越好——Transformer 架构在视频生成领域延续了 LLM 的扩展性(Sora 技术报告)。

自回归视频生成

把视频帧 token 化(VQ-VAE),像语言模型一样逐 token 预测下一帧/下一段。架构简单、可复用 LLM 基建,适合与文本统一建模;但生成质量与长程一致性弱于扩散路线,目前不是主流,主要出现在「统一多模态模型」的探索中。它的意义不在当下效果,而在「视频生成与语言模型共用一套架构」的可能性——这与多模态理解的原生化是同一个趋势的两面。

图像模型延展:图生视频

基于成熟文生图模型插入时间模块,输入一张图 + 运动描述生成短视频。成本低、上手快,是开源社区与商业产品的常见起点(如 SVD、AnimateDiff 路线);由于首帧由用户给定,一致性风险大幅前置,图生视频的质量普遍好于文生视频——这也直接影响了产品设计:先出图、再让图动起来,比从零生成整段视频稳得多。

各路线选型速览

路线代表优点局限适合
时空扩散(3D U-Net)SVD、AnimateDiff成熟、可组合图生视频长程一致性一般图生视频、短视频
DiTSora、可灵、Open-Sora可扩展、Scaling Law 生效算力需求高旗舰级生成
自回归统一多模态探索与 LLM 架构统一质量与速度弱前沿探索
图像延展各类图生视频成本低、易上手运动幅度有限快速原型、批量素材

训练与数据工程

视频模型的竞争,一半在架构、一半在数据。数据工程是「反馈最显著」的优化点:

  • 数据筛选:排除低质视频(过度编辑、转场频繁、运动不连贯、讲座式、文字主导、屏幕噪声),用光流与美学分数动态调阈值——「什么数据进训练集」决定模型上限。
  • 镜头切分:级联剪辑检测(多帧率、多阈值)识别转场与淡入淡出,确保训练样本是「连续运动」而不是「剪辑拼接」。
  • 密集字幕标注:视频普遍缺高质量文本描述,标准链路是「生成短字幕 → 逐帧生成密集描述 → LLM 总结成最终标签」,并用小模型蒸馏分担标注成本——Sora 与 DALL-E 3 都强调「详细字幕是文本对齐的关键数据工程」。
  • 三阶段训练范式(SVD 确立):图像预训练(空间基础)→ 低清视频预训练(运动表征)→ 高清微调(质量提升);后续模型普遍沿用这一「由静到动、由粗到精」的路径。
  • 数据配比:混合图像与视频训练是常见做法(图像补足空间细节、视频提供运动先验);纯视频训练易在单帧质量上吃亏。
  • 长宽比与时长多样性:训练数据要覆盖横竖屏、不同时长与运动幅度,否则模型会「只会生成训练时见过的版式」。
  • 对产品经理的含义:视频生成的能力差距,相当部分来自「数据与标注」而不是「模型骨架」;同样调用量下,自建高质量垂直数据(你的场景视频)微调,效果可能显著优于通用模型。

典型模型现状

以下为 2026-08 现状概览,时长/分辨率/价格变动频繁,以各官方页面为准:

模型/产品厂商能力量级(以官方为准)备注
SoraOpenAI1080p、最长数十秒、文/图/视频输入与编辑(Remix/Storyboard/Blend 等)首批落地已开放,定位创意工具
可灵(Kling)快手高清长视频、多主体一致性中文场景强,ConceptMaster 方案公开
RunwayRunway文生视频/图生视频 + 专业编辑工具面向创作者工具链
即梦 / 清影字节 / 智谱短视频快速生成、中文友好与图像生成共用生态
Open-Sora开源社区开源 DiT 视频模型路线可本地部署,能力弱于商业旗舰
  • 共性现状:主流产品普遍支持 1080p、时长从几秒到几十秒,图生视频质量普遍好于文生视频;文字渲染、多人交互、复杂物理(液体、布料、碰撞)仍是弱项;生成时长与分辨率的提升同时带来成本与等待的线性增长,产品要在这个三角里取舍。
  • Sora 的产品形态:支持文/图/视频多模态输入,并围绕生成提供编辑工具链(Remix 重混、Re-cut 截取延伸、Storyboard 分镜、Loop 循环、Blend 融合、风格预设),「生成 + 编辑」一体化是旗舰产品的共同形态(以官方为准)。
  • 可灵的技术路线:3D VAE + DiT(时空注意力 + 文本交叉注意力)+ T5-XXL 文本编码 + Flow Matching 采样,多主体一致性(ConceptMaster)是其公开的技术亮点——「让多个角色/物体在镜头里保持各自身份」正是行业级难题(以官方为准)。
  • 国内产品:即梦(字节)、清影(智谱)等与图像生成共用生态,中文提示词理解与「文生图 → 图生视频」衔接顺滑,价格与功能以官方页面为准。
  • 开源路线:Open-Sora 等开源项目复刻 DiT + 3D VAE 路线,能力落后商业旗舰约一代,但胜在可私有化与二次开发(以各官方仓库为准);「先跑通开源再决定是否上商业 API」是常见选型路径。

选型对比维度

维度要问的问题
时长与分辨率支持多长、多清晰?价格随哪个参数涨?
文生 vs 图生图生视频质量差异多大?有没有首帧参考能力?
一致性多主体/长镜头表现如何?有没有公开一致性的评测?
编辑能力是否支持局部编辑、延伸、融合?还是只能整段生成?
中文与合规中文提示词理解;内容审核与数据政策是否符合要求?
价格与等待单条约多少钱、多久出片?批量有没有优惠?

视频理解

与生成共享架构基础——理解了才能生成好,而理解本身也是产品:视频问答、时序事件理解、逐帧分析与审核。

  • 视频问答与摘要:抽帧 + 视觉语言模型(类似 多模态理解 的管线),回答「视频里发生了什么」「第几秒发生了什么」;长视频要用关键帧筛选、分段采样与记忆压缩(如用记忆 token 递归压缩历史片段),直接全量抽帧会爆上下文与成本——工程上按语义切段,每段抽代表帧,再做跨段检索。
  • 时序事件理解:定位事件发生的起止时间(如进球、翻车、违规操作),依赖模型对时间轴的理解,成熟度低于静态图像理解,需要专门的时序定位能力与数据;落地时先做「有/无事件」二分类,再做「时间定位」。
  • 逐帧分析与审核:直播/短视频审核、质检流水线是成熟场景——逐帧检测违禁内容、产品缺陷,速度与召回优先,错误容忍度低时配人工复核;审核场景的难点在「长尾违禁形态」,规则库 + 模型 + 人工三层兜底是标配。
  • 架构基础共享:视频理解的编码器(抽帧 + 时间建模)与视频生成的压缩网络同源,理解模型的进步会外溢到生成(更好的字幕与对齐),生成模型的进步也会提升理解(更强的时空建模)——「理解与生成相互促进」在视频领域比图像领域更明显。

视频理解模型的演进(产品视角)

  • 第一代:分析器 + 文本模型——视觉模块负责「看」,LLM 负责「想」,能力边界清晰但耦合弱。
  • 第二代:编码器 + 文本模型——视频编码器输出 token 序列直接进 LLM(如 Video-LLaMA、Video-ChatGPT 路线),能对话但长视频记忆差。
  • 第三代:记忆与检索增强——分段编码 + 记忆 token/缓存检索(如 VideoLLaMB 的递归记忆桥接),长视频「记得住前文」,接近可用。
  • 第四代:统一时空模型——与生成模型共享时空 token 表示,理解与生成一体,是当前前沿方向。

产品启示:选视频理解方案时,「能处理多长的视频、每段多少成本、记忆是否跨段」比「单帧问答准不准」更重要——长视频的可用性由记忆机制决定,而不是由视觉编码器决定。

长视频处理的成本策略

策略做法适用场景代价
均匀抽帧每秒取 1-2 帧粗粒度摘要、审核初筛漏掉瞬间动作
关键帧筛选按场景切变取代表帧事件定位、摘要依赖切变质量
分段 + 记忆压缩分段编码 + 记忆 token 递归长视频问答实现复杂
两段式(先转写/先摘要)音频转写 + 帧摘要再喂模型会议、教程类丢失视觉细节
检索式建帧索引,问答时只取相关段素材库检索问答需检索基建

预算敏感型产品(会议纪要、课程总结)用「音频转写 + 关键帧」两段式最划算;视觉细节重要的场景(体育、安防)才值得为逐帧能力付费。

视频编辑与数字人

这些是比「从零生成」更成熟的商用场景,本质是「在已有素材上做受控改动」:

  • 局部编辑与风格迁移:文本驱动的局部修改(换背景、换物体、去物)、风格迁移(真人转动画)、深度条件编辑——常用 DDIM 反演把原视频映射回噪声空间,在去噪过程中注入编辑条件,保住原结构只改目标属性;ControlNet 类结构控制在视频上同样适用(注入姿态/深度条件,如 ControlVideo)。
  • 数字人:
    • 口型同步:给定音频驱动口型,让虚拟人「说」出任意内容,是口播、客服、直播的基础能力;口型与音频的同步精度(音画对齐)是体验关键,延迟补偿要按帧调。
    • 动作驱动:用动捕数据或参考视频驱动虚拟人动作;「上半身动作 + 口型 + 手势」组合是口播场景的常见形态。
    • 声音合成:配合 语音与音频 的 TTS 与音色克隆,数字人 = 虚拟形象 + 声音 + 动作三件套;三者的「一致感」(形象、语气、动作节奏匹配)决定真实感。
    • 商用成熟度:营销口播、数字人客服、直播电商已规模商用;音色授权与深度伪造监管是合规重点——克隆真人形象与声音必须授权,生成内容要可标识。
  • 虚拟试衣:人体视频生成的重要落地——给定衣服图与人物视频,把衣服「穿上」并保持动作自然,电商试衣场景潜力大,但遮挡、材质、动态褶皱仍是难点;当前成熟形态多为「静态试衣 + 简单动作」,动态复杂动作仍需打磨。

数字人技术分层与产品取舍

技术成熟度产品注意
形象3D 建模 / 2D 视频数字人 / 真人克隆真人克隆需授权;2D 数字人成本低、更新快
声音TTS + 音色克隆音色授权、语气一致性,见 语音与音频
口型音频驱动口型(音画对齐)中高延迟补偿、口型误差的「恐怖谷」
动作动捕 / 视频驱动 / 程序化手势与表情是真实感关键
交互实时对话(打断、多轮)参考 语音与音频 的延迟预算

产品取舍:to B 口播用「2D 数字人 + 成熟 TTS」最快上线;直播电商要「实时交互」,对延迟与打断的要求上一个台阶;品牌级虚拟代言人则走「3D 高精 + 定制训练」,成本最高、差异也最大。

注意:数字人产品的「真实感」是一条 U 形曲线——不像真人时用户当它是卡通,接近真人但差一点时进入「恐怖谷」,用户反而反感;上线前做用户观感测试,比技术指标更能发现问题。

视频编辑的常用技术手段

  • DDIM 反演:把输入视频「反演」回噪声空间,在去噪过程中注入编辑条件——「先变回噪声再重画」的思路保住了原结构,只改目标属性。
  • 结构条件注入:ControlNet 类控制(姿态/深度/边缘)在视频上同样适用,配合时间一致性约束避免逐帧抖动。
  • 关键帧 + 补帧:只对关键帧做重绘/生成,中间帧用光流或插值补全——成本可控,是编辑类产品的主流工程取舍。
  • 逐帧一致性检查:编辑后的视频要做「跨帧一致性」自动检测(闪烁、突变、身份漂移),这是编辑产品比生成产品更依赖的质检环节。

典型工作流拆解

口播数字人视频

  1. 文案 → TTS 生成配音(选音色、调语速,见 语音与音频)。
  2. 选择/克隆形象 → 口型驱动 + 动作模板(镜头、手势)。
  3. 渲染合成:形象 + 配音 + 字幕/BGM 合成一条视频。
  4. 审核:内容合规、形象授权、口型对齐检查。
  5. 批量变体:同一文案换音色/形象/背景,生成 A/B 版本投放。

电商产品动态视频

  1. 产品白底图(可来自 图像生成 的工作流)→ 图生视频。
  2. 运动描述:旋转展示、场景化动态(桌面、户外、使用场景)。
  3. 生成多条候选(不同运动/场景)→ 人工挑片。
  4. 拼接 + 配乐 + 字幕 → 投放;不满意局部用「关键帧 + 重生成」返工。

两个工作流的共同纪律:先确定首帧/素材,再谈运动;每步有检查点,失败有返工路径

产品视角

适用场景

  • 营销素材:广告片初稿、多版本 A/B 素材、电商短视频批量生成——AI 出草稿与变体,人工精修定稿;「AI 出 20 版,投放团队选 2 版」比「AI 直接交付 1 版」现实得多。典型路径:产品图 → 动态展示(旋转/环绕/场景化)→ 多版配色与文案 → 投放测试。
  • 产品预览:虚拟场景演示、效果图动起来(家装、建筑漫游),接受度较高,因为「示意」属性天然容忍不完美;「先静态后动态」的两段式(静态渲染确认构图,再让 AI 加运动)能把返工成本压到最低。
  • 短视频辅助:口播数字人、图文转视频、剪辑辅助(长视频切条),是当前最稳的落地形态——把 AI 放在「辅助」位置而不是「全自动生成」位置。
  • 教育与培训:讲义动画化、操作演示生成、虚拟讲师,接受度高,是「低成本出视频」场景的代表。

不适场景

高保真商业成片(品牌 TVC、电影镜头)、对物理真实性和一致性要求极高的场景——AI 直接生成大概率翻车,应定位为「前期概念与草稿」而不是成品;医疗、安防等对误报零容忍的领域,AI 生成内容只做辅助示意。另一个容易被忽视的不适场景是事实性内容(新闻、教程中的数字与操作):画面细节会被「脑补」,事实类视频必须人工核对每个事实点,或干脆不用生成画面。

成本与延迟

  • 单条视频成本随分辨率、时长、步数上升,商业 API 按条计费,量级远高于图像(以官方页面为准);批量场景要排队架构与异步任务设计——「提交任务 → 轮询结果」而不是同步等待。
  • 生成耗时从几十秒到几分钟,交互设计上要管理等待预期(进度条、先出首帧预览);「先出图再动起来」的两段式管线可以把「图不好看」的失败前置到低成本的图像阶段。
  • 成本算例(量级参考):同样时长与分辨率下,视频单条成本 = 帧数 × 单帧生成成本 + 时序建模开销,通常比图像贵一个数量级以上;批量投放(多版本 A/B)要先把「生成成本 × 转化收益」的账算清楚,再决定「出几版」。

一致性边界

长镜头(人物多次进出画面)、多人交互、复杂动作仍弱;规避策略:短镜头、单主体、图生视频起步,用「先图后动」把一致性风险前置消化;同一主体批量出多条视频时,用固定首帧 + 固定提示词模板保持基线一致。要主动向用户/客户说明一致性边界——「预期管理」是视频生成产品最重要的非技术工作之一,把边界写在产品文档里,能避免「客户拿一致性要求当 bug 投诉」。

版权与内容安全

  • 深度伪造监管:生成真人视频需要授权与标识,主流平台强制内容水印/溯源(C2PA 类机制);相关法规持续收紧,产品要预留标识能力(不可见水印、元数据)。
  • 训练数据版权:视频生成模型的训练数据争议与图像同源,商用评估法律风险。
  • 内容审核:生成视频上线前必须过内容安全审核,和平台内容治理同一套标准——「生成即审核」应做成管线内步骤,而不是发布前补一刀。
  • 素材版权:输入的参考素材(图片、BGM、模板)本身的授权也要查——「AI 生成的视频」不豁免「素材侵权」,输入端与输出端各查一遍。
  • 数字人专项合规:数字人直播/口播涉及「形象 + 声音」双重授权,且多平台要求「数字人内容显著标识」;平台政策变化快,上线前逐平台核对规则。

产品化的落地清单

  • 定位:想清楚「草稿工具」还是「成品工具」,并按定位设预期
  • 成本:按条成本 × 月用量算过账,批量场景有异步队列
  • 质量:可用率/返工率基线 + 人工抽检流程,运动质量有人看
  • 一致性:单主体/短镜头起步,固定首帧与模板策略就位
  • 合规:形象与音色授权、水印与标识、数字人平台规则核对
  • 审核:生成即审核的管线内步骤上线
视频生成的三个「不要」

不要承诺「全自动出成片」(一致性不支持);不要用生成视频做事实性内容(细节会编);不要忽略水印与标识(合规会找上门)。

给产品经理的最终建议

视频生成落地的正确姿势:定位「草稿与素材工具」、先图后动、短镜头单主体、每步有检查点、合规与标识前置。用「可用率 + 返工率 + 一致性问题清单」验收,而不是用演示片定方案——这条纪律比追任何新模型都值钱。

练习

为一个「口播数字人营销视频」产品画一条生成管线(素材输入 → 数字人驱动 → 审核 → 发布),标出每步的成本与失败点,并说明你会如何设计人工终审环节。进阶题:设计 10 条「一致性验收」用例(人物出画再入画、多人同框、物体遮挡),并定义每条通过/失败标准;再估算「日生成 500 条、每条 10 秒 1080p」的月成本量级,给出你推荐的降本路径。

常见坑与排错

  • 拿首帧当成品验收:视频的失败藏在运动里(手指扭动、影子漂移、物体穿模),只看首帧截图验收会被骗——验收必须看完整运动。
  • 时长硬撑:模型只保证短片段稳定,强行拉长视频会「越到后面越崩」;「短片段 + 剪辑拼接」比「一条长视频」可靠得多。
  • 运动幅度与质量成反比:提示词要求「剧烈运动」时,崩的概率显著上升;静态/微动场景可用性高,「动作越大越要人工盯」。
  • 忽略音频轨:很多产品只做画面不做声音,成品像默片;配音、BGM、口型对齐要提前规划,见 语音与音频
  • 批处理不做一致性约束:同一批视频(同一产品不同场景)各生成各的,产品外观漂移——固定首帧、固定提示词模板、同一参考图是标配。
  • 不设失败重试与降级:生成失败(黑屏、崩坏、超时)要有自动重试与降级策略(降分辨率/降时长),否则线上体验不可控。
  • 忽略分辨率与码率的工程链:生成 1080p 不等于交付 1080p——转码、码率、平台压缩会再损一遍画质;「生成规格 × 交付规格」要分开定义。
  • 把「演示片段」当「能力基线」:模型演示都是精心挑选的样本,真实场景的长尾(复杂背景、小众物体、多语言)要自建用例集实测,别拿演示片写进方案。
  • 跨平台规则不一致:同一段生成视频在不同平台的内容政策、标识要求、水印规则不同,「一份素材全网发」在合规上不成立。
  • 忽视生成日志与溯源:谁在什么时间、用什么提示词生成了哪条视频,要有日志可查——出了合规问题,「查不到」比「有问题」更致命。
  • 不做效果回归:模型升级或提示词模板改动后,要重跑同一批验收用例,防止「这次升级把运动质量搞崩了」——视频模型迭代快,回归是常态工作。
  • 把生成时长当体验上限:几分钟的生成等待不设计「进度反馈」与「首帧预览」,用户会在等待中流失;异步任务 + 通知 + 预览图是标准体验。
  • 忽略并发与队列:批量生成高峰期的排队时间会远超单条生成时间,「峰值并发 × 单条时长」的容量规划要提前做,否则线上体验崩在投放季。
  • 提示词照搬图像经验:视频提示词要写「运动」与「镜头」(缓慢推进、人物向左走、镜头跟随),只写静态画面描述会得到「动不起来的视频」。

未来趋势

  • 时长与分辨率继续爬升:长镜头一致性是各家的主战场,「分钟级可用」会从旗舰下放到大众产品。
  • 多模态输入驱动:文案 + 图 + 音频 + 风格参考一次生成,「脚本到成片」的自动化程度提升。
  • 可控性追平图像:ControlNet 类结构控制、角色一致性在视频上普及,「视频版可控生成」是下一个产品红利。
  • 端侧与实时:视频生成的轻量化与流式生成,让「实时换装、实时特效」成为可能,直播与社交场景打开新空间。
  • 评估标准化:视频评测(FVD 之外的运动质量、一致性指标)会随行业成熟而标准化,「可复现的验收基准」是产品与供应商博弈的关键工具。
  • 世界模型叙事:生成模型向「可交互世界模拟」演进,游戏与仿真场景是长期想象,短期仍以内容生产力为主。
  • 多模态统一:文本、图像、视频、音频在同一套模型里互相引用(图驱动视频、语音驱动形象),「一次描述,全形态产出」逐步成为现实。

来源说明

本文为原创整理,原理与模型信息参考以下来源,访问验证日期 2026-08-23;模型能力与价格变动频繁,以各官方页面为准。

  1. Video Diffusion Models:视频扩散模型奠基论文。
  2. Sora 技术报告:视频压缩网络 + DiT 架构与世界模拟器定位。
  3. DDPM:扩散模型原理基础(视频扩散同源)。
  4. AIGC 面试书视频系列笔记(预取资料 sources/video/):视频生成/理解/编辑/数字人技术脉络与可灵、SVD、CogVideoX 等模型要点。
  5. 站内:图像生成多模态理解语音与音频模型能力与边界