这两年,AI视频突然就火了。

从Sora到Runway,从Pika到可灵,各种AI视频生成工具层出不穷。输入一段文字,或者一张图片,就能生成一段几秒钟甚至几十秒钟的视频,画面逼真,动作流畅,让人惊叹不已。

以前,做视频是一件很专业的事情,需要专业的设备、专业的软件、专业的技能,普通人很难上手。现在,有了AI视频生成工具,任何人都能轻松生成视频,只需要输入一段文字描述就行。

AI视频的普及,速度之快,超出了很多人的预期。这背后,是技术的快速进步和成本的大幅下降。这篇文章我想深入剖析一下AI视频普及的底层原理,从技术架构、训练方法到推理优化、成本下降,聊聊AI视频是怎么从实验室走向大众的。

如果你对AI视频技术感兴趣,或者想了解AI视频生成的底层机制,希望这篇文章能给你一些启发。内容会比较深入,需要一些深度学习的基础,但我会尽量用通俗易懂的语言来解释。

AI视频生成的基本原理

要理解AI视频的普及,首先要理解AI视频生成的基本原理。

AI视频生成,本质上是一个"从噪声到视频"的生成过程。它的核心技术是扩散模型(Diffusion Model),这也是现在AI图像生成和AI视频生成的主流技术。

扩散模型的基本思想很简单:先给一张图片(或一帧视频)不断加噪声,直到它变成完全随机的噪声;然后,训练一个神经网络,学习如何从噪声中一步步去噪,还原出原来的图片(或视频帧)。训练好之后,我们就可以从完全随机的噪声开始,一步步去噪,生成一张全新的图片(或视频帧)。

这个过程,就像雕刻一样。一开始是一块粗糙的石头(噪声),然后一刀一刀地雕刻(去噪),最后变成一个精美的雕像(图片或视频)。

AI图像生成,是生成一张图片;AI视频生成,是生成一段视频,也就是一系列连续的图片帧。视频和图片的区别在于,视频不仅每一帧要清晰,帧与帧之间还要连贯,动作要流畅,不能出现闪烁和跳变。

所以,AI视频生成,比AI图像生成更难。它不仅要生成清晰的画面,还要保证时间维度上的连贯性。这就需要在模型架构和训练方法上做一些特殊的设计。

目前,AI视频生成主要有两种技术路线:一种是基于扩散模型的直接生成,另一种是基于图像生成模型的帧间插值。

基于扩散模型的直接生成,就是把视频看成一个整体,直接用扩散模型生成整段视频。这种方法的优点是生成的视频质量高,连贯性好;缺点是计算量大,训练和推理成本高。Sora、Runway Gen-3等主流模型,用的都是这种方法。

基于图像生成模型的帧间插值,是先用图像生成模型生成关键帧,然后用插值模型生成中间帧,把关键帧连起来,形成视频。这种方法的优点是计算量小,成本低;缺点是视频质量和连贯性相对差一些。一些早期的AI视频工具,用的是这种方法。

现在,随着技术的进步,基于扩散模型的直接生成已经成为主流,视频的质量和连贯性都有了很大的提升。

AI视频生成的模型架构

了解了基本原理之后,我们来看看AI视频生成的模型架构。

AI视频生成模型,一般由几个部分组成:文本编码器、视频生成网络(去噪网络)、视频解码器(VAE)。

第一部分是文本编码器。

文本编码器的作用,是把输入的文字描述,转换成模型能理解的向量表示。因为视频生成模型不能直接理解文字,需要先把文字转换成向量。

文本编码器一般用的是预训练的大语言模型,比如T5、CLIP的文本编码器等。这些模型,已经在大量的文本数据上预训练过,能很好地理解文字的语义。输入一段文字,文本编码器会输出一个向量序列,这个向量序列包含了文字的语义信息。

在视频生成的过程中,文本编码器的输出会作为条件,引导视频生成网络生成符合文字描述的视频。比如,输入"一只猫在草地上奔跑",文本编码器会把这句话转换成向量,视频生成网络根据这个向量,生成一只猫在草地上奔跑的视频。

第二部分是视频生成网络(去噪网络)。

视频生成网络是整个模型的核心,它的作用是从噪声中一步步去噪,生成视频。这个网络一般用的是3D U-Net或者Transformer架构。

3D U-Net是在2D U-Net的基础上,增加了时间维度。2D U-Net处理的是二维的图片,3D U-Net处理的是三维的视频(高度、宽度、时间)。3D U-Net能同时捕捉空间维度和时间维度的信息,保证生成的视频不仅画面清晰,而且帧与帧之间连贯。

Transformer架构,是把视频看成一系列的patch(图像块)序列,用Transformer来处理。Sora用的就是这种架构,它把视频压缩成一系列的latent patch,然后用Transformer来建模这些patch之间的关系,包括空间关系和时间关系。这种方法的优点是扩展性好,能处理更长的视频和更高的分辨率。

视频生成网络在去噪的过程中,会接收文本编码器的输出作为条件,还会接收时间步(当前是第几步去噪)作为条件。通过这些条件,网络能知道"要生成什么样的视频"和"现在去噪到哪一步了",从而一步步生成符合要求的视频。

第三部分是视频解码器(VAE)。

视频生成网络生成的视频,是在latent空间(隐空间)中的,不是真实的像素空间。需要用视频解码器(VAE的解码器),把latent空间的视频,解码成真实的像素视频。

VAE(变分自编码器),由编码器和解码器组成。编码器把真实的视频压缩成latent表示,解码器把latent表示还原成视频。在训练的时候,用编码器压缩视频,用视频生成网络在latent空间去噪;在推理的时候,视频生成网络在latent空间生成视频,用解码器还原成真实视频。

用latent空间而不是像素空间,主要是为了降低计算量。视频的像素数据量很大,直接在像素空间生成,计算量太大。用VAE把视频压缩到latent空间,数据量会大大减少,计算量也会相应减少。

这三个部分,文本编码器、视频生成网络、视频解码器,共同组成了AI视频生成模型。输入一段文字,经过文本编码器编码,视频生成网络在latent空间去噪生成视频,视频解码器解码成真实视频,就得到了最终的输出。

AI视频生成的训练方法

模型架构设计好了之后,还需要用大量的数据来训练,才能生成高质量的视频。AI视频生成的训练,是一个非常复杂和昂贵的过程。

训练数据,是AI视频生成的基础。要训练一个好的视频生成模型,需要大量高质量的视频数据,包括电影、电视剧、短视频、动画等。这些视频数据,需要经过清洗、标注、筛选,才能用于训练。

数据的质量和数量,直接决定了模型的上限。数据越多、质量越高,模型生成的视频就越好。Sora之所以效果好,一个重要原因就是它用了大量高质量的视频数据来训练。

训练过程,一般分为几个阶段。

第一阶段是预训练。在大量的视频数据上,用扩散模型的目标函数来训练模型。目标是让模型学会从噪声中还原视频。这个阶段,模型会学习到视频的基本规律,比如物体的形状、颜色、运动方式,场景的布局,光影的变化等。

预训练是最耗时、最耗算力的阶段。训练一个大的视频生成模型,可能需要几千甚至上万张GPU,训练几个月。算力成本,可能高达几千万甚至上亿。这也是为什么只有大公司才能训练大模型的原因。

第二阶段是微调。在预训练的基础上,用一些特定的数据或者特定的目标来微调模型,让模型在某些方面表现更好。比如,用更高质量的视频数据微调,提升视频的画质;用特定风格的视频数据微调,让模型能生成特定风格的视频;用图文对数据微调,提升文本和视频的对齐度。

微调的算力成本,比预训练低很多,但也需要不少的算力。通过微调,可以让模型在特定场景下表现更好,更符合用户的需求。

第三阶段是对齐。用人类反馈强化学习(RLHF)或者类似的方法,让模型的输出更符合人类的偏好。比如,让生成的视频更美观、更真实、更符合文字描述。这个阶段,需要人类对模型的输出进行评分和排序,用这些反馈来训练模型。

对齐阶段,虽然算力成本不高,但需要大量的人力来做标注和评分。通过对齐,可以显著提升用户的体验,让模型的输出更符合人类的审美和需求。

训练过程中,还有很多技术细节,比如学习率的调度、梯度累积、混合精度训练、分布式训练等。这些技术,都是为了让训练更稳定、更高效。

总的来说,AI视频生成的训练,是一个数据密集、算力密集、人力密集的过程。需要大量的高质量数据、大量的GPU算力、大量的人力投入。这也是AI视频生成技术门槛高的原因。

AI视频推理的优化方法

模型训练好之后,就可以用来生成视频了,这个过程叫做推理。推理的成本和速度,直接决定了AI视频能不能普及。

早期的AI视频生成,推理成本很高,生成一段几秒钟的视频,可能需要几分钟甚至几十分钟,成本也很高。这样的成本和速度,只能在实验室里用,没法普及给普通用户。

这两年,AI视频的推理成本大幅下降,速度大幅提升,这是AI视频能普及的重要原因。推理优化,主要有以下几个方面。

第一,模型压缩和量化。

模型压缩,是通过剪枝、蒸馏等方法,减少模型的参数数量和计算量,让模型更小、更快。剪枝是去掉模型中不重要的参数,蒸馏是用大模型来训练小模型,让小模型学到大模型的能力。

量化,是把模型的参数从高精度(比如FP32)转换成低精度(比如FP16、INT8、INT4),减少计算量和内存占用。低精度的计算,比高精度快很多,也更省内存。现在,很多推理框架都支持量化,能在几乎不损失质量的情况下,大幅提升推理速度。

通过模型压缩和量化,可以把模型的体积缩小几倍甚至几十倍,推理速度提升几倍甚至几十倍,成本也相应下降。

第二,推理调度和批处理。

视频生成的推理,是一个迭代的过程,需要一步步去噪。每一步去噪,都需要一次前向计算。如果一次只处理一个请求,GPU的利用率会很低,因为GPU的算力很强,一个请求用不完。

通过批处理(Batch Processing),把多个请求放在一起处理,可以提高GPU的利用率,降低单位请求的成本。比如,一次处理8个请求,GPU的利用率会高很多,每个请求的成本就降下来了。

还有连续批处理(Continuous Batching),就是动态地把新的请求加入到正在处理的批次中,而不是等整个批次处理完再处理下一批。这样可以进一步提高GPU的利用率,降低延迟。

通过合理的推理调度和批处理,可以大幅提高GPU的利用率,降低推理成本。

第三,采样步数优化。

扩散模型的推理,需要一步步去噪,步数越多,生成的质量越高,但速度也越慢。早期的模型,可能需要50步甚至100步才能生成高质量的视频。现在,通过一些采样方法的优化,可以用更少的步数生成同样质量的视频。

比如,DDIM、DPM-Solver等采样器,能用更少的步数达到更好的效果。还有一些蒸馏方法,比如LCM(Latent Consistency Models),能把采样步数压缩到几步甚至一步,速度提升几十倍。

通过采样步数优化,可以在保证质量的前提下,大幅减少计算量,提升推理速度,降低成本。

第四,KV缓存和注意力优化。

对于基于Transformer架构的视频生成模型,注意力计算是瓶颈。注意力计算的复杂度,和序列长度的平方成正比。视频的序列长度很长,注意力计算的开销很大。

通过KV缓存,可以把之前计算过的Key和Value缓存起来,避免重复计算,减少计算量。还有一些注意力优化方法,比如FlashAttention、PagedAttention等,能减少内存访问,提升注意力计算的效率。

通过这些优化,可以大幅提升Transformer模型的推理速度,降低成本。

第五,硬件加速。

硬件的进步,也是推理成本下降的重要原因。新一代的GPU,比如NVIDIA的H100、H200、B200,算力越来越强,专门针对AI推理做了优化,能效比越来越高。用新一代的GPU推理,速度更快,成本更低。

还有专门的AI推理芯片,比如Google的TPU、亚马逊的Inferentia、国内的各种AI芯片等,这些芯片专门针对AI推理设计,能效比比通用GPU更高,成本更低。

通过硬件加速,可以进一步提升推理速度,降低成本。

通过以上这些优化方法,AI视频的推理成本,这两年下降了几十倍甚至上百倍。以前生成一段视频可能要几十块钱,现在只要几毛钱甚至几分钱。成本的大幅下降,是AI视频能普及的关键。

AI视频普及的其他因素

除了技术进步和成本下降,AI视频的普及,还有其他一些因素。

第一,用户体验的提升。

早期的AI视频生成工具,用户体验很差。需要写复杂的prompt,生成的视频质量不稳定,经常出现畸形、闪烁、跳变等问题,生成速度也很慢。普通用户很难上手,生成的效果也不好。

现在,AI视频生成工具的用户体验有了很大的提升。界面更友好了,操作更简单了,不需要写复杂的prompt,用自然语言描述就行。生成的视频质量也越来越高,畸形、闪烁等问题越来越少。生成速度也越来越快,几秒钟就能生成一段视频。

用户体验的提升,降低了使用门槛,让更多的人愿意用、会用AI视频工具。

第二,应用场景的丰富。

AI视频的应用场景,越来越丰富。从短视频创作、广告营销、教育培训到影视制作、游戏开发、虚拟现实,AI视频都能发挥作用。

比如,短视频创作者,可以用AI视频快速生成素材,提高创作效率;广告营销人员,可以用AI视频快速生成广告片,降低制作成本;教育培训,可以用AI视频生成教学视频,让教学更生动;影视制作,可以用AI视频生成特效和预览,提高制作效率。

应用场景的丰富,让AI视频不再是一个"玩具",而是一个真正有用的工具。越来越多的人,因为工作需要,开始使用AI视频工具。

第三,生态的建设。

AI视频的生态,也在逐步建设中。各大平台,都在开放API,让开发者可以基于AI视频能力开发应用。还有很多第三方工具和插件,能和AI视频工具集成,拓展AI视频的应用场景。

生态的建设,让AI视频的能力,能融入到更多的产品和工作流中。比如,视频编辑软件集成了AI视频生成功能,用户可以在编辑视频的时候直接用AI生成素材;设计软件集成了AI视频功能,设计师可以直接生成动态设计稿。

生态的繁荣,进一步推动了AI视频的普及。

第四,社会认知的提升。

这两年,随着AI的火热,社会对AI的认知也在提升。越来越多的人,知道了AI能做什么,愿意尝试AI工具。AI视频,作为AI最直观、最震撼的应用之一,自然也受到了很多人的关注。

很多人,都是因为看到了AI视频生成的惊艳效果,才开始了解和使用AI工具的。社会认知的提升,为AI视频的普及,打下了良好的基础。

AI视频的未来趋势

最后,聊聊AI视频的未来趋势。

第一,视频质量会继续提升。

现在的AI视频,虽然已经很逼真了,但还有很多问题,比如细节不够精细、长视频连贯性不好、复杂动作容易出错等。未来,随着模型的进步和数据的增加,这些问题会逐步解决,视频的质量会继续提升,越来越接近真实拍摄的视频。

第二,视频长度会越来越长。

现在的AI视频,一般只能生成几秒钟到几十秒钟。生成更长的视频,连贯性和质量都会下降。未来,随着模型架构的进步和推理能力的提升,AI视频能生成的长度会越来越长,从几十秒到几分钟,甚至几十分钟。到那时候,AI就能生成完整的短片、电影了。

第三,可控性会越来越强。

现在的AI视频,可控性还不够强。用户只能输入文字描述,生成的结果有一定的随机性,不能精确控制每一个细节。未来,AI视频的可控性会越来越强,用户可以精确控制镜头、动作、表情、光影等,就像用专业的视频编辑软件一样。

第四,多模态融合会越来越深入。

未来的AI视频,不会只是文字生成视频,还会融合图像、音频、3D等多种模态。比如,输入一张图片和一段文字,生成视频;输入一段音频,生成对口型的视频;输入一个3D场景,生成视频。多模态融合,会让AI视频的能力更强大,应用场景更丰富。

第五,成本会继续下降。

随着技术的进步和硬件的升级,AI视频的推理成本会继续下降。未来,生成一段视频的成本,可能会降到几分钱甚至几厘钱。成本的下降,会让AI视频进一步普及,融入到更多的场景中。

第六,监管和规范会逐步完善。

AI视频的普及,也带来了一些问题,比如深度伪造、虚假信息、版权纠纷等。未来,针对AI视频的监管和规范会逐步完善,比如要求AI生成的视频必须标注,禁止用AI视频进行欺诈和造谣,保护原创者的版权等。监管和规范的完善,会让AI视频行业更健康地发展。

写在最后

AI视频的普及,不是偶然的,而是技术进步、成本下降、体验提升、场景丰富等多种因素共同作用的结果。

从扩散模型的基本原理,到视频生成的模型架构,到训练方法,到推理优化,每一个环节的技术进步,都在推动AI视频向前发展。而成本的大幅下降,让AI视频从实验室走向了大众,让每个人都能轻松生成视频。

AI视频,正在改变内容创作的方式。以前,做视频需要专业的团队和设备;现在,一个人、一台电脑、一段文字,就能生成视频。这大大降低了内容创作的门槛,让更多的人能参与到内容创作中来。

当然,AI视频还在发展初期,还有很多问题需要解决,还有很多进步的空间。但它的发展速度,已经超出了很多人的预期。未来,AI视频会变得更强大、更易用、更便宜,会融入到我们生活的方方面面。

作为技术从业者,我们要关注AI视频的技术发展,理解它的底层原理,探索它的应用场景。作为普通用户,我们要拥抱新技术,学会用AI视频工具提升自己的效率和创造力。同时,也要注意AI视频带来的问题,合理使用,遵守规范。

最后用一句话来结束这篇文章:"技术的进步,让创作变得更简单;而真正的创造力,永远来自于人。"

愿AI视频技术,能帮助更多的人,表达自己的创意,讲述自己的故事。