1、基于文本的视频生成
TexttoVideo模型:这类模型能够直接将一段描述性的文字转换成相应的视频片段。这通常涉及到自然语言处理(NLP)和计算机视觉(CV)两方面的技术。
DALLE 2、Imagen Video等:这些是基于扩散模型或变分自编码器的先进系统,可以从文本提示中生成高质量图像甚至是视频序列。
2、深度伪造与换脸技术
FaceSwap/Deepfake:利用深度学习算法实现人脸交换,可以用来制作娱乐性质的内容或是用于影视后期制作中的特效合成。
First Order Motion Model:一种特别有效的面部重演技术,能够让静态图片上的人脸动起来,并模仿给定驱动视频中人物的表情变化。