OpenAI最近新出的 Sora 视频生成模型,效果非常离谱,展示中一分钟的视频没有什么闪烁 看不出什么瑕疵
模型架构依然是类似GPT3 DALLE的DiT(他们说是基于 DALLE3 继续研发的),但是看上去与之前大家的思路(以上一帧图片加噪声为基础来生成下一帧图片)不同,他是直接生成一段噪声视频,然后对整个视频进行降噪;降噪时应该还是通过图片的形式,但是给了很多帧的“上下文”
相关:
研究报告:https://openai.com/research/video-generation-models-as-world-simulators
模型架构依然是类似GPT3 DALLE的DiT(他们说是基于 DALLE3 继续研发的),但是看上去与之前大家的思路(以上一帧图片加噪声为基础来生成下一帧图片)不同,他是直接生成一段噪声视频,然后对整个视频进行降噪;降噪时应该还是通过图片的形式,但是给了很多帧的“上下文”
相关:
研究报告:https://openai.com/research/video-generation-models-as-world-simulators