多模态
William Peebles
Bill Peebles
DiT · 视频生成
William Peebles 是视觉生成研究者,代表工作包括与谢赛宁合作的 DiT。他在伯克利完成博士研究,随后参与视频生成系统研发,其个人主页记录了他在 Sora 项目中的研究角色。
DiT 将 Transformer 用作扩散模型的主要网络结构,把潜在表示拆成图块后进行处理。论文比较模型规模、输入图块等因素与生成质量之间的关系,研究这种架构能否随着计算量增加持续改善。
这项工作的重点是替换扩散过程中的网络骨干,而不是放弃扩散生成。它使注意力架构与去噪训练结合起来,为后来的图像和视频生成模型提供了设计依据,也让语言与视觉生成在模型组件上有了更多共同之处。