多模态
Jiaming Song
DDIM · 可控生成
Jiaming Song 是多模态生成研究者,代表工作包括 DDIM 和 SDEdit。他的研究围绕生成过程的效率与可控性展开,也延伸到图像和视频生成系统。
DDIM 研究如何在沿用 DDPM 训练目标的情况下改变采样过程,减少生成一张图所需的迭代。它不是简单跳过任意步骤,而是构造与原始训练目标相容的生成过程,并比较速度和输出质量的变化。
在 SDEdit 中,他与合作者研究从带噪的用户输入出发生成图像,使草图或已有图片成为约束。他的个人主页还记录了在 Luma 参与多模态模型研发的经历,从采样方法进一步走向用户可以控制和编辑的生成工具。