多模态
Aditya Ramesh
阿迪蒂亚·拉梅什
DALL·E · 文生图
Aditya Ramesh 是生成模型研究者,代表工作包括 DALL·E。他参与研究如何让模型根据自然语言描述生成图像,把语言中的对象、属性和关系转化为视觉内容。
2021 年的 DALL·E 工作将文本与图像编码组织为序列,通过生成式模型学习二者之间的关系。后续研究结合 CLIP 表示与扩散生成,进一步探索文本条件下的图像生成方式。
DALL·E 2 进一步利用 CLIP 的图文表示,把文字条件与图像生成联系起来。这条研究路线让用户可以直接用自然语言描述所需图像,而不必先提供草图或类别标签,也推动了可编辑、可交互的生成式图像工具。