跳转到内容
← AI 人物志
多模态

谢赛宁

Saining Xie

视觉架构 · DiT

谢赛宁是计算机视觉与机器学习研究者,代表工作包括 ResNeXt、ConvNeXt 以及 Diffusion Transformers。他关注模型架构如何影响视觉表示和生成能力。

ResNeXt 研究在残差结构中组织多个相似变换;ConvNeXt 则重新审视卷积网络,把一些现代训练与架构设计用于视觉任务。这些工作说明,比较模型时不仅要看架构名称,还要考虑训练方式与配置是否公平。

在 DiT 研究中,他与 William Peebles 将 Transformer 用作扩散模型的骨干网络,研究这种结构在生成任务中的扩展规律。其工作连接了卷积、注意力和扩散模型,为理解视觉生成系统为什么采用不同骨干提供了依据。