多模态
何恺明
Kaiming He
ResNet · 视觉表示
何恺明是计算机视觉研究者,代表工作包括 ResNet、Mask R-CNN 和 Masked Autoencoders。他的研究横跨网络结构、目标识别与自监督视觉学习。
2015 年,他与合作者提出残差学习,用跳跃连接让网络学习相对于输入的变化,缓解深层网络的优化困难。ResNet 成为视觉模型的重要基础,也使残差连接这一设计得到更广泛应用。
他参与的 Mask R-CNN 将目标检测与实例分割结合,既找出图中有哪些物体,也标出每个物体的像素区域;MAE 则让模型通过恢复被遮挡的图像区域学习表示。几项研究分别改进了深层训练、视觉识别和无标注数据的利用方式。