多模态
刘壮
Zhuang Liu
ConvNeXt · 网络压缩
刘壮是视觉模型与高效网络研究者,代表工作包括 ConvNeXt 和 Network Slimming。他关注清晰、相对简单的结构设计,研究模型中的哪些改变真正影响效果,以及哪些计算可以省去。
ConvNeXt 重新检查卷积网络的训练与结构设计,在吸收现代训练方法和部分设计经验后,展示纯卷积网络仍具有竞争力。它没有直接把全部卷积换成注意力,而是逐项分析设计选择的作用。
Network Slimming 则在训练过程中鼓励通道级稀疏,再移除不重要的通道,减少模型规模和计算量。这两类工作分别回答如何保留有效结构、如何去掉冗余计算的问题,也让模型架构与部署成本之间的关系更容易被分析。