训练与推理
韩松
Song Han
模型压缩 · AWQ
韩松是高效机器学习研究者,长期研究如何让模型在显存、功耗和计算资源受限的设备上运行。他参与的工作包括模型剪枝、量化、硬件感知的架构搜索,以及面向大语言模型的推理加速。
在 AWQ 中,团队利用激活信息识别对模型输出更重要的权重通道,并通过缩放降低低比特量化造成的误差。目标是缩小模型占用,同时避免简单地把所有权重等同处理后损失过多质量。
他参与的 Once-for-All 研究则先训练一个包含多种子网络的网络,再根据设备约束选择合适版本,而不必为每台设备从头训练。配套的 EfficientML 教学材料也把这些模型、系统和硬件之间的取舍介绍给开发者。