训练与推理
Noam Shazeer
诺姆·沙泽尔
稀疏 MoE · Transformer
Noam Shazeer 是语言模型架构与计算效率领域的重要研究者,也是 Transformer 原论文的共同作者。他的代表工作包括稀疏混合专家网络,以及减少注意力计算和存储开销的方法。
2017 年,他与合作者提出稀疏门控 MoE 层:模型拥有许多专家子网络,但每个输入只交给少量专家处理。这样可以增加总参数容量,而不必让单次计算成本同比增长。专家如何被选择、如何保持负载均衡,也是这种结构需要处理的问题。
他还提出 Multi-Query Attention,让多个注意力查询头共享键和值,减少自回归生成中的内存访问。与单纯扩大模型相比,这些工作关注的是怎样更有效地使用参数和硬件资源,对理解今天的 MoE 与高效推理模型很有帮助。