训练与推理
Jared Kaplan
贾里德·卡普兰
Scaling Laws
Jared Kaplan 的研究连接理论物理与大规模机器学习。他是 2020 年语言模型 Scaling Laws 论文的第一作者,也是 Anthropic 的联合创始人之一。
该研究系统比较模型参数量、训练数据量和计算预算怎样影响语言模型的预测损失。在实验覆盖的范围内,一些关系可以用相对规律的尺度变化描述,从而为训练资源分配提供依据。它将“模型应该多大”转化为需要结合数据与计算一起讨论的问题。
这些规律是特定设置中的经验观察,不是保证所有能力都会按同一速度增长的定律。Kaplan 也参与了 GPT-3 和 Constitutional AI 等研究。其人物脉络可以从模型规模的可预测性,延伸到怎样把能力增长与助手行为的训练结合起来。