对齐与评测
Long Ouyang
欧阳龙
InstructGPT · 指令遵循
Long Ouyang 是 InstructGPT 论文的第一作者。他与合作者研究的核心问题是:语言模型能够生成流畅文字,并不代表它会按照用户的要求给出有用回答。
2022 年的研究先使用人工示范进行监督微调,再收集人对模型回答的偏好,训练奖励模型并进行强化学习。团队在其评测分布中发现,经过这种训练的小模型也可能比规模大得多的基础模型更受评审者偏好。
这项工作展示了训练目标与反馈方式的重要性,推动了面向用户的指令模型。结果并不意味着参数规模不重要,也不表示模型已经消除错误;它说明“擅长预测文本”和“擅长回应请求”需要不同的训练与评测安排。