跳转到内容
← AI 人物志
对齐与评测

Jan Leike

扬·莱克

可扩展监督 · 模型对齐

Jan Leike 是 AI 对齐研究者,关注如何评价和引导越来越强的模型。他参与的工作包括奖励建模、语言模型的人类反馈训练和可扩展监督。

InstructGPT 将人工示范和回答偏好用于训练,使模型输出更符合用户意图。Leike 是该论文的共同作者。2023 年,他与 Ilya Sutskever 共同领导 OpenAI 的 Superalignment 项目,提出研究人类难以直接评价的任务该如何监督。

这一问题的关键是:如果模型能完成超过评审者能力范围的工作,单靠人工看答案可能不足以保证可靠性。相关研究探索模型辅助评估、行为验证和对抗测试。机构公告中的研究目标应与已经得到实验验证的成果分开理解。