跳转到内容
← AI 人物志
对齐与评测

Paul Christiano

保罗·克里斯蒂亚诺

人类偏好学习 · 对齐

Paul Christiano 是 AI 对齐研究者,关注如何让能力不断增强的系统按照人类希望的方式行动。他参与了人类偏好学习和语言模型反馈训练的重要研究。

2017 年,他与合作者研究用人对行为片段的比较来学习奖励函数。人不必为每个动作写出精确的分数,只需比较哪段行为更符合目标,模型再利用这些偏好训练。这为后来 RLHF 的发展提供了重要研究基础。

他也是 InstructGPT 的共同作者。其研究还讨论复杂任务如何获得可靠监督,以及模型是否会利用奖励中的漏洞。理解这条路线需要区分“更符合收集到的偏好”和“在所有情况下都符合人的真实目标”,二者并不等价。