对齐与评测
John Schulman
约翰·舒尔曼
PPO · RLHF
John Schulman 是强化学习研究者,也是 OpenAI 的联合创始人之一。他的研究关注怎样稳定地改进策略,以及怎样让语言模型更好地遵循人的意图。
他与合作者提出 TRPO 和 PPO 等策略优化方法。PPO 通过限制策略更新的变化幅度,在实现复杂度和训练稳定性之间取得实用的平衡,因此被广泛用于强化学习。它也曾用于语言模型的人类反馈训练。
在 InstructGPT 研究中,他参与把示范数据、回答偏好与强化学习结合起来,改善模型的指令遵循行为。算法本身不会自动定义什么是正确或安全:反馈数据、奖励设计和评价过程仍决定系统最终学习到的行为。