跳转到内容
← AI 人物志
对齐与评测

Dylan Hadfield-Menell

迪伦·哈德菲尔德-梅内尔

人机协作 · 价值学习

Dylan Hadfield-Menell 研究人机协作与 AI 对齐,关注系统如何在不完全知道人类目标的情况下作出决策。他的工作把目标的不确定性本身纳入模型。

在 Cooperative Inverse Reinforcement Learning 中,他与合作者把人与机器之间的互动建模为合作问题。机器不应假定收到的奖励函数已经完整表达人的意图,而是需要从人的行动和反馈中进一步推断目标。

这种思路有助于解释为什么澄清问题、允许纠正和保留人类控制权很重要。不过,数学模型中的假设与真实用户行为之间仍有距离。对于 Agent 系统,它提供的是设计和分析人机协作的视角,不能直接替代权限控制与工程层面的安全机制。