跳转到内容
← AI 人物志
对齐与评测

Rafael Rafailov

拉斐尔·拉法伊洛夫

DPO · 偏好优化

Rafael Rafailov 是机器学习研究者,也是 Direct Preference Optimization,即 DPO 论文的第一作者。他与合作者研究如何更直接地利用人对回答的偏好来训练语言模型。

传统 RLHF 流程往往先训练奖励模型,再用强化学习优化策略。DPO 在特定建模假设下,将这一目标转化为直接作用于偏好样本的训练损失,减少了单独训练奖励模型及在线策略优化的复杂性。

这使偏好训练更容易实现和复现,但并没有消除数据质量问题。被偏好的回答是否正确、训练样本是否覆盖目标用户,以及模型是否学到表面风格,都仍需评测。Rafailov 的工作帮助开发者理解:同一类行为目标,可能通过不同的优化流程实现。