对齐与评测
Rafael Rafailov
拉斐尔·拉法伊洛夫
DPO · 偏好优化
Rafael Rafailov 是机器学习研究者,也是 Direct Preference Optimization,即 DPO 论文的第一作者。他与合作者研究如何更直接地利用人对回答的偏好来训练语言模型。
传统 RLHF 流程往往先训练奖励模型,再用强化学习优化策略。DPO 在特定建模假设下,将这一目标转化为直接作用于偏好样本的训练损失,减少了单独训练奖励模型及在线策略优化的复杂性。
这使偏好训练更容易实现和复现,但并没有消除数据质量问题。被偏好的回答是否正确、训练样本是否覆盖目标用户,以及模型是否学到表面风格,都仍需评测。Rafailov 的工作帮助开发者理解:同一类行为目标,可能通过不同的优化流程实现。