跳转到内容
← AI 人物志
对齐与评测

Yuntao Bai

白云涛

Constitutional AI

Yuntao Bai 是语言模型对齐研究者,也是 Constitutional AI 论文的第一作者。他的研究关注能否让 AI 根据明确原则评价和修改回答,从而减少对逐条人工标注的依赖。

2022 年,研究团队让模型依据一组原则对自己的回答提出批评并修订,再使用修订数据训练模型。另一阶段利用 AI 生成的偏好训练奖励模型,并通过强化学习改善行为。这种做法通常被称为来自 AI 反馈的强化学习。

原则由人制定,反馈过程由模型参与,并不等于系统能独立决定什么是正确。原则是否完整、评价模型是否可靠,以及训练结果能否在新场景中保持,都需要继续验证。Bai 的工作为理解 Claude 等助手的行为训练提供了直接研究入口。