开源与教育
Nathan Lambert
内森·兰伯特
Tülu · RLHF Book
Nathan Lambert 是语言模型后训练研究者,也是《RLHF Book》的作者。他的工作关注怎样把预训练模型变成更符合任务要求的助手,并公开训练过程中的数据、方法和实验细节。
他作为第一作者参与 Tülu 3 报告,研究监督微调、偏好优化和基于可验证结果的强化学习如何组合。团队公开相应的训练方案,让开发者不只能够下载模型,也能够研究模型的行为是怎样训练出来的。
《RLHF Book》则把偏好数据、奖励模型、优化算法和评测组织成可阅读的材料。研究与写作面向同一个难点:后训练不是加上一段固定提示词,而是需要明确想改善什么行为,用什么信号训练,以及怎样确认改进确实发生。