训练与推理
Hamish Ivison
哈米什·艾维森
Tülu · 开放后训练
Hamish Ivison 是语言模型后训练研究者,公开工作涉及指令数据、偏好优化和强化学习。他参与 OLMo 与 Tülu 等开放研究,关注模型在预测下一个 token 之外,怎样获得更适合用户任务的行为。
Tülu 3 将多种后训练步骤放在同一个可复现方案中,并比较训练数据与方法的组合。监督微调提供任务示范,偏好优化利用回答之间的比较,而可验证奖励适合能够检查结果的任务,三者提供的信号并不相同。
Ivison 的个人研究还关注数据混合与不同语言建模方法。相比只报告一个最终模型分数,这类工作更重视哪些数据和步骤带来了变化,使其他团队能够根据自己的任务复现、删减或调整训练过程。