对齐与评测
Amanda Askell
阿曼达·阿斯凯尔
模型行为 · 价值原则
Amanda Askell 的研究背景包括哲学与 AI 行为设计。她关注助手应怎样回应用户,以及如何把诚实、有帮助和减少伤害等要求转化为训练中可以使用的原则。
她是 GPT-3、InstructGPT 和 Constitutional AI 等论文的共同作者。这些研究分别涉及模型能力、人类偏好训练,以及利用原则和 AI 反馈调整模型行为,反映了能力评测与规范性问题之间的联系。
对助手角色的设计会影响回答的语气、拒绝方式及处理价值冲突的行为,但不能替代产品权限、工具约束和实际评测。理解她的工作,重点是人如何明确期望模型表现出的特质,以及这些期望在训练和使用中会遇到哪些困难。