基础与架构
Tom Brown
Tom B. Brown
GPT-3 · 少样本学习
Tom Brown 是 GPT-3 论文 Language Models are Few-Shot Learners 的第一作者。他参与研究大规模语言模型能否在不更新参数的情况下,仅通过输入中的任务说明和少量例子完成新任务。
2020 年,研究团队训练了 1750 亿参数的 GPT-3,并在翻译、问答、文本补全和其他任务上评估零样本及少样本能力。这里的“学习”发生在一次输入的上下文中,与重新训练或微调模型不是同一件事。
这项工作使提示中的示例成为使用语言模型的重要方式,也展示了扩大模型规模的潜力。论文同时报告了失败任务、数据污染等问题。Brown 后来还参与 Constitutional AI 等研究,研究方向从模型能力延伸到怎样通过反馈改善助手行为。