基础与架构
傅尧
Yao Fu
语言模型 · 长上下文
傅尧是自然语言处理研究者,代表工作涉及语言模型的长上下文训练和信息检索能力。他也通过技术文章解释模型数据、推理及部署中的具体问题。
2024 年,他与合作者发表将语言模型扩展到 128K 上下文的研究。论文重点不是重新设计整个架构,而是分析继续预训练时的数据组成:在不同来源的数据中提高长文本的比例,帮助模型在更长输入的任意位置利用信息。
研究还比较了长上下文能力与短任务表现,而不只测试模型能否接收更长的文本。这使数据工程成为长上下文训练中的关键环节:窗口长度只是输入上限,模型是否真正能找到并使用其中的信息,需要通过任务结果检验。