跳转到内容
← AI 人物志
基础与架构

傅尧

Yao Fu

语言模型 · 长上下文

傅尧是自然语言处理研究者,代表工作涉及语言模型的长上下文训练和信息检索能力。他也通过技术文章解释模型数据、推理及部署中的具体问题。

2024 年,他与合作者发表将语言模型扩展到 128K 上下文的研究。论文重点不是重新设计整个架构,而是分析继续预训练时的数据组成:在不同来源的数据中提高长文本的比例,帮助模型在更长输入的任意位置利用信息。

研究还比较了长上下文能力与短任务表现,而不只测试模型能否接收更长的文本。这使数据工程成为长上下文训练中的关键环节:窗口长度只是输入上限,模型是否真正能找到并使用其中的信息,需要通过任务结果检验。