多模态
白金泽
Jinze Bai
Qwen · Qwen-VL
白金泽是语言与视觉语言模型研究者,是 Qwen 与 Qwen-VL 技术报告的第一作者。他参与的工作涉及基础模型训练、多模态输入与任务评测。
Qwen 技术报告介绍语言模型的数据、预训练及能力评估。Qwen-VL 在此基础上结合视觉组件,研究图像理解、文字识别和对象定位,让模型可以根据图片与文本共同完成任务。
Qwen-VL 不只生成图片描述,还尝试用边界框对应图像中的对象,并处理图中文字。因此,理解一张图与指出“答案在图中哪里”成为可以一起训练的任务,为文档问答、对象定位和图文交互提供了基础。