Qwen-VL: A Frontier Large Vision-Language Model with Versatile(多才多艺的) Abilities
202308开源Qwen-VL和chat模型
QwenVL是一个预训练模型,通过链接视觉编码器,扩展了Qwen7B(LLM)的视觉能力
QwenVL chat是基于Qwen VL的交互式VLM,支持图像描述,视觉问答,视觉定位和灵活的多图交互能力
这些模型的特点是:能够感知和理解多层次尺度的视觉信号
Qwen-VL由三部分组成:
Vision Encoder: 1.9B
VL adapter: 0.08B
LLM: 7.7B
其中LLM部分用的是qwen7B
Vision Transformer (ViT)的架构, 使用Openclip的ViT-bigG来初始化权重。
通过将图像分割成大小为14的patch,生成一组图像特征
Position-aware Vision Language Adapter
目的:压缩图像特征序列,解决长序列带来的效率问题
他作为视觉和自然语言的adapter
结构:单个的交叉注意力层参数(随机初始化)
相比于instruct blip。Qwen的视觉语言的连接模块简化很多,但Qwen效果更好
有可训练的query embedding,视觉编码器输出的视觉特征作为交叉注意力的key
引入了2D的绝对位置编码,
最后,压缩后的图像特征序列会送到LLM中
Pretraining
Multi-task Pretraining
Supervised Finetuning
前两个阶段后的模型叫Qwen-VL,再经过第三阶段,得到Qwen-VL-chat

目的是将Vision encoder和freeze LLM对齐。使用了大量的弱监督文本对数据,比如Laion5B进行对齐。这一步需要1.4B数据。freeze LLM是为了避免对LLm造成影响
数据分辨率224*224
多任务的预训练,主要是赋予完成多种下游任务的能力。包括视觉问答,图像描述,OCR,视觉定位
数据分辨率448*448
SFT:将VLM与人类偏好对齐
增强了模型的指令跟随,以及对话的能力。
这一阶段还有部分纯文本数据,是为了避免纯文本对话能力的退化