多模态大模型Qwen-VL
搜狗搜到你1314520
2026年03月10日 11:11

Qwen-VL: A Frontier Large Vision-Language Model with Versatile(多才多艺的) Abilities

202308开源Qwen-VL和chat模型

QwenVL是一个预训练模型,通过链接视觉编码器,扩展了Qwen7B(LLM)的视觉能力

QwenVL chat是基于Qwen VL的交互式VLM,支持图像描述,视觉问答,视觉定位和灵活的多图交互能力

这些模型的特点是:能够感知和理解多层次尺度的视觉信号

模型架构

Qwen-VL由三部分组成:

  1. Vision Encoder: 1.9B

  2. VL adapter: 0.08B

  3. LLM: 7.7B

其中LLM部分用的是qwen7B

Vision Encoder

Vision Transformer (ViT)的架构, 使用Openclip的ViT-bigG来初始化权重。

通过将图像分割成大小为14的patch,生成一组图像特征

VL adapter

Position-aware Vision Language Adapter

目的:压缩图像特征序列,解决长序列带来的效率问题

他作为视觉和自然语言的adapter

结构:单个的交叉注意力层参数(随机初始化)

相比于instruct blip。Qwen的视觉语言的连接模块简化很多,但Qwen效果更好

有可训练的query embedding,视觉编码器输出的视觉特征作为交叉注意力的key

引入了2D的绝对位置编码,

最后,压缩后的图像特征序列会送到LLM中

训练方法

  1. Pretraining

  2. Multi-task Pretraining

  3. Supervised Finetuning

前两个阶段后的模型叫Qwen-VL,再经过第三阶段,得到Qwen-VL-chat

第一阶段:

目的是将Vision encoder和freeze LLM对齐。使用了大量的弱监督文本对数据,比如Laion5B进行对齐。这一步需要1.4B数据。freeze LLM是为了避免对LLm造成影响

数据分辨率224*224

第二阶段:

多任务的预训练,主要是赋予完成多种下游任务的能力。包括视觉问答,图像描述,OCR,视觉定位

数据分辨率448*448

第三阶段:

SFT:将VLM与人类偏好对齐

增强了模型的指令跟随,以及对话的能力。

这一阶段还有部分纯文本数据,是为了避免纯文本对话能力的退化