Qwen2新模型,真的很能打吗?
laohaibao666
2024年06月08日 10:27

6月7日消息,阿里云在其技术博客上宣布,正式发布了全球性能最强的开源模型Qwen2-72B,除了72B同时也发布了0.5B、1.5B、7B、57B-A14B和72B

  • 针对每种尺寸提供基础模型和指令微调模型,并确保指令微调模型按照人类偏好进行校准;

  • 基础模型和指令微调模型的多语言支持;

  • 所有模型均稳定支持32K长度上下文;Qwen2-7B-Instruct与Qwen2-72B-Instruct可支持128K上下文(需额外配置)

  • 支持工具调用、RAG(检索增强文本生成)、角色扮演、AI Agent等

项目地址:https://github.com/QwenLM/Qwen2

项目文档:https://qwen.readthedocs.io/zh-cn/latest/ ( 阿里的文档非常详细)

模型也同时能够在Hugging Face 和ModelScope 下载到

https://huggingface.co/collections/Qwen/qwen2-6659360b33528ced941e557f#/

https://modelscope.cn/organization/qwen#/

官方也同时提供在线演示DEMO地址是:https://huggingface.co/spaces/Qwen/Qwen2-72B-Instruct#/

ollama 官方也是第一时间对多个模型进行了适配,因为ollama 部署模型比较简单,我这里偷懒了,下面给大家使用ollama运行Qwen2模型,下面具体步骤。

1.模型下载地址

https://ollama.com/library/qwen2

默认有0.5B 、1.5B 、7B、72B模型,在 7B 和 72B 模型中,上下文长度已扩展至128k 个 token

表现

2 模型下载

我们在windows 电脑上执行如下命令下载7b-instruct模型

ollama pull qwen2:7b-instruct

3 模型运行

我们在windows 电脑上执行如下命令运行该模型

ollama run qwen2:7b-instruct

出现如下对话框我们就可以和大模型聊天了

另外我们查看一下显卡消耗情况(因为我们下载的是4B量化的模型,所以显存占用不高大概4GB显存。

4 模型测试

输入问题:你好,你是谁?

我靠 这个明显有问题啊,感觉这个模型的modifile写的是否有问题

我们使用如下命令检查模型modifile写法

ollama show qwen2:7b-instruct --modelfile

看不出问题在哪?接下来我们换个模型(qwen2:7b)测试一下,模型下载和模型运行和上面类似,这里就详细展开了。

失败

ollama 官方推这个镜像估计没测试,差评。

5 模型自定义制作

以上问题从官方ollama 下载的模型感觉有点问题,我们还是自定义打包模型

5.1 下载GGUF模型文件

https://modelscope.cn/models/qwen/Qwen2-7B-Instruct-GGUF/files

从魔塔社区找到Qwen2-7B-Instruct-GGUF文件

5.2 编写Qwen2-7B-Instruct-GGUF模型对应Modelfile文件

FROM ./qwen2-7b-instruct-q5_k_m.gguf

# set the temperature to 1 [higher is more creative, lower is more coherent]

PARAMETER temperature 0.7

PARAMETER top_p 0.8

PARAMETER repeat_penalty 1.05

PARAMETER top_k 20

TEMPLATE """{{ if and .First .System }}<|im_start|>system

{{ .System }}<|im_end|>

{{ end }}<|im_start|>user

{{ .Prompt }}<|im_end|>

<|im_start|>assistant

{{ .Response }}"""

# set the system message

SYSTEM """

You are a helpful assistant.

"""

5.3 自定义创建一个ollama模型

 ollama create qwen2-7b-instruct -f Modelfile

5.4 模型创建

5.5 运行模型

ollama run qwen2-7b-instruct:latest

失败了。

6 模型成功测试

按照以上步骤不管是 qwen2-7b-instruct 自定义模型 还是ollama 官方下载的qwen2:7b-instruct 、qwen2:1.5b、qwen2:7b 都不行。

最后我们尝试了qwen2:0.5b 的小模型尝试测试成功。

ollama run qwen2:0.5b

我们使用chatbox 来测试。关于chatbox 安装这里就详细展开了。感兴趣的小伙伴可以看我之前文章,有提到。

使用chatbox配置好qwen2:0.5b

测试下来速度还可以,可惜不是我想要的,因为0.5b的小模型本身输出就小,也不够聪明,最后一个题目我是从 弱智吧找到的问题,虽然回答的对但是不是我想要的。

这次放出的0.5B 、1.5B 、7B、72B模型 在ollama 适配后效果不太理想。希望官方或者ollama 进行进行改进一下。感觉应该是ollama的问题。本次文章没有把7B模型测通,所以长文本模型没有实际给大家演示。我们下个文章使用pytorch 方式推理qwen2-7b,我们下个文章见。