
6月7日消息,阿里云在其技术博客上宣布,正式发布了全球性能最强的开源模型Qwen2-72B,除了72B同时也发布了0.5B、1.5B、7B、57B-A14B和72B
针对每种尺寸提供基础模型和指令微调模型,并确保指令微调模型按照人类偏好进行校准;
基础模型和指令微调模型的多语言支持;
所有模型均稳定支持32K长度上下文;Qwen2-7B-Instruct与Qwen2-72B-Instruct可支持128K上下文(需额外配置)
支持工具调用、RAG(检索增强文本生成)、角色扮演、AI Agent等
项目地址:https://github.com/QwenLM/Qwen2
项目文档:https://qwen.readthedocs.io/zh-cn/latest/ ( 阿里的文档非常详细)
模型也同时能够在Hugging Face 和ModelScope 下载到
https://huggingface.co/collections/Qwen/qwen2-6659360b33528ced941e557f#/

https://modelscope.cn/organization/qwen#/

官方也同时提供在线演示DEMO地址是:https://huggingface.co/spaces/Qwen/Qwen2-72B-Instruct#/

ollama 官方也是第一时间对多个模型进行了适配,因为ollama 部署模型比较简单,我这里偷懒了,下面给大家使用ollama运行Qwen2模型,下面具体步骤。
https://ollama.com/library/qwen2
默认有0.5B 、1.5B 、7B、72B模型,在 7B 和 72B 模型中,上下文长度已扩展至128k 个 token





我们在windows 电脑上执行如下命令下载7b-instruct模型
ollama pull qwen2:7b-instruct

我们在windows 电脑上执行如下命令运行该模型
ollama run qwen2:7b-instruct
出现如下对话框我们就可以和大模型聊天了
另外我们查看一下显卡消耗情况(因为我们下载的是4B量化的模型,所以显存占用不高大概4GB显存。

输入问题:你好,你是谁?

我靠 这个明显有问题啊,感觉这个模型的modifile写的是否有问题
我们使用如下命令检查模型modifile写法
ollama show qwen2:7b-instruct --modelfile

看不出问题在哪?接下来我们换个模型(qwen2:7b)测试一下,模型下载和模型运行和上面类似,这里就详细展开了。

失败
ollama 官方推这个镜像估计没测试,差评。
以上问题从官方ollama 下载的模型感觉有点问题,我们还是自定义打包模型
https://modelscope.cn/models/qwen/Qwen2-7B-Instruct-GGUF/files
从魔塔社区找到Qwen2-7B-Instruct-GGUF文件

FROM ./qwen2-7b-instruct-q5_k_m.gguf
# set the temperature to 1 [higher is more creative, lower is more coherent]
PARAMETER temperature 0.7
PARAMETER top_p 0.8
PARAMETER repeat_penalty 1.05
PARAMETER top_k 20
TEMPLATE """{{ if and .First .System }}<|im_start|>system
{{ .System }}<|im_end|>
{{ end }}<|im_start|>user
{{ .Prompt }}<|im_end|>
<|im_start|>assistant
{{ .Response }}"""
# set the system message
SYSTEM """
You are a helpful assistant.
"""
ollama create qwen2-7b-instruct -f Modelfile

ollama run qwen2-7b-instruct:latest

失败了。
按照以上步骤不管是 qwen2-7b-instruct 自定义模型 还是ollama 官方下载的qwen2:7b-instruct 、qwen2:1.5b、qwen2:7b 都不行。
最后我们尝试了qwen2:0.5b 的小模型尝试测试成功。
ollama run qwen2:0.5b

我们使用chatbox 来测试。关于chatbox 安装这里就详细展开了。感兴趣的小伙伴可以看我之前文章,有提到。

使用chatbox配置好qwen2:0.5b

测试下来速度还可以,可惜不是我想要的,因为0.5b的小模型本身输出就小,也不够聪明,最后一个题目我是从 弱智吧找到的问题,虽然回答的对但是不是我想要的。
这次放出的0.5B 、1.5B 、7B、72B模型 在ollama 适配后效果不太理想。希望官方或者ollama 进行进行改进一下。感觉应该是ollama的问题。本次文章没有把7B模型测通,所以长文本模型没有实际给大家演示。我们下个文章使用pytorch 方式推理qwen2-7b,我们下个文章见。