基于unsloth的DeepSeek-R1动态量化版本部署
基于unsloth的DeepSeek R1动态量化版本部署 来源: https://www.ucloud.cn/yun/131186.html 作者: UCloud小助手 发布日期: 发布于2025 02 08 10:20 DeepSeek R1 671b动态量化版,由unsloth.ai发布,推荐使用多卡进行部署,具
来源: https://www.ucloud.cn/yun/131186.html 作者: UCloud小助手 发布日期: 发布于2025-02-08 10:20
DeepSeek-R1-671b动态量化版,由unsloth.ai发布,推荐使用多卡进行部署,具体操作如下。本镜像还附带32b的无限制版蒸馏模型,使用open-webui和ollama以及llama.cpp进行部署,内置所有环境,即拉即用。
第一步:登录「优云智算」算力共享平台并进入「镜像社区」,新用户免费体验10小时4090
地址:https://www.compshare.cn/?ytag=seo

第二步:选择「vLLM-DeepSeek-R1-Distill」镜像,点击「使用该镜像创建实例」
镜像地址:优云智算 | Unsloth-DeepSeek-R1一键部署

根据镜像说明中的引导,选择所用模型需要的GPU算力规格,并点击「立即部署」即可拥有一个自带模型的算力资源。(动态量化版本推荐使用4卡或8卡4090)

第三步:启动服务,镜像已配置好所需依赖环境,无需额外安装,即可通过以下命令启动:
打开jupyterlab

按照指引启动llama.cpp

根据所开的机器卡数填写对应的显存大小

按照指引将代码块修改并复制到终端中运行

运行完成后,访问外网IP:10000即可开始使用

使用llama.cpp加载模型以后,再启动open-webui,访问ip:8080是这样

注意:
1、unsloth文档给了四个模型,镜像默认选择1.58的作为默认配置
2、部署1.58bit的如果需要全部加载到显存上,需要2x80GB的显卡,换算成24g的4090需要挺多张,但是相较于需要一大堆H100的671b的原本模型,所用配置已经相当低了,全部加载到内存上推理可能会比较慢,因此可以通过将部分layer卸载到显存上从而加快推理速度
3、单卡4090的话不是很推荐,显存内存加在一起都有点放不下,只有0.17token/s;双卡4090,layer为17或者16,大概1.5token/s到2tokens/s之间,再多的话没测过,虽然这速度也不是不能用,三卡应该就能正常用了,当然,选择更大显存的A100或者8卡4090,即可全部吃下,飞快使用
4、该镜像还搭载了Ollama,你不想使用R1模型的话也可以试试蒸馏模型,单卡4090妥妥够了,70b的那个中文效果还不如32g,镜像内自带的两个蒸馏模型分别是32b官方版和32b越狱般。启动ollama服务后,再启动open-webui,进入到open-webui即可使用
5、量化模型也可以在llama.cpp的serve上面推,open-webui并不是必须的