检查以及安装本地CUDA
nvidia-smi #查看CUDA支持的版本号以及显存
nvcc --version #查看当前CUDA编译器版本号
CUDA Toolkit Archive | NVIDIA Developer
安装Pytorch
终端进入Python,检查Pytorch安装
下载安装模型
THUDM/chatglm-6b · Hugging Face
从 Hugging Face Hub 下载模型需要先安装Git LFS,然后运行
清华大学云盘 (tsinghua.edu.cn)https://cloud.tsinghua.edu.cn/d/fb9f16d6dc8f482596c2/
将模型下载到本地之后,将以上代码中的 THUDM/chatglm-6b替换为你本地的 chatglm-6b文件夹的路径,即可从本地加载模型。
安装相关依赖库
启动 demo 程序
(1)cli_demo.py,直接在命令行中输入进行问答;
(2)web_demo.py,利用 gradio库生成问答网页。
启动 cli_demo.py
1.修改模型路径。编辑 cli_demo.py 代码,修改 5、6 行的模型文件夹路径,将原始的 “THUDM/ChatGLM-6B” 替换为 “model” 即可。
2.修改量化版本。如果你的显存大于 14G,则无需量化可以跳过此步骤。如果你的显存只有 6G 或 10G,则需要在第 6 行代码上添加 quantize(4) 或 quantize(8) ,如下:
6G 显存可以 4 bit 量化
10G 显存可以 8 bit 量化
3.执行 python 文件即可,可以在命令行终端输入:python cli_demo.py即可启动 demo,开始使用了!
启动 web_demo.py
1.安装 gradio 库,在 ChatGLM 目录下打开命令行终端,输入:pip install gradio即可安装 demo 所需要的库。
2.修改模型路径。编辑 web_demo.py代码,修改 4、5 行的模型文件夹路径,将原始的 **“THUDM/ChatGLM-6B”**替换为 **“model”**即可
3.修改量化版本。如果你的显存大于 14G,则无需量化可以跳过此步骤。如果你的显存只有 6G 或 10G,则需要在第 5 行代码上添加 quantize(4) 或 quantize(8) ,如下:
6G 显存可以 4 bit 量化
10G 显存可以 8 bit 量化
执行 python 文件即可,可以在命令行终端输入:
即可启动 demo,开始使用了
ChatGLM-6B|清华开源本地化语言模型免费安装部署教程全方位指南,效果堪比ChatGPT。 - openAI