大语言模型推理系列-Xinference企业级大语言模型部署
·
目录
前言
Xinference 是针对生成式 AI 场景度身定制的能力全面的推理服务平台。功能覆盖算力、模型和高可用可观测的企业级能力。对于个人开发者还是企业来说都十分的好用。
一、Xinference安装
官网安装说明:安装说明链接
1.创建conda环境,我这边使用的是Python版本为3.9.21
conda create -n xinference python=3.9.21
2.激活环境
conda activate xinference
3.安装相关包
pip install "xinference[all]"
清华源安装
pip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple
二、启动方式
1.环境确认,确认在xinference环境下
conda activate xinference
2.启动命令
后端正常启动
xinference-local --host 0.0.0.0 --port 9997
后端静默长期启动
nohup xinference-local --host 0.0.0.0 --port 9997 > logfile.log 2>&1 &
端口9997可以修改为自己的端口,尽量别改,不然加载模型时可能出现找不到模型列表的报错。
3.可视化ui查看
如果您使用的是vscode连接的服务器,可以使用端口转发在本地电脑打开web界面。
此时打开http://localhost:9997/即可看到页面如下:
三、模型部署
1.选择Register Model,将自己微调过的模型注册,参数填写如下两图所示:


2.模型部署
注册成功后,可以在Launch Model下的Custom Models中看到刚注册好的模型
我们点击进入注册好的模型,配置参数

3.部署成功后
部署成功后我们可以在Running Models中看到自己部署运行的模型。

进入对话。

GPUFan即为卡id
查看卡情况命令
nvidia-smi
4.API接口调用
打开http://localhost:9997/docs,可以查看接口文档
答疑合作

联系方式:18530663302
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)