前言

Xinference 是针对生成式 AI 场景度身定制的能力全面的推理服务平台。功能覆盖算力、模型和高可用可观测的企业级能力。对于个人开发者还是企业来说都十分的好用。
在这里插入图片描述


一、Xinference安装

官网安装说明:安装说明链接
1.创建conda环境,我这边使用的是Python版本为3.9.21

conda create -n xinference python=3.9.21

2.激活环境

conda activate xinference 

3.安装相关包

pip install "xinference[all]"

清华源安装

pip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple

二、启动方式

1.环境确认,确认在xinference环境下

conda activate xinference 

2.启动命令

后端正常启动

xinference-local --host 0.0.0.0 --port 9997

后端静默长期启动

nohup xinference-local --host 0.0.0.0 --port 9997 > logfile.log 2>&1 &

端口9997可以修改为自己的端口,尽量别改,不然加载模型时可能出现找不到模型列表的报错。

3.可视化ui查看

如果您使用的是vscode连接的服务器,可以使用端口转发在本地电脑打开web界面。
在这里插入图片描述
此时打开http://localhost:9997/即可看到页面如下:
在这里插入图片描述

三、模型部署

1.选择Register Model,将自己微调过的模型注册,参数填写如下两图所示:

在这里插入图片描述
在这里插入图片描述

2.模型部署

注册成功后,可以在Launch Model下的Custom Models中看到刚注册好的模型
在这里插入图片描述
我们点击进入注册好的模型,配置参数
在这里插入图片描述

在这里插入图片描述

3.部署成功后

部署成功后我们可以在Running Models中看到自己部署运行的模型。

在这里插入图片描述
进入对话。
在这里插入图片描述
在这里插入图片描述
GPUFan即为卡id
查看卡情况命令

nvidia-smi

4.API接口调用

打开http://localhost:9997/docs,可以查看接口文档

答疑合作

在这里插入图片描述

联系方式:18530663302

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐