1. 前言

不久前,我需要完成五个算法的复现对比工作,但是大参数模型属实是要将我的4060给燃尽了~~

于是乎,我开始转向了服务器租赁的方向。在对比多家云服务器租赁平台之后,选择了AutoDL平台。主要是碍于学生党,没有什么资金支持,这个平台的性价比较高。唉~~

因此我将记录一下我第一次使用云算力平台的感受,介绍一下 AutoDL 平台的一些操作。

2. AutoDL的特点

AutoDL 是一个面向 AI 开发者与深度学习研究者 的云端 GPU 训练平台。它通过简单易用的网页控制台和高性能的云端资源,提供灵活、可扩展的训练环境。
其核心理念是:即开即用,按需付费,免去繁琐的硬件维护和环境配置。

主要特点:

高性能 GPU 支持:提供多种 NVIDIA 高端 GPU,如 A100、V100、RTX 3090、4090 等。

弹性资源调度:根据项目需求灵活选择 GPU 数量和规格。

便捷的环境管理:预装主流深度学习框架(TensorFlow、PyTorch 等),可一键切换或自定义环境。

按需计费:按使用时间计费,相比自建服务器更经济。

3. AutoDL 的核心功能

一键式实例创建
只需在网页端选择 GPU 型号、操作系统镜像和存储空间,即可几分钟内创建训练环境。

镜像与环境管理
预置常见深度学习镜像,也支持自定义 Docker 镜像,满足不同框架和工具链需求。

高效数据传输
提供高速的数据上传和下载通道,支持直接从对象存储、Git 仓库等位置导入数据。

远程开发与调试
支持 SSH、JupyterLab、VS Code Remote 等多种远程开发方式。

弹性计费与自动关机
可设置空闲自动关机,避免资源浪费。

4. 使用 AutoDL 的典型流程

以下是一个典型的使用步骤示例:

Step 1:注册与充值
在 AutoDL 官网注册账号,并完成基础实名认证与充值,方便后续使用 GPU 资源。

Step 2:创建实例
进入控制台 -> 创建实例 -> 选择 GPU 型号(如 RTX 4090)、系统镜像(Ubuntu 20.04 + PyTorch),配置磁盘空间和带宽。

在torch版本上更推荐兼容性更好的2.0.0版本,能适配大部分的包,避免因为版本的问题而报错。

Step 3:上传代码与数据
可以通过浏览器上传、SSH/SCP、从 Git 仓库克隆等方式上传数据:

个人更推荐使用夸克网盘,比较方便省心,对新手较为友好,因此下面介绍基于夸克网盘的方法。

在控制台开机之后(配置环境与传输数据时更建议使用无卡开机模式,更划算),打开AutoPanel,授权之后选择公网网盘,夸克网盘。接下来就是如何获取Cookie了。

浏览器登录夸克网盘网页版,按F12打开浏览器“调试”,选中“Network”,点击鼠标右键选择刷新,就能找到携带 Cookie 参数,随后将Cookie参数复制填写对应位置。

然后就是将需要上传的代码与数据集文件压缩上传,上传的压缩文件会在autodl-tmp文件夹中。

Step 4:启动训练

上传完成之后,就可以通过SSH在VSCode链接或者在控制台点击JupyterLab进入页面,点击终端进入。

进入之后首先要激活选择的基础环境,执行

conda activate my-env

my-env换为自己的环境名称,如果是和我一样选择的基础镜像,那my-env就是base,激活刷新终端之后就会在前面显示环境名称base。

激活之后cd进入autodl-tmp文件夹,解压缩之前的代码文件夹以及数据集文件夹。

按照代码的requestions使用pip或者conda命令安装相应版本的包。
配置完成后就可以在实例中运行训练代码了,例如:

python train.py --epochs 50 --batch-size 32

Step 5:监控与调试
使用平台提供的实例监控或者终端(代码会输出loss等参数情况),随时掌握训练进度。

训练完成后下载数据如果是在JupyterLab的终端,需要先进行压缩,然后再下载,因为JupyterLab不支持下载文件夹,只能下载单个文件。

5. 总结

在深度学习的研究与工程实践中,硬件算力是不可或缺的。AutoDL 为我提供了一个稳定、高效、易用的云端 GPU 平台,帮助开发者摆脱繁琐的服务器运维,将更多精力投入到算法与应用的创新中。

💡 建议:首次使用可以选择小规格 GPU 进行测试,熟悉平台后再进行大规模任务部署,既经济又高效。(不缺经费可以忽略~~)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐