比方说我想下载OpenCity的数据集,根据作者给出的链接来到:https://huggingface.co/datasets/hkuds/OpenCity-dataset/tree/main

一看页面长这样:

咋样才能把这个整个OpenCity-dataset文件夹都下载下来呢?

其实我们直接使用

git clone

就可以。

但是直接克隆完整的网页URL会失败:

$ git clone https://huggingface.co/datasets/hkuds/OpenCity-dataset/tree/main
Cloning into 'main'...
fatal: repository 'https://huggingface.co/datasets/hkuds/OpenCity-dataset/tree/main/' not found

那该怎么办呢?

注意到,数据集的结尾有一个“copy”形状的按钮:

点击它会得到:

hkuds/OpenCity-dataset

我们要做的是,把先前的URL进行截断,使得URL的结尾为上面复制到的字符串。

那么最终的命令就变成了:

git clone https://huggingface.co/datasets/hkuds/OpenCity-dataset

然后就成功啦:

=================二编=================

笑死,翻车了。

打开文件一看,都长这个样子:

说明我们克隆下来的实际上是一个个 Git LFS(Large File Storage)指针文件,并不是压缩包或直接的数据文件。文本指针指向真正的大文件内容,真正的数据需要通过 Git LFS 下载。

如果还没有安装Git LFS的话,首先运行:

sudo apt-get install git-lfs

(如果失败的话,就更新一下系统源:`sudo apt-get update`,然后再跑上面命令)

安装成功后初始化:

git lfs install

进入到我们刚才从git克隆下来的目录,执行下面的命令:

:~/OpenCity/data/OpenCity-dataset$ git lfs pull

安心等待就好了。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐