如何从HuggingFace上下载数据集
·
比方说我想下载OpenCity的数据集,根据作者给出的链接来到:https://huggingface.co/datasets/hkuds/OpenCity-dataset/tree/main。
一看页面长这样:

咋样才能把这个整个OpenCity-dataset文件夹都下载下来呢?
其实我们直接使用
git clone
就可以。
但是直接克隆完整的网页URL会失败:
$ git clone https://huggingface.co/datasets/hkuds/OpenCity-dataset/tree/main
Cloning into 'main'...
fatal: repository 'https://huggingface.co/datasets/hkuds/OpenCity-dataset/tree/main/' not found
那该怎么办呢?
注意到,数据集的结尾有一个“copy”形状的按钮:

点击它会得到:
hkuds/OpenCity-dataset
我们要做的是,把先前的URL进行截断,使得URL的结尾为上面复制到的字符串。
那么最终的命令就变成了:
git clone https://huggingface.co/datasets/hkuds/OpenCity-dataset
然后就成功啦:

=================二编=================
笑死,翻车了。
打开文件一看,都长这个样子:

说明我们克隆下来的实际上是一个个 Git LFS(Large File Storage)指针文件,并不是压缩包或直接的数据文件。文本指针指向真正的大文件内容,真正的数据需要通过 Git LFS 下载。
如果还没有安装Git LFS的话,首先运行:
sudo apt-get install git-lfs
(如果失败的话,就更新一下系统源:`sudo apt-get update`,然后再跑上面命令)
安装成功后初始化:
git lfs install
进入到我们刚才从git克隆下来的目录,执行下面的命令:
:~/OpenCity/data/OpenCity-dataset$ git lfs pull
安心等待就好了。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)