从Huggingface中下载C4/wikipedia/..等数据集并转换成可被调用的格式的教程
·
从Huggingface中下载C4/wikipedia/等数据集并转换成pytorch库可被调用的格式
1 问题背景
llama_eval可以直接调用的数据集格式是arrow而我们在hf上下载下来的却是一些json格式的数据集
2 解决方案
Step1:下载数据集
这里我采用的是hf直接下载
import os
# 设置环境变量
os.environ['HF_ENDPOINT'] = 'https://hf-mirror.com'
# 下载模型
os.system('huggingface-cli download --resume-download Undi95/Meta-Llama-3-8B-hf --local-dir ./llama3-8b')
# 下载C4数据集
# os.system('huggingface-cli download --repo-type dataset --resume-download allenai/c4 --local-dir ./C4')
# 下载Books数据集
# os.system('huggingface-cli download --repo-type dataset --resume-download sailor2/sea-commoncrawl --local-dir ./CommonCrawl')
Step2:格式转换
例如C4数据集的格式转换可以由下面的代码完成
from datasets import load_dataset
# 加载数据集
dataset = load_dataset("json", data_files="/home/liuhao/code/C4/en.noblocklist/c4-train.00001-of-01024.json", split="train")
# 保存成Arrow格式
dataset.save_to_disk("./C4")
Step3:直接在load_data的时候将路径改为转换后的路径即可!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)