从Huggingface中下载C4/wikipedia/等数据集并转换成pytorch库可被调用的格式

1 问题背景

llama_eval可以直接调用的数据集格式是arrow而我们在hf上下载下来的却是一些json格式的数据集

2 解决方案

Step1:下载数据集

这里我采用的是hf直接下载

import os

# 设置环境变量
os.environ['HF_ENDPOINT'] = 'https://hf-mirror.com'

# 下载模型
os.system('huggingface-cli download --resume-download Undi95/Meta-Llama-3-8B-hf --local-dir ./llama3-8b')

# 下载C4数据集
# os.system('huggingface-cli download --repo-type dataset --resume-download allenai/c4 --local-dir ./C4')

# 下载Books数据集
# os.system('huggingface-cli download --repo-type dataset --resume-download sailor2/sea-commoncrawl --local-dir ./CommonCrawl')

Step2:格式转换

例如C4数据集的格式转换可以由下面的代码完成

from datasets import load_dataset

# 加载数据集
dataset = load_dataset("json", data_files="/home/liuhao/code/C4/en.noblocklist/c4-train.00001-of-01024.json", split="train")
# 保存成Arrow格式
dataset.save_to_disk("./C4")

Step3:直接在load_data的时候将路径改为转换后的路径即可!

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐