AI开发平台MODELARTS-准备数据:自定义数据
自定义数据
用户也可以自行准备训练数据。数据要求如下:
使用标准的.json格式的数据,通过设置--json-key来指定需要参与训练的列。
请注意huggingface中的数据集具有如下this格式。可以使用–json-key标志更改数据集文本字段的名称,默认为text。在维基百科数据集中,它有四列,分别是id、url、title和text。可以指定–json-key 标志来选择用于训练的列。
{ 'id': '1', 'url': 'https://simple.wikipedia.org/wiki/April', 'title': 'April', 'text': 'April is the fourth month...' }
将下载的原始数据存放在/home/ma-user/ws/datasets/data目录下。具体步骤如下:
- 进入到/home/ma-user/ws/目录下。
- 创建目录“datasets/data”,并将原始数据放置在此处。
mkdir -p datasets/data
数据存放参考目录结构如下:
${workdir}(例如/home/ma-user/ws ) ├── datasets ├── data #原始数据集 ├── train-00000-of-00001-a09b74b3ef9c3b56.parquet #预训练原始数据集 ├── alpaca_data.json #微调原始数据集