检测到您已登录华为云国际站账号,为了您更好的体验,建议您访问国际站服务网站 https://www.huaweicloud.com/intl/zh-cn
不再显示此消息
目录下只有1个数据文件时,文件无命名要求。 目录下有多个数据文件时,需要通过命名的方式指定数据是训练数据集、验证数据集还是测试数据集。训练数据名称需包含train字样,如train01.csv;验证数据名称需包含eval字样;测试数据名称需包含test字样。文件的命名不能同时包含train、eval和test中的两个或三个。
加工图片类数据集 加工图片类数据集 标注图片类数据集 配比图片类数据集 父主题: 加工数据集
发布图片类数据集 评估图片类数据集 发布图片类数据集 父主题: 发布数据集
气象类加工算子介绍 平台支持气象类数据集的加工操作,气象类加工算子能力清单见表1。 表1 气象类加工算子能力清单 算子分类 算子名称 算子描述 科学计算 气象预处理 将二进制格式的气象数据文件转换成结构化JSON数据。 父主题: 数据集加工算子介绍
包括数据提取、过滤、打标签等。这些算子能够帮助用户从海量数据中提取出有用信息,并进行深度加工,以生成高质量的训练数据。 平台支持视频类数据集的加工操作,分为数据提取、数据过滤、数据打标三类,视频类加工算子能力清单见表1。 表1 视频类加工算子能力清单 算子分类 算子名称 算子描述
创建提示词评估数据集 批量评估提示词效果前,需要先上传提示词变量数据文件用于创建对应的评估数据集。 提示词变量是一种可以在文本生成中动态替换的占位符,用于根据不同的场景或用户输入生成不同的内容。其中,变量名称可以是任意的文字,用于描述变量的含义或作用。 提示词评估数据集约束限制 上传文件限xlsx格式。
标注文本类数据集 配比文本类数据集 数据配比是将多个数据集按特定比例组合的过程。通过合理的配比,确保数据集的多样性、平衡性和代表性,避免因数据分布不均而引发的问题。 配比文本类数据集 发布文本类数据集 评估文本类数据集 平台预置了多种数据类型的基础评估标准,包括NLP、视频和图片数据,用户可根据
使用数据工程构建数据集 数据工程介绍 数据工程使用流程 数据集格式要求 导入数据至盘古平台 加工数据集 发布数据集 数据工程常见报错与解决方案
创建NLP大模型评测数据集 NLP大模型支持人工评测与自动评测,在执行模型评测任务前,需创建评测数据集。 评测数据集的创建步骤与训练数据集一致,本章节仅做简单介绍,详细步骤请参见使用数据工程构建NLP大模型数据集。 登录ModelArts Studio平台,进入所需空间。 在左侧导航栏中选择“数据工程
数据发布:将单个数据集发布为特定格式的“发布数据集”的过程,用于后续模型训练等操作。 支持发布的数据集格式为标准格式、盘古格式(适用于训练盘古大模型时)。目前,仅文本类和图片类数据集支持发布为“盘古格式”。 在集成了数据获取、数据加工、数据发布功能外,平台还支持对原始数据集、加工数据集
据标注的质量直接影响模型的训练效果和精度。 配比数据集 数据配比是将多个数据集按特定比例组合并生成为“加工数据集”的过程。通过合理的配比,确保数据集的多样性、平衡性和代表性,避免因数据分布不均而引发的问题。 发布数据集 评估数据集 平台预置了多种数据类型的基础评估标准,包括NLP
在“创建导入任务”页面,选择“数据集类型”、“文件格式”和“导入来源”。 单击“”,在“存储位置”弹窗中选择需导入的数据,单击“确定”。 图1 选择导入的数据 填写“数据集名称”和“描述”,可选择填写“扩展信息”。 扩展信息包括“数据集属性”与“数据集版权”: 数据集属性。可以给数据集添加行业、语言和自定义信息。
发布任务”,单击界面右上角“创建发布任务”。 在“创建发布任务”页面,数据集模态选择“气象 > 气象数据”,选择需要发布的数据集。 图3 创建发布任务 单击“下一步”,设置数据集的“数据用途”与“数据集可见性”,填写数据集名称、描述,单击“确认”完成微调数据集的构建。 父主题: 盘古科学计算大模型微调训练实践
导入数据至盘古平台 加工气象类数据集 加工气象类数据集 通过专用的加工算子对数据进行预处理,确保数据符合模型训练的标准和业务需求。不同类型的数据集使用专门设计的算子,例如去除噪声、冗余信息等,提升数据质量。 加工气象类数据集 发布气象类数据集 发布气象类数据集 数据发布是将单个数据集发布为特定格式
not online. 数据加工使用的数据集未上线,请先执行上线操作。 invalid obs path. 请检查数据集对应的OBS路径是否有效,是否可正常访问。 数据标注 annotate data not exist. 请检查标注数据集是否存在,是否被删除。 obs url invalid
Studio平台针对不同类别的数据集可使用OBS服务导入的文件形式不同: 文本、视频、预测和其他类(自定义)数据集支持文件夹或单个文件导入,导入界面提示用户:“请选择文件夹或文件”。 图1 支持导入单个文件示例 图片、视频(事件检测)、气象类数据集仅支持文件夹导入,导入界面提示用户:“请选择文件夹”。
数据资产介绍 数据资产是指在平台中被纳入管理、存储并可供使用的数据集。 数据资产包含以下两种形式: 用户自行发布的数据集。 用户可以通过“数据工程 > 数据发布 > 数据流通”功能将数据集发布为数据资产。发布的数据集支持查看详细信息、编辑、删除以及发布至AI Gallery等操作。
描述:对于该输出参数的描述。 参数提取:开启后,可增加输出参数的配置,并对参数中文名进行额外配置。关闭参数提取,输出为用户最近一轮(即回答当前提问器)的对话输入。 中文名称:若开启“参数提取 > 是否提取”功能,可额外配置中文名称。 参数校验:可自定义参数校验规则对输出参数规范性进行校验。规则包括参数名称、校验类型及校验规则。
盘古大模型是否可以自定义人设 大模型支持设置人设,在用户调用文本对话(chat/completions)API时,可以将“role”参数设置为system,让模型按预设的人设风格回答问题。 以下示例要求模型以幼儿园老师的风格回答问题: { "messages": [
便于用户实现统一查看和操作管理。 数据资产:用户已发布的数据集将作为数据资产存放在空间资产中。用户可以查看数据集的详细信息,包括数据格式、大小、配比比例等。同时,平台支持数据集的删除等管理操作,使用户能够统一管理数据集资源,以便在模型训练和分析时灵活调用,确保数据资产的规范性与安全性。