检测到您已登录华为云国际站账号,为了您更好的体验,建议您访问国际站服务网站 https://www.huaweicloud.com/intl/zh-cn
不再显示此消息
父主题: 数据集加工算子介绍
数据集格式要求 文本类数据集格式要求 视频类数据集格式要求 图片类数据集格式要求 气象类数据集格式要求 预测类数据集格式要求 其他类数据集格式要求 父主题: 使用数据工程准备与处理数据集
使用数据工程准备与处理数据集 数据工程介绍 数据工程使用流程 数据集格式要求 导入数据至盘古平台 加工数据集 标注数据集 评估数据集 发布数据集 数据工程常见报错与解决方案
在左侧导航栏中选择“Agent 开发 > 提示词工程 > 提示用例管理”,单击页面右上角“创建提示用例集”。 图3 提示用例管理 在“创建数据集”页面完成数据集的上传。 图4 创建提示词评估数据集 父主题: 批量评估提示词效果
创建文本类数据集标注任务 审核数据集标注结果 对数据集的标注结果进行审核 审核文本类数据集标注结果 上线标注后的数据集 对标注后的数据集执行上线操作。 上线标注后的文本类数据集 评估数据集(可选) 创建文本类数据集评估标准 创建数据集评估标准。
使用数据工程构建科学计算大模型数据集 科学计算大模型支持接入的数据集类型 盘古科学计算大模型仅支持接入气象类数据集,该数据集格式要求请参见气象类数据集格式要求。 构建科学计算大模型训练数据要求 构建科学计算大模型进行训练的数据要求见表1。
单轮问答 支持jsonl、csv,详见文本类数据集格式要求。 单轮问答(人设) 支持jsonl、csv,详见文本类数据集格式要求。 多轮问答 支持jsonl,详见文本类数据集格式要求。 多轮问答(人设) 支持jsonl,详见文本类数据集格式要求。
标注数据集(可选) 创建数据集标注任务 创建数据集标注任务,并对数据集执行标注操作,标注后的数据可以用于模型训练。 审核数据集标注结果 对数据集的标注结果进行审核。 上线标注后的数据集 对标注后的数据集执行上线操作。 评估数据集(可选) 创建数据集评估标准 创建数据集评估标准。
图6 上线数据集 只有上线后的数据集才可用于后续的数据加工、标注、评估、发布操作。 管理原始数据集 原始数据集上线成功后,支持查看数据集详情、下载数据集、查看数据血缘、以及对数据集进行删除等操作。 支持查看数据集详情。
选择左侧“数据工程 > 数据获取”,单击右上角“创建原始数据集”。 在“创建原始数据集”页面,选择“图片 > 图片+Caption”,选择文件格式、文件来源,填写数据集名称及描述,单击“立即创建”。
请检查数据集是否存在。 Dataset [%s] status is invalid. 请检查数据集状态是否正常上线。 父主题: 使用数据工程准备与处理数据集
图1 创建原始数据集 创建成功的数据集的任务状态为“成功”,单击操作列的“上线”按钮,将该数据集上线,用于后续加工操作。 选择左侧“数据工程 > 数据加工”,单击右上角“创建加工数据集”。
平台为数据资产提供了一系列管理功能,包括查看数据集的详细信息、追踪操作记录、以及数据集的删除管理等。这不仅便于用户对已发布数据集的集中管理,还可帮助用户了解每个数据集的使用情况,从而简化数据资产的维护更新流程。
数据资产:用户已发布的数据集将作为数据资产存放在空间资产中。用户可以查看数据集的详细信息,包括数据格式、大小、配比比例等。同时,平台支持数据集的删除等管理操作,使用户能够统一管理数据集资源,以便在模型训练和分析时灵活调用,确保数据资产的规范性与安全性。
步骤3:标注文本类数据集 本样例场景帮助用户高效完成数据标注任务,提升标注数据的可靠性和可用性。 步骤4:评估文本类数据集 本样例场景帮助用户利用数据集评估标准评估和优化数据质量。 步骤5:发布文本类数据集 本样例场景实现将处理好的数据集发布为模型训练可用的数据集。
开发一个大模型的流程可以分为以下几个主要步骤: 数据集准备:大模型的性能往往依赖于大量的训练数据。因此,数据集准备是模型开发的第一步。首先,需要根据业务需求收集相关的原始数据,确保数据的覆盖面和多样性。
这种情况可能是由于以下几个原因导致的,建议您依次排查: 测试集质量:请检查测试集的目标任务和分布与实际场景是否一致,质量较差的测试集无法反映模型的真实结果。 数据质量:请检查训练数据的质量,若训练样本和目标任务不一致或者分布差异较大,则会加剧该现象。
针对不同类型的数据集,平台提供了专用的加工算子,有效提升数据质量并支持大规模数据处理,确保生成的数据集符合训练的标准。 数据标注:对于无标签的数据,平台支持进行标注或重新标注,以提升数据集的标注质量。
数据保护技术 盘古大模型服务通过多种数据保护手段和特性,保障存储在服务中的数据安全可靠。 表1 盘古大模型的数据保护手段和特性 数据保护手段 简要说明 传输加密(HTTPS) 盘古服务使用HTTPS传输协议保证数据传输的安全性。 基于OBS提供的数据保护 基于OBS服务对用户的数据进行存储和保护
人工评测:您可以采用人工评测的方式,参照目标任务构造评测集,通过横向或纵向评估评测集的方式来验证模型效果。 父主题: 大模型微调训练类问题