搜索_华为云

训练脚本说明 - AI开发平台ModelArts

训练脚本说明训练启动脚本说明和参数配置训练的数据集预处理说明训练中的权重转换说明训练tokenizer文件说明父主题：主流开源大模型基于Lite Server适配ModelLink PyTorch NPU训练指导（6.3.907）

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配ModelLink PyTorch NPU训练指导（6.3.907）
获取动态挂载OBS实例信息列表 - AI开发平台ModelArts

Array of DataVolumesRes objects 数据。 pages Integer 总的页数。 size Integer 每一页的数量。 total Long 总的记录数量。表3 DataVolumesRes 参数参数类型描述 category String 存储类型。可选值为OBS。

帮助中心 > AI开发平台ModelArts > API参考 > 开发环境管理
训练脚本说明参考 - AI开发平台ModelArts

训练脚本说明参考训练启动脚本说明和参数配置训练的数据集预处理说明训练中的权重转换说明训练tokenizer文件说明父主题：主流开源大模型基于Lite Server适配ModelLink PyTorch NPU训练指导（6.3.909）

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配ModelLink PyTorch NPU训练指导（6.3.909）
查询DevServer实例详情 - AI开发平台ModelArts

String 服务器所属的超节点资源id。表4 Endpoints 参数参数类型描述 allowed_access_ips Array of strings 允许通过SSH协议访问Notebook的公网IP地址白名单列表，默认都可以访问。当配置指定IP后，则仅允许IP所在的客户端实现对Notebook的访问。

帮助中心 > AI开发平台ModelArts > API参考 > DevServer管理
MoXing - AI开发平台ModelArts
MoXing - AI开发平台ModelArts

MoXing 使用MoXing复制数据报错如何关闭Mox的warmup Pytorch Mox日志反复输出 moxing.tensorflow是否包含整个TensorFlow，如何对生成的checkpoint进行本地Fine Tune？训练作业使用MoXing复制数据较慢，重复打印日志

 帮助中心 > AI开发平台ModelArts > 故障排除
Cluster资源池节点故障如何定位 - AI开发平台ModelArts

掉卡 NPU卡丢失。节点规格的NPU卡数和k8sNode中可调度卡数不一致。可能是亚健康，建议先重启节点，如果重启节点后未恢复，发起维修流程。 NT_NPU_OTHER NPU 其他 NPU其他错误。检测到的其他NPU错误，通常为不可自纠正的异常，请联系技术人员支持。发起维修流程。

帮助中心 > AI开发平台ModelArts > 故障排除 > Lite Cluster
启动DevServer实例 - AI开发平台ModelArts

String 服务器所属的超节点资源id。表5 Endpoints 参数参数类型描述 allowed_access_ips Array of strings 允许通过SSH协议访问Notebook的公网IP地址白名单列表，默认都可以访问。当配置指定IP后，则仅允许IP所在的客户端实现对Notebook的访问。

帮助中心 > AI开发平台ModelArts > API参考 > DevServer管理
创建团队标注任务 - AI开发平台ModelArts

描述 auto_sync_dataset 否 Boolean 团队标注任务的标注结果是否自动同步至数据集。可选值如下： true：团队标注任务的标注结果自动同步至数据集（默认值） false：团队标注任务的标注结果不自动同步至数据集 data_sync_type 否 Integer

帮助中心 > AI开发平台ModelArts > API参考 > 历史API > 数据管理（旧版）
更新节点池 - AI开发平台ModelArts

NodePoolSpec object 更新节点池的请求体。表4 NodePoolSpec 参数是否必选参数类型描述 resources 是 PoolResource object 节点池中的资源信息列表，包括资源规格和相应规格的资源数量，自定义配置等。表5 PoolResource

帮助中心 > AI开发平台ModelArts > API参考 > 节点池管理
创建工作流定时调度 - AI开发平台ModelArts

WorkflowSchedulePolicies 参数是否必选参数类型描述 on_failure 否 String 定时调度策略中的标记，失败时触发。 on_running 否 String 定时调度策略中的标记，running时触发。响应参数状态码：201 表4 响应Body参数参数参数类型描述 type

帮助中心 > AI开发平台ModelArts > API参考 > Workflow工作流管理
查询训练作业标签 - AI开发平台ModelArts

of TmsTag objects TMS的标签结构体。表3 TmsTag 参数参数类型描述 key String TMS标签的key。长度不能超过128个字符，首尾不能有空格，不能以_sys_开头。 value String TMS标签的value。长度不能超过255个字符。

帮助中心 > AI开发平台ModelArts > API参考 > 训练管理
创建DevServer - AI开发平台ModelArts

String 服务器所属的超节点资源id。表9 Endpoints 参数参数类型描述 allowed_access_ips Array of strings 允许通过SSH协议访问Notebook的公网IP地址白名单列表，默认都可以访问。当配置指定IP后，则仅允许IP所在的客户端实现对Notebook的访问。

帮助中心 > AI开发平台ModelArts > API参考 > DevServer管理
执行训练任务 - AI开发平台ModelArts

必须修改。用于指定模板。如果设置为"qwen"，则使用Qwen模板进行训练，模板选择可参照表1中的template列 output_dir /home/ma-user/ws/Qwen2-72B/sft-4096 必须修改。指定输出目录。训练过程中生成的模型参数和日志文件将保存在这个目录下。用户根据自己实际要求适配。

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配LlamaFactory PyTorch NPU训练指导（6.3.910）
执行训练任务 - AI开发平台ModelArts

必须修改。用于指定模板。如果设置为"qwen"，则使用Qwen模板进行训练，模板选择可参照表1中的template列 output_dir /home/ma-user/ws/Qwen2-72B/sft-4096 必须修改。指定输出目录。训练过程中生成的模型参数和日志文件将保存在这个目录下。用户根据自己实际要求适配。

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配LlamaFactory PyTorch NPU训练指导（6.3.909）
总览Workflow工作流 - AI开发平台ModelArts

在创建并使用的工作空间，以实际取值为准。 search_type 否 String 过滤方式。可选值如下： equal表示精确匹配。 contain表示模糊匹配。具体过滤的字段，由各个接口额外定义参数。例如Workflow支持按照名称（name）进行过滤，则相应的过滤字段为na

帮助中心 > AI开发平台ModelArts > API参考 > Workflow工作流管理
服务启动后，状态断断续续处于“告警中” - AI开发平台ModelArts

to process the new request 原因分析该报错是因为发送预测请求后，服务出现停止后又启动的情况。处理方法需要您检查服务使用的镜像，确定服务停止的原因，修复问题。重新创建模型部署服务。父主题：服务部署

 帮助中心 > AI开发平台ModelArts > 故障排除 > 推理部署 > 服务部署
报错“The VS Code Server failed to start”如何解决？ - AI开发平台ModelArts

Ctrl+Shift+P，macOS：Cmd+Shift+P），搜索“Kill VS Code Server on Host”，选择出问题的实例进行自动清除，然后重新进行连接。图1 清除异常的实例父主题： VS Code连接开发环境失败故障处理

 帮助中心 > AI开发平台ModelArts > 故障排除 > 开发环境 > VS Code连接开发环境失败故障处理
调优数据集异常日志说明 - AI开发平台ModelArts

like ["conversation_id", "text"]. 对于csv、xlsx文件，平台会根据训练类型的不同，将其转为Alpaca格式或MOSS格式，选择预期的数据类型无效。父主题： Studio

帮助中心 > AI开发平台ModelArts > 常见问题 > Studio
部署在线服务出现报错No CUDA runtime is found - AI开发平台ModelArts

py中添加一行代码os.system('nvcc -V)查看该镜像的cuda版本（customize_service.py编写指导请见模型推理代码编写说明）。确认该cuda版本与您安装的mmcv版本是否匹配。部署时是否需要使用GPU，取决于的模型需要用到CPU还是GPU，以及推理脚本如何编写。

帮助中心 > AI开发平台ModelArts > 故障排除 > 推理部署 > 服务部署
重启可视化作业 - AI开发平台ModelArts

请求是否成功。 error_code String 调用失败时的错误码，具体请参见错误码。调用成功时无此字段。 error_message String 调用失败时的错误信息。调用成功时无此字段。请求示例如下以重启作业ID为10的可视化作业为例。 POST https://e

帮助中心 > AI开发平台ModelArts > API参考 > 历史API > 训练管理（旧版） > 可视化作业

总条数： 2291

点击加载更多

您搜索到想要的结果了吗？

是的没搜到

意见反馈

/200

提交反馈取消

训练脚本说明 - AI开发平台ModelArts

获取动态挂载OBS实例信息列表 - AI开发平台ModelArts

训练脚本说明参考 - AI开发平台ModelArts

查询DevServer实例详情 - AI开发平台ModelArts

MoXing - AI开发平台ModelArts

Cluster资源池节点故障如何定位 - AI开发平台ModelArts

启动DevServer实例 - AI开发平台ModelArts

创建团队标注任务 - AI开发平台ModelArts

更新节点池 - AI开发平台ModelArts

创建工作流定时调度 - AI开发平台ModelArts

查询训练作业标签 - AI开发平台ModelArts

创建DevServer - AI开发平台ModelArts

执行训练任务 - AI开发平台ModelArts

执行训练任务 - AI开发平台ModelArts

总览Workflow工作流 - AI开发平台ModelArts

服务启动后，状态断断续续处于“告警中” - AI开发平台ModelArts

报错“The VS Code Server failed to start”如何解决？ - AI开发平台ModelArts

调优数据集异常日志说明 - AI开发平台ModelArts

部署在线服务出现报错No CUDA runtime is found - AI开发平台ModelArts

重启可视化作业 - AI开发平台ModelArts

意见反馈

7*24

备案

专业服务

退订

建议反馈

售前咨询热线