搜索_华为云

通过patch操作对服务进行更新 - AI开发平台ModelArts

请求链路编号，可用于日志追踪表6 响应Body参数参数参数类型描述 update_time String 本次更新时间，仅触发服务配置升级时会返回，比如修改config参数，可根据此时间从服务更新记录中过滤出此次的更新结果；修改描述或启停服务不会返回此参数。 resource_ids

帮助中心 > AI开发平台ModelArts > API参考 > 服务管理
查询算法详情 - AI开发平台ModelArts

metadata metadata object 算法的元数据，描述算法基本信息。 job_config job_config object 算法配置信息，如启动文件等。 resource_requirements Array of resource_requirements objects

帮助中心 > AI开发平台ModelArts > API参考 > 训练管理
查询训练作业列表 - AI开发平台ModelArts

n_id+item_version_id则无需填写。 autosearch_config_path String 自动化搜索作业的yaml配置路径，需要提供一个OBS路径。 autosearch_framework_path String 自动化搜索作业的框架代码目录，需要提供一个OBS路径。

帮助中心 > AI开发平台ModelArts > SDK参考 > 训练管理 > 训练作业
日志提示"Permission denied" - AI开发平台ModelArts

在创建训练作业前，推荐您先使用ModelArts开发环境调试训练代码，避免代码迁移过程中的错误。直接使用线上notebook环境调试请参考使用JupyterLab开发模型。配置本地IDE（Pycharm或者VSCode）联接云上环境调试请参考使用本地IDE开发模型。父主题：权限问题

 帮助中心 > AI开发平台ModelArts > 故障排除 > 训练作业 > 权限问题
下载JupyterLab文件到本地 - AI开发平台ModelArts

Browser+下载数据或文件夹。使用OBS下载文件的操作指导，请参见下载文件。方式二：使用ModelArts SDK进行下载在您的本地环境下载并安装ModelArts SDK。完成ModelArts SDK的Session鉴权。将OBS中的文件下载到本地，详情请参见从OBS下载数据。示例代码如下：

帮助中心 > AI开发平台ModelArts > ModelArts用户指南（Standard） > 使用Notebook进行AI开发调试 > 通过JupyterLab在线使用Notebook实例进行AI开发
附录：训练常见问题 - AI开发平台ModelArts

duleNotFoundError: No module named 'tyro'" 错误截图：报错原因：未指定tyro依赖包版本，导致安装依赖为最新0.9.0版本导致与其他依赖冲突解决措施：任务前容器内更新'tyro'版本为0.8.14或以下版本 pip install tyro==0

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配LlamaFactory PyTorch NPU训练指导（6.3.910）
附录：训练常见问题 - AI开发平台ModelArts

duleNotFoundError: No module named 'tyro'" 错误截图：报错原因：未指定tyro依赖包版本，导致安装依赖为最新0.9.0版本导致与其他依赖冲突解决措施：任务前容器内更新'tyro'版本为0.8.14或以下版本 pip install tyro==0

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配LlamaFactory PyTorch NPU训练指导（6.3.911）
构建条件节点控制分支执行 - AI开发平台ModelArts

存储的是节点名称；此时if_then_steps中的step跳过不执行。使用案例根据需求参考简单示例或进阶示例。简单示例通过参数配置实现 import modelarts.workflow as wf left_value = wf.Placeholder(name="left_value"

帮助中心 > AI开发平台ModelArts > ModelArts用户指南（Standard） > 使用Workflow实现低代码AI开发 > 开发Workflow命令参考 > 构建Workflow多分支运行场景
扩缩容Lite Cluster资源池 - AI开发平台ModelArts

”。“整柜”参数为创建资源池时选择，扩缩容时不可修改。用户通过增减“数量”来改变“目标总实例数”。在“专属资源池扩缩容”页面，设置“资源配置 > 可用区”，可用区可选择“随机分配”和“指定AZ”。选择随机分配时，扩缩容完成后，节点的可用区分布由系统后台随机选择。选择指定AZ

帮助中心 > AI开发平台ModelArts > ModelArts用户指南（Lite Cluster） > Lite Cluster资源管理
断点续训练 - AI开发平台ModelArts

ckpoint信息初始化训练状态即可。用户需要在代码里加上reload ckpt的代码，使能读取前一次训练保存的预训练模型。原有训练参数配置表1断点续训练中新加MODEL_PATH参数，并修改TRAIN_ITERS参数值。表1 断点续训练修改参数参数参考值参数说明 CKPT_LOAD_DIR

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > Baichuan2-13B模型基于DevServer适配PyTorch NPU训练指导（6.3.904） > 预训练
Standard资源池节点故障定位 - AI开发平台ModelArts

驱动升级 NPU升级。节点正在执行NPU驱动升级。 A200008 节点管理节点准入准入检测。节点正在进行节点准入检测，包括基本的节点配置检查和简单的业务验证。 A050933 节点管理容错Failover 当节点具有该污点时，会将节点上容错（Failover）业务迁移走。

帮助中心 > AI开发平台ModelArts > 故障排除 > 资源池
断点续训练 - AI开发平台ModelArts

/home/ma-user/ws/xxx-Ascend/llm_train/AscendSpeed/ 修改断点续训练参数。断点续训前，需要在原有训练参数配置表1中新加“MODEL_PATH”参数，并修改“TRAIN_ITERS”参数和“RUN_TYPE”参数。表1 断点续训练修改参数参数示例值

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > Qwen系列模型基于Lite Server适配PyTorch NPU训练指导（6.3.904） > 预训练
查询算法列表 - AI开发平台ModelArts

metadata metadata object 算法的元数据，描述算法基本信息。 job_config job_config object 算法配置信息，如启动文件等。 resource_requirements Array of resource_requirements objects

帮助中心 > AI开发平台ModelArts > API参考 > 训练管理
断点续训练 - AI开发平台ModelArts

/home/ma-user/ws/xxx-Ascend/llm_train/AscendSpeed/ 修改断点续训练参数。断点续训前，需要在原有训练参数配置表1中新加“MODEL_PATH”参数，并修改“TRAIN_ITERS”参数和“RUN_TYPE”参数。表1 断点续训练修改参数参数参考值

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > GLM3-6B模型基于DevServer适配PyTorch NPU训练指导（6.3.904） > 预训练
Ascend-vLLM推理常见问题 - AI开发平台ModelArts

completed 图3 服务端响应200 图4 仍返回报错Response payload is not completed 解决方法：安装brotlipy后返回正确报错 pip install brotlipy 问题10：使用benchmark-tools访问推理客户端返回报错或警告

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.3.912） > 附录
附录：训练常见问题 - AI开发平台ModelArts

duleNotFoundError: No module named 'tyro'" 错误截图：报错原因：未指定tyro依赖包版本，导致安装依赖为最新0.9.0版本导致与其他依赖冲突解决措施：任务前容器内更新'tyro'版本为0.8.14或以下版本 pip install tyro==0

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配LlamaFactory PyTorch NPU训练指导（6.3.912）
附录：训练常见问题 - AI开发平台ModelArts

duleNotFoundError: No module named 'tyro'" 错误截图：报错原因：未指定tyro依赖包版本，导致安装依赖为最新0.9.0版本导致与其他依赖冲突解决措施：任务前容器内更新'tyro'版本为0.8.14或以下版本 pip install tyro==0

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配LlamaFactory PyTorch NPU训练指导（6.5.901）
Ascend-vLLM推理常见问题 - AI开发平台ModelArts

completed 图3 服务端响应200 图4 仍返回报错Response payload is not completed 解决方法：安装brotlipy后返回正确报错 pip install brotlipy 问题10：使用benchmark-tools访问推理客户端返回报错或警告

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.5.901） > 附录
查看Notebook实例事件 - AI开发平台ModelArts

重要实例扩容完成（User %s updated storage size successfully）重要 UpdateKeyPair 配置实例密钥对（User %s updated the instance keypair to "{%s}"）重要更新实例密钥对（User

帮助中心 > AI开发平台ModelArts > ModelArts用户指南（Standard） > 使用Notebook进行AI开发调试 > 管理Notebook实例
附录：大模型推理常见问题 - AI开发平台ModelArts

self.inv_freq.npu() 问题6：使用Qwen2-7B、Qwen2-72B模型有精度问题，重复输出感叹号检查步骤六中4. 配置环境变量章节中，高精度模式的环境变量是否开启。问题7：使用autoAWQ进行qwen-7b模型量化时报错使用autoAWQ进行qwen

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.911）

总条数： 1719

点击加载更多

您搜索到想要的结果了吗？

是的没搜到

意见反馈

/200

提交反馈取消

通过patch操作对服务进行更新 - AI开发平台ModelArts

查询算法详情 - AI开发平台ModelArts

查询训练作业列表 - AI开发平台ModelArts

日志提示"Permission denied" - AI开发平台ModelArts

下载JupyterLab文件到本地 - AI开发平台ModelArts

附录：训练常见问题 - AI开发平台ModelArts

附录：训练常见问题 - AI开发平台ModelArts

构建条件节点控制分支执行 - AI开发平台ModelArts

扩缩容Lite Cluster资源池 - AI开发平台ModelArts

断点续训练 - AI开发平台ModelArts

Standard资源池节点故障定位 - AI开发平台ModelArts

断点续训练 - AI开发平台ModelArts

查询算法列表 - AI开发平台ModelArts

断点续训练 - AI开发平台ModelArts

Ascend-vLLM推理常见问题 - AI开发平台ModelArts

附录：训练常见问题 - AI开发平台ModelArts

附录：训练常见问题 - AI开发平台ModelArts

Ascend-vLLM推理常见问题 - AI开发平台ModelArts

查看Notebook实例事件 - AI开发平台ModelArts

附录：大模型推理常见问题 - AI开发平台ModelArts

意见反馈

7*24

备案

专业服务

退订

建议反馈

售前咨询热线