搜索_华为云

SFT全参微调训练 - AI开发平台ModelArts

sh ./scripts/install.sh; sh ./scripts/obs_pipeline.sh 如果镜像使用ECS中构建新镜像构建的新镜像时，训练作业启动命令中输入： cd /home/ma-user/modelarts/user-job-dir/AscendSpeed;

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Standard+OBS适配PyTorch NPU训练指导（6.3.910）
查询服务监控信息 - AI开发平台ModelArts

model_version String 模型版本。 invocation_times Number 模型实例的总调用次数。 failed_times Number 模型实例调用失败次数。 cpu_core_usage Float 已使用CPU核数。 cpu_core_total

帮助中心 > AI开发平台ModelArts > SDK参考 > 服务管理
使用python3.6-torch1.4版本镜像环境安装MMCV报错 - AI开发平台ModelArts

Please install mmcv>=1.3.1, <=1.5.0。原因分析 MMCV的依赖与PyTorch版本不匹配。处理方法可参考链接的内容，根据PyTorch和CUDA版本安装对应版本的MMCV。父主题：预置算法运行故障

 帮助中心 > AI开发平台ModelArts > 故障排除 > 训练作业 > 预置算法运行故障
返回结果 - AI开发平台ModelArts
返回结果 - AI开发平台ModelArts

对于获取用户Token接口，如果调用后返回状态码为“201”，则表示请求成功。响应消息头对应请求消息头，响应同样也有消息头，如“Content-type”。对于获取用户Token接口，返回如图1所示的消息头。其中“x-subject-token”就是需要获取的用户Toke

帮助中心 > AI开发平台ModelArts > API参考 > 如何调用API
在推理生产环境中部署推理服务 - AI开发平台ModelArts

--gpu-memory-utilization：NPU使用的显存比例，复用原vLLM的入参名称，默认为0.9。 --trust-remote-code：是否相信远程代码。 --distributed-executor-backend：多卡推理启动后端，可选值为"ray"或者"mp"，其中"ray"表示

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.908）
查询模型列表 - AI开发平台ModelArts

在ModelArts Notebook平台，Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。场景1：查询当前用户所有模型 1 2 3 4 5 6 from modelarts.session import Session from modelarts

帮助中心 > AI开发平台ModelArts > SDK参考 > 模型管理
监控安全风险 - AI开发平台ModelArts

监控安全风险 ModelArts支持监控ModelArts在线服务和对应模型负载，执行自动实时监控、告警和通知操作，帮助用户更好地了解服务和模型的各项性能指标。详细内容请参见ModelArts支持的监控指标。父主题：安全

 帮助中心 > AI开发平台ModelArts > 产品介绍 > 安全
查询AI应用详情 - AI开发平台ModelArts

取当前用户拥有的AI应用，其中model_id字段即为模型ID。 project_id 是 String 用户项目ID。获取方法请参见获取项目ID和名称。请求参数表2 请求Header参数参数是否必选参数类型描述 X-Auth-Token 是 String 用户Tok

帮助中心 > AI开发平台ModelArts > API参考 > AI应用管理
查询模型对象列表 - AI开发平台ModelArts

在ModelArts Notebook平台，Session鉴权无需输入鉴权参数。其它平台的Session鉴权请参见Session鉴权。场景1：查询当前用户所有模型对象 1 2 3 4 5 6 from modelarts.session import Session from modelarts

帮助中心 > AI开发平台ModelArts > SDK参考 > 模型管理
查询数据集列表 - AI开发平台ModelArts

查询数据集列表分页查询用户的数据集列表。 list_datasets(session, dataset_type=None, dataset_name=None, offset=None, limit=None) 示例代码示例一：查询数据集列表 from modelarts.session

帮助中心 > AI开发平台ModelArts > SDK参考 > 数据管理 > 数据集管理
MXNet创建kvstore时程序被阻塞，无报错 - AI开发平台ModelArts

'2'”为打印所有的通信信息。“os.environ['PS_RESEND'] = '1'”为在“PS_RESEND_TIMEOUT”毫秒后没有收到ACK消息，Van实例会重发消息。父主题：业务代码问题

 帮助中心 > AI开发平台ModelArts > 故障排除 > 训练作业 > 业务代码问题
在线服务预测报错ModelArts.4302 - AI开发平台ModelArts

service due to connection refused. " 出现该报错有两种情况：流量超过了模型的处理能力。可以考虑降低流量或者增加模型实例数量。镜像自身有问题。需要单独运行镜像确保镜像本身能正确提供服务。 "error_msg"："Due to self protection

帮助中心 > AI开发平台ModelArts > 故障排除 > 推理部署 > 服务预测
Cluster资源池节点故障如何定位 - AI开发平台ModelArts

可能是亚健康，建议先重启节点，若重启节点后未恢复，发起维修流程。 NT_NPU_NET NPU 链路 npu dcmi net异常。 NPU网络链接异常。可能是亚健康，建议先重启节点，若重启节点后未恢复，发起维修流程。 NT_NPU_CARD_LOSE NPU 掉卡 NPU卡丢失。

帮助中心 > AI开发平台ModelArts > 故障排除 > Lite Cluster
TPE算法优化的超参数必须是分类特征（categorical features）吗 - AI开发平台ModelArts

TPE算法优化的超参数必须是分类特征（categorical features）吗对于优化的超参数类型，TPE算法本身是没有限制的，但出于面对普通用户节省资源的目的，ModelArts在前端限制了TPE的超参数必须是float，如果想离散型和连续型参数混用的话，可以调用rest接口。父主题：

帮助中心 > AI开发平台ModelArts > 常见问题 > Standard训练作业 > 功能咨询
在Notebook中使用tensorboard命令打开日志文件报错Permission denied - AI开发平台ModelArts

--logdir ./命令，报错[Errno 13] Permission denied……。原因分析当前目录下包含没有权限的文件。解决方法建议用户新建一个文件夹（例如：tb_logs），将tensorboard的日志文件（例如：tb.events）放到新建的文件夹下，然后执行tensorboard命令。示例命令如下：

帮助中心 > AI开发平台ModelArts > 常见问题 > Standard Notebook > 更多功能咨询
如何在代码中打印GPU使用信息 - AI开发平台ModelArts

如何在代码中打印GPU使用信息用户可通过shell命令或python命令查询GPU使用信息。使用shell命令执行nvidia-smi命令。依赖CUDA nvcc watch -n 1 nvidia-smi 执行gpustat命令。 pip install gpustat

帮助中心 > AI开发平台ModelArts > 常见问题 > Standard Notebook > 更多功能咨询
在Notebook中使用tensorboard命令打开日志文件报错Permission denied - AI开发平台ModelArts

--logdir ./命令，报错[Errno 13] Permission denied……。原因分析当前目录下包含没有权限的文件。解决方法建议用户新建一个文件夹（例如：tb_logs），将tensorboard的日志文件（例如：tb.events）放到新建的文件夹下，然后执行tensorboard命令。示例命令如下：

帮助中心 > AI开发平台ModelArts > 故障排除 > 开发环境 > 其他故障
批量添加样本 - AI开发平台ModelArts

cluster_id 否 String MRS集群ID。可登录MRS控制台查看。 cluster_mode 否 String MRS集群运行模式。可选值如下： 0：普通集群 1：安全集群 cluster_name 否 String MRS集群名称。可登录MRS控制台查看。 database_name

帮助中心 > AI开发平台ModelArts > API参考 > 历史API > 数据管理（旧版）
训练作业日志中提示“No such file or directory” - AI开发平台ModelArts

_url”。使用“data_url”当做训练数据输入的本地路径。检查报错的路径是否存在由于用户本地开发的代码需要上传至ModelArts后台，训练代码中涉及到依赖文件的路径时，用户设置有误的场景较多。推荐通用的解决方案：使用os接口得到依赖文件的绝对路径，避免报错。示例：

帮助中心 > AI开发平台ModelArts > 故障排除 > 训练作业 > 云上迁移适配故障
在Notebook中，如何使用昇腾多卡进行调试？ - AI开发平台ModelArts

昇腾多卡训练任务是多进程多卡模式，跑几卡需要起几个python进程。昇腾底层会读取环境变量：RANK_TABLE_FILE，开发环境已经设置，用户无需关注。比如跑八卡，可以如下片段代码： export RANK_SIZE=8 current_exec_path=$(pwd) echo

帮助中心 > AI开发平台ModelArts > 常见问题 > Standard Notebook > 更多功能咨询

总条数： 1994

上一页
1
...
81
82
83
...
100
下一页
跳转

点击加载更多

您搜索到想要的结果了吗？

是的没搜到

意见反馈

/200

提交反馈取消

SFT全参微调训练 - AI开发平台ModelArts

查询服务监控信息 - AI开发平台ModelArts

使用python3.6-torch1.4版本镜像环境安装MMCV报错 - AI开发平台ModelArts

返回结果 - AI开发平台ModelArts

在推理生产环境中部署推理服务 - AI开发平台ModelArts

查询模型列表 - AI开发平台ModelArts

监控安全风险 - AI开发平台ModelArts

查询AI应用详情 - AI开发平台ModelArts

查询模型对象列表 - AI开发平台ModelArts

查询数据集列表 - AI开发平台ModelArts

MXNet创建kvstore时程序被阻塞，无报错 - AI开发平台ModelArts

在线服务预测报错ModelArts.4302 - AI开发平台ModelArts

Cluster资源池节点故障如何定位 - AI开发平台ModelArts

TPE算法优化的超参数必须是分类特征（categorical features）吗 - AI开发平台ModelArts

在Notebook中使用tensorboard命令打开日志文件报错Permission denied - AI开发平台ModelArts

如何在代码中打印GPU使用信息 - AI开发平台ModelArts

在Notebook中使用tensorboard命令打开日志文件报错Permission denied - AI开发平台ModelArts

批量添加样本 - AI开发平台ModelArts

训练作业日志中提示“No such file or directory” - AI开发平台ModelArts

在Notebook中，如何使用昇腾多卡进行调试？ - AI开发平台ModelArts

意见反馈

7*24

备案

专业服务

退订

建议反馈

售前咨询热线