搜索_华为云

已找到以下 2647 条记录

AI智能搜索

产品选择

AI开发平台ModelArts

所有产品

弹性云服务器 ECS

Flexus云服务

裸金属服务器 BMS

云手机服务器 CPH

专属主机 DeH

弹性伸缩 AS

镜像服务 IMS

函数工作流 FunctionGraph

云耀云服务器（旧版）

VR云渲游平台 CVR

Huawei Cloud EulerOS

对象存储服务 OBS

云硬盘 EVS

云备份 CBR

高性能弹性文件服务 SFS Turbo

弹性文件服务 SFS

存储容灾服务 SDRS

云硬盘备份 VBS

云服务器备份 CSBS

数据快递服务 DES

云存储网关 CSG

专属分布式存储服务 DSS

数据工坊 DWR

地图数据 MapDS

键值存储服务 KVS

虚拟私有云 VPC

弹性公网IP EIP

弹性负载均衡 ELB

NAT网关 NAT

云专线 DC

虚拟专用网络 VPN

云连接 CC

VPC终端节点 VPCEP

企业路由器 ER

企业交换机 ESW

全球加速 GA

企业连接 EC

云容器引擎 CCE

云容器实例 CCI

容器镜像服务 SWR

云原生服务中心 OSC

应用服务网格 ASM

华为云UCS

内容分发网络 CDN

智能边缘云 IEC

智能边缘平台 IEF

CloudPond云服务

云数据库 RDS

数据复制服务 DRS

文档数据库服务 DDS

分布式数据库中间件 DDM

云数据库 GaussDB

云数据库 GeminiDB

数据管理服务 DAS

数据库和应用迁移 UGO

云数据库 TaurusDB

安全技术与应用

Web应用防火墙 WAF

企业主机安全 HSS

云防火墙 CFW

安全云脑 SecMaster

DDoS防护 AAD

数据加密服务 DEW

数据库安全服务 DBSS

云堡垒机 CBH

数据安全中心 DSC

云证书管理服务 CCM

威胁检测服务 MTD

态势感知 SA

认证测试中心 CTC

边缘安全 EdgeSec

AI开发平台ModelArts

华为HiLens

图引擎服务 GES

图像识别 Image

文字识别 OCR

自然语言处理 NLP

内容审核 Moderation

图像搜索 ImageSearch

医疗智能体 EIHealth

企业级AI应用开发专业套件 ModelArts Pro

人脸识别服务 FRS

对话机器人服务 CBS

语音交互服务 SIS

人证核身服务 IVS

视频智能分析服务 VIAS

城市智能体

自动驾驶云服务 Octopus

盘古大模型 PanguLargeModels

MapReduce服务 MRS

MRS on CCE

数据湖探索 DLI

表格存储服务 CloudTable

可信智能计算服务 TICS

推荐系统 RES

云搜索服务 CSS

数据可视化 DLV

数据接入服务 DIS

数据仓库服务 GaussDB(DWS)

数据治理中心 DataArts Studio

湖仓构建 LakeFormation

智能数据洞察 DataArts Insight

设备接入 IoTDA

IoT物联网

全球SIM联接 GSL

IoT数据分析 IoTA

路网数字化服务 DRIS

IoT边缘 IoTEdge

设备发放 IoTDP

微服务引擎 CSE

分布式消息服务Kafka版

分布式消息服务RabbitMQ版

分布式消息服务RocketMQ版

API网关 APIG

分布式缓存服务 DCS

多活高可用服务 MAS

事件网格 EG

域名注册服务 Domains

云解析服务 DNS

企业门户 EWP

ICP备案

商标注册

华为云WeLink

华为云会议 Meeting

隐私保护通话 PrivateNumber

语音通话 VoiceCall

消息&短信 MSGSMS

云管理网络

SD-WAN 云服务

边缘数据中心管理 EDCM

云桌面 Workspace

应用与数据集成平台 ROMA Connect

ROMA资产中心 ROMA Exchange

API全生命周期管理 ROMA API

政企自服务管理 ESM

应用平台 AppStage

开天企业工作台 MSSE

开天集成工作台 MSSI

API中心 API Hub

云消息服务 KooMessage

交换数据空间 EDS

云地图服务 KooMap

云手机服务 KooPhone

组织成员账号 OrgID

云空间服务 KooDrive

实时音视频 SparkRTC

视频直播 Live

视频点播 VOD

媒体处理 MPC

视频接入服务 VIS

数字内容生产线 MetaStudio

统一身份认证服务 IAM

消息通知服务 SMN

云监控服务 CES

应用运维管理 AOM

应用性能管理 APM

云日志服务 LTS

云审计服务 CTS

标签管理服务 TMS

配置审计 Config

应用身份管理服务 OneAccess

资源访问管理 RAM

组织 Organizations

资源编排服务 RFS

优化顾问 OA

IAM 身份中心

云运维中心 COC

资源治理中心 RGC

主机迁移服务 SMS

对象存储迁移服务 OMS

云数据迁移 CDM

迁移中心 MGC

区块链服务 BCS

可信跨链服务 TCS

可信分布式身份服务 TDIS

数字资产链 DAC

华为云区块链引擎服务 HBS

专属计算集群 DCC

高性能计算 HPC

SAP

混合云灾备

开天工业工作台 MIW

Haydn解决方案工厂

数字化诊断治理专家服务

SDK开发指南

API签名指南

DevStar

华为云命令行工具服务 KooCLI

Huawei Cloud Toolkit

CodeArts API

成本优化最佳实践

专属云商业逻辑

云架构中心

云商店

合作伙伴中心

华为云开发者学堂

华为云慧通差旅

账号中心

费用中心

成本中心

资源中心

企业管理

工单管理

客户运营能力

国际站常见问题

支持计划

专业服务

合作伙伴支持计划

我的凭证

华为云公共事业服务云平台

管理控制台

消息中心

产品价格详情

系统权限

客户关联华为云合作伙伴须知

公共问题

宽限期保留期

奖励推广计划

活动

云服务信任体系能力说明

工业数字模型驱动引擎

硬件开发工具链平台云服务

工业数据转换引擎云服务

软件开发生产线 CodeArts

需求管理 CodeArts Req

流水线 CodeArts Pipeline

代码检查 CodeArts Check

编译构建 CodeArts Build

部署 CodeArts Deploy

测试计划 CodeArts TestPlan

制品仓库 CodeArts Artifact

移动应用测试 MobileAPPTest

CodeArts IDE Online

Classroom

开源镜像站 Mirrors

性能测试 CodeArts PerfTest

应用管理与运维平台 ServiceStage

云应用引擎 CAE

开源治理服务 CodeArts Governance

Astro轻应用 AstroZero

CodeArts IDE

Astro工作流 AstroFlow

代码托管 CodeArts Repo

漏洞管理服务 CodeArts Inspector

联接 CodeArtsLink

软件建模 CodeArts Modeling

Astro企业应用 AstroPro

智能开发助手 CodeArtsSnap

Astro大屏应用 AstroCanvas

没有找到结果，请重新输入

产品选择

AI开发平台ModelArts

在搜索结果页开启AI智能搜索

开启

产品选择

取消所有产品

弹性云服务器 ECS

Flexus云服务

裸金属服务器 BMS

云手机服务器 CPH

专属主机 DeH

弹性伸缩 AS

镜像服务 IMS

函数工作流 FunctionGraph

云耀云服务器（旧版）

VR云渲游平台 CVR

Huawei Cloud EulerOS

对象存储服务 OBS

云硬盘 EVS

云备份 CBR

高性能弹性文件服务 SFS Turbo

弹性文件服务 SFS

存储容灾服务 SDRS

云硬盘备份 VBS

云服务器备份 CSBS

数据快递服务 DES

云存储网关 CSG

专属分布式存储服务 DSS

数据工坊 DWR

地图数据 MapDS

键值存储服务 KVS

虚拟私有云 VPC

弹性公网IP EIP

弹性负载均衡 ELB

NAT网关 NAT

云专线 DC

虚拟专用网络 VPN

云连接 CC

VPC终端节点 VPCEP

企业路由器 ER

企业交换机 ESW

全球加速 GA

企业连接 EC

云容器引擎 CCE

云容器实例 CCI

容器镜像服务 SWR

云原生服务中心 OSC

应用服务网格 ASM

华为云UCS

内容分发网络 CDN

智能边缘云 IEC

智能边缘平台 IEF

CloudPond云服务

云数据库 RDS

数据复制服务 DRS

文档数据库服务 DDS

分布式数据库中间件 DDM

云数据库 GaussDB

云数据库 GeminiDB

数据管理服务 DAS

数据库和应用迁移 UGO

云数据库 TaurusDB

安全技术与应用

Web应用防火墙 WAF

企业主机安全 HSS

云防火墙 CFW

安全云脑 SecMaster

DDoS防护 AAD

数据加密服务 DEW

数据库安全服务 DBSS

云堡垒机 CBH

数据安全中心 DSC

云证书管理服务 CCM

威胁检测服务 MTD

态势感知 SA

认证测试中心 CTC

边缘安全 EdgeSec

AI开发平台ModelArts

华为HiLens

图引擎服务 GES

图像识别 Image

文字识别 OCR

自然语言处理 NLP

内容审核 Moderation

图像搜索 ImageSearch

医疗智能体 EIHealth

企业级AI应用开发专业套件 ModelArts Pro

人脸识别服务 FRS

对话机器人服务 CBS

语音交互服务 SIS

人证核身服务 IVS

视频智能分析服务 VIAS

城市智能体

自动驾驶云服务 Octopus

盘古大模型 PanguLargeModels

MapReduce服务 MRS

MRS on CCE

数据湖探索 DLI

表格存储服务 CloudTable

可信智能计算服务 TICS

推荐系统 RES

云搜索服务 CSS

数据可视化 DLV

数据接入服务 DIS

数据仓库服务 GaussDB(DWS)

数据治理中心 DataArts Studio

湖仓构建 LakeFormation

智能数据洞察 DataArts Insight

设备接入 IoTDA

IoT物联网

全球SIM联接 GSL

IoT数据分析 IoTA

路网数字化服务 DRIS

IoT边缘 IoTEdge

设备发放 IoTDP

微服务引擎 CSE

分布式消息服务Kafka版

分布式消息服务RabbitMQ版

分布式消息服务RocketMQ版

API网关 APIG

分布式缓存服务 DCS

多活高可用服务 MAS

事件网格 EG

域名注册服务 Domains

云解析服务 DNS

企业门户 EWP

ICP备案

商标注册

华为云WeLink

华为云会议 Meeting

隐私保护通话 PrivateNumber

语音通话 VoiceCall

消息&短信 MSGSMS

云管理网络

SD-WAN 云服务

边缘数据中心管理 EDCM

云桌面 Workspace

应用与数据集成平台 ROMA Connect

ROMA资产中心 ROMA Exchange

API全生命周期管理 ROMA API

政企自服务管理 ESM

应用平台 AppStage

开天企业工作台 MSSE

开天集成工作台 MSSI

API中心 API Hub

云消息服务 KooMessage

交换数据空间 EDS

云地图服务 KooMap

云手机服务 KooPhone

组织成员账号 OrgID

云空间服务 KooDrive

实时音视频 SparkRTC

视频直播 Live

视频点播 VOD

媒体处理 MPC

视频接入服务 VIS

数字内容生产线 MetaStudio

统一身份认证服务 IAM

消息通知服务 SMN

云监控服务 CES

应用运维管理 AOM

应用性能管理 APM

云日志服务 LTS

云审计服务 CTS

标签管理服务 TMS

配置审计 Config

应用身份管理服务 OneAccess

资源访问管理 RAM

组织 Organizations

资源编排服务 RFS

优化顾问 OA

IAM 身份中心

云运维中心 COC

资源治理中心 RGC

主机迁移服务 SMS

对象存储迁移服务 OMS

云数据迁移 CDM

迁移中心 MGC

区块链服务 BCS

可信跨链服务 TCS

可信分布式身份服务 TDIS

数字资产链 DAC

华为云区块链引擎服务 HBS

专属计算集群 DCC

高性能计算 HPC

SAP

混合云灾备

开天工业工作台 MIW

Haydn解决方案工厂

数字化诊断治理专家服务

SDK开发指南

API签名指南

DevStar

华为云命令行工具服务 KooCLI

Huawei Cloud Toolkit

CodeArts API

成本优化最佳实践

专属云商业逻辑

云架构中心

云商店

合作伙伴中心

华为云开发者学堂

华为云慧通差旅

账号中心

费用中心

成本中心

资源中心

企业管理

工单管理

客户运营能力

国际站常见问题

支持计划

专业服务

合作伙伴支持计划

我的凭证

华为云公共事业服务云平台

管理控制台

消息中心

产品价格详情

系统权限

客户关联华为云合作伙伴须知

公共问题

宽限期保留期

奖励推广计划

活动

云服务信任体系能力说明

工业数字模型驱动引擎

硬件开发工具链平台云服务

工业数据转换引擎云服务

软件开发生产线 CodeArts

需求管理 CodeArts Req

流水线 CodeArts Pipeline

代码检查 CodeArts Check

编译构建 CodeArts Build

部署 CodeArts Deploy

测试计划 CodeArts TestPlan

制品仓库 CodeArts Artifact

移动应用测试 MobileAPPTest

CodeArts IDE Online

Classroom

开源镜像站 Mirrors

性能测试 CodeArts PerfTest

应用管理与运维平台 ServiceStage

云应用引擎 CAE

开源治理服务 CodeArts Governance

Astro轻应用 AstroZero

CodeArts IDE

Astro工作流 AstroFlow

代码托管 CodeArts Repo

漏洞管理服务 CodeArts Inspector

联接 CodeArtsLink

软件建模 CodeArts Modeling

Astro企业应用 AstroPro

智能开发助手 CodeArtsSnap

Astro大屏应用 AstroCanvas

没有找到结果，请重新输入

停止回答

已停止生成

正在生成

展开

收起

了解详细信息

内容由大模型输出，仅供参考，请遵守《官网AI智能搜索服务声明》

您的反馈将帮助我们优化体验

理解有误

未理解指令

未理解上下文

回答不佳

内容错误

答非所问

回答不完整

逻辑混乱

格式错误

回答速度慢

没有帮助

/200

确定取消

模型NPU卡数、梯度累积值取值表 - AI开发平台ModelArts

模型NPU卡数、梯度累积值取值表不同模型推荐的训练参数和计算规格要求如表1所示。规格与节点数中的1*节点 & 4*Ascend表示单机4卡，以此类推。表1 NPU卡数、加速框架、梯度配置取值表模型模型参数量训练类型序列长度cutoff_len 梯度累积值优化工具(Deepspeed)

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于DevServer适配LlamaFactory PyTorch NPU训练指导（6.3.908） > 训练脚本说明
训练的数据集预处理说明 - AI开发平台ModelArts

训练的数据集预处理说明以 llama2-13b 举例，运行：0_pl_pretrain_13b.sh 训练脚本后，脚本检查是否已经完成数据集预处理的过程。如果已完成数据集预处理，则直接执行预训练任务。如果未进行数据集预处理，则会自动执行 scripts/llama2/1_preprocess_data

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于DevServer适配ModelLink PyTorch NPU训练指导（6.3.911） > 训练脚本说明参考
保存ckpt时超时报错 - AI开发平台ModelArts

保存ckpt时超时报错在多节点集群训练完成后，只有部分节点会保存权重，而其他节点会一直在等待通信。当等待时间超过36分钟时，会发生超时的错误。图1 报错提示解决方法 1. 需要保证磁盘IO带宽正常，可以在36分钟内将文件保存到磁盘。单个节点内，最大只有60G（实际应该在40

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于DevServer适配ModelLink PyTorch NPU训练指导（6.3.911） > 常见错误原因和解决方法
模型NPU卡数、梯度累积值取值表 - AI开发平台ModelArts

模型NPU卡数、梯度累积值取值表不同模型推荐的训练参数和计算规格要求如表1所示。规格与节点数中的1*节点 & 4*Ascend表示单机4卡，以此类推。表1 NPU卡数、加速框架、梯度配置取值表模型 Template 模型参数量训练策略类型序列长度cutoff_len 梯度累积值

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于DevServer适配LlamaFactory PyTorch NPU训练指导（6.3.911） > 训练脚本说明
多模态模型推理性能测试 - AI开发平台ModelArts

多模态模型推理性能测试 benchmark方法介绍静态性能测试：评估在固定输入、固定输出和固定并发下，模型的吞吐与首token延迟。该方式实现简单，能比较清楚的看出模型的性能和输入输出长度、以及并发的关系。性能benchmark验证使用到的脚本存放在代码包AscendCloud-LLM-xxx

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Server适配PyTorch NPU推理指导（6.3.909） > 推理性能测试
语言模型推理性能测试 - AI开发平台ModelArts

语言模型推理性能测试 benchmark方法介绍性能benchmark包括两部分。静态性能测试：评估在固定输入、固定输出和固定并发下，模型的吞吐与首token延迟。该方式实现简单，能比较清楚的看出模型的性能和输入输出长度、以及并发的关系。动态性能测试：评估在请求并发在一定范

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Server适配PyTorch NPU推理指导（6.3.910） > 推理性能测试
多模态模型推理性能测试 - AI开发平台ModelArts

多模态模型推理性能测试 benchmark方法介绍静态性能测试：评估在固定输入、固定输出和固定并发下，模型的吞吐与首token延迟。该方式实现简单，能比较清楚的看出模型的性能和输入输出长度、以及并发的关系。性能benchmark验证使用到的脚本存放在代码包AscendCloud-LLM-xxx

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Server适配PyTorch NPU推理指导（6.3.910） > 推理性能测试
附录：基于vLLM不同模型推理支持最小卡数和最大序列说明 - AI开发平台ModelArts

附录：基于vLLM不同模型推理支持最小卡数和最大序列说明基于vLLM（v0.6.0）部署推理服务时，不同模型推理支持的最小昇腾卡数和对应卡数下的max-model-len长度说明，如下面的表格所示。以下值是在gpu-memory-utilization为0.9时测试得出，为服

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Server适配PyTorch NPU推理指导（6.3.910）
多模态模型推理性能测试 - AI开发平台ModelArts

多模态模型推理性能测试 benchmark方法介绍静态性能测试：评估在固定输入、固定输出和固定并发下，模型的吞吐与首token延迟。该方式实现简单，能比较清楚的看出模型的性能和输入输出长度、以及并发的关系。性能benchmark验证使用到的脚本存放在代码包AscendCloud-LLM-xxx

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Server适配PyTorch NPU推理指导（6.3.911） > 推理性能测试
MA-Advisor和Ascend-Insigh工具使用指导 - AI开发平台ModelArts

MA-Advisor和Ascend-Insigh工具使用指导 MA-Advisor：一款昇腾迁移性能问题自动诊断工具，支持对推理、训练等多种场景进行自动诊断。自动诊断工具可以有效减少人工分析profiling的耗时，降低性能调优的门槛，帮助客户快速识别性能瓶颈点并完成性能优化。推

 帮助中心 > AI开发平台ModelArts > 最佳实践 > GPU业务迁移至昇腾训练推理 > GPU训练业务迁移至昇腾的通用指导 > PyTorch迁移性能调优
保存ckpt时超时报错 - AI开发平台ModelArts

保存ckpt时超时报错在多节点集群训练完成后，只有部分节点会保存权重，而其他节点会一直在等待通信。当等待时间超过36分钟时，会发生超时的错误。图1 报错提示解决方法 1. 需要保证磁盘IO带宽正常，可以在36分钟内将文件保存到磁盘。单个节点内，最大只有60G（实际应该在40

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于DevServer适配ModelLink PyTorch NPU训练指导（6.3.907） > 常见错误原因和解决方法
报错“Failed to install the VS Code Server.”或“tar: Error is not recoverable: exitng now.”如何解决？ - AI开发平台ModelArts

报错“Failed to install the VS Code Server.”或“tar: Error is not recoverable: exitng now.”如何解决？问题现象或原因分析可能为/home/ma-user/work磁盘空间不足。解决方法删除

 帮助中心 > AI开发平台ModelArts > 常见问题 > Standard Notebook > VS Code连接开发环境失败常见问题
报错“Bad owner or permissions on C:\Users\Administrator/.ssh/config”或“Connection permission denied (publickey)”如何解决？ - AI开发平台ModelArts

报错“Bad owner or permissions on C:\Users\Administrator/.ssh/config”或“Connection permission denied (publickey)”如何解决？问题现象报错“Bad owner or permissions

帮助中心 > AI开发平台ModelArts > 常见问题 > Standard Notebook > VS Code连接开发环境失败常见问题
附录：基于vLLM不同模型推理支持最小卡数和最大序列说明 - AI开发平台ModelArts

附录：基于vLLM不同模型推理支持最小卡数和最大序列说明基于vLLM（v0.5.0）部署推理服务时，不同模型推理支持的最小昇腾卡数和对应卡数下的max-model-len长度说明，如下面的表格所示。以下值是在gpu-memory-utilization为0.9时测试得出，为服

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于DevServer适配PyTorch NPU推理指导（6.3.908）
使用Server-Sent Events协议的方式访问在线服务 - AI开发平台ModelArts

调用API访问在线服务时，对预测请求体大小和预测时间有限制：请求体的大小不超过12MB，超过后请求会被拦截。因APIG（API网关）限制，平台每次请求预测的时间不超过40秒。 SSE在线服务调用 SSE协议本身不提供额外的认证方式，和HTTP请求方式一致。可以使用ModelArts提供的以下认证方式：

帮助中心 > AI开发平台ModelArts > ModelArts用户指南（Standard） > 使用ModelArts Standard部署模型并推理预测 > 将模型部署为实时推理作业 > 访问在线服务支持的传输协议
报错“Failed to install the VS Code Server.”或“tar: Error is not recoverable: exiting now.”如何解决？ - AI开发平台ModelArts

报错“Failed to install the VS Code Server.”或“tar: Error is not recoverable: exiting now.”如何解决？问题现象或原因分析可能为/home/ma-user/work磁盘空间不足。解决方法删

 帮助中心 > AI开发平台ModelArts > 故障排除 > 开发环境 > VS Code连接开发环境失败故障处理
在ModelArts控制台界面上单击VS Code接入并在新界面单击打开，未弹出VS Code窗口 - AI开发平台ModelArts

在ModelArts控制台界面上单击VS Code接入并在新界面单击打开，未弹出VS Code窗口原因分析未安装VS Code或者安装版本过低。解决方法下载并安装VS Code（Windows用户请单击“Win”，其他用户请单击“其他”下载），安装完成后单击“刷新”完成连接。

帮助中心 > AI开发平台ModelArts > 故障排除 > 开发环境 > VS Code连接开发环境失败故障处理
语言模型推理性能测试 - AI开发平台ModelArts

语言模型推理性能测试 benchmark方法介绍性能benchmark包括两部分。静态性能测试：评估在固定输入、固定输出和固定并发下，模型的吞吐与首token延迟。该方式实现简单，能比较清楚的看出模型的性能和输入输出长度、以及并发的关系。动态性能测试：评估在请求并发在一定范

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Server适配PyTorch NPU推理指导（6.3.909） > 推理性能测试
附录：基于vLLM不同模型推理支持最小卡数和最大序列说明 - AI开发平台ModelArts

附录：基于vLLM不同模型推理支持最小卡数和最大序列说明基于vLLM（v0.6.3）部署推理服务时，不同模型推理支持的最小昇腾卡数和对应卡数下的max-model-len长度说明，如下面的表格所示。以下值是在gpu-memory-utilization为0.9时测试得出，为服

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Server适配PyTorch NPU推理指导（6.3.911）
保存ckpt时超时报错 - AI开发平台ModelArts

保存ckpt时超时报错在多节点集群训练完成后，只有部分节点会保存权重，而其他节点会一直在等待通信。当等待时间超过36分钟时，会发生超时的错误。图1 报错提示解决方法 1. 需要保证磁盘IO带宽正常，可以在36分钟内将文件保存到磁盘。单个节点内，最大只有60G（实际应该在40

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于DevServer适配ModelLink PyTorch NPU训练指导（6.3.908） > 常见错误原因和解决方法

总条数： 2647

点击加载更多

您搜索到想要的结果了吗？

是的没搜到

意见反馈

/200

提交反馈取消

模型NPU卡数、梯度累积值取值表 - AI开发平台ModelArts

训练的数据集预处理说明 - AI开发平台ModelArts

保存ckpt时超时报错 - AI开发平台ModelArts

模型NPU卡数、梯度累积值取值表 - AI开发平台ModelArts

多模态模型推理性能测试 - AI开发平台ModelArts

语言模型推理性能测试 - AI开发平台ModelArts

多模态模型推理性能测试 - AI开发平台ModelArts

附录：基于vLLM不同模型推理支持最小卡数和最大序列说明 - AI开发平台ModelArts

多模态模型推理性能测试 - AI开发平台ModelArts

MA-Advisor和Ascend-Insigh工具使用指导 - AI开发平台ModelArts

保存ckpt时超时报错 - AI开发平台ModelArts

报错“Failed to install the VS Code Server.”或“tar: Error is not recoverable: exitng now.”如何解决？ - AI开发平台ModelArts

报错“Bad owner or permissions on C:\Users\Administrator/.ssh/config”或“Connection permission denied (publickey)”如何解决？ - AI开发平台ModelArts

附录：基于vLLM不同模型推理支持最小卡数和最大序列说明 - AI开发平台ModelArts

使用Server-Sent Events协议的方式访问在线服务 - AI开发平台ModelArts

报错“Failed to install the VS Code Server.”或“tar: Error is not recoverable: exiting now.”如何解决？ - AI开发平台ModelArts

在ModelArts控制台界面上单击VS Code接入并在新界面单击打开，未弹出VS Code窗口 - AI开发平台ModelArts

语言模型推理性能测试 - AI开发平台ModelArts

附录：基于vLLM不同模型推理支持最小卡数和最大序列说明 - AI开发平台ModelArts

保存ckpt时超时报错 - AI开发平台ModelArts

意见反馈

7*24

备案

专业服务

退订

建议反馈

售前咨询热线