搜索_华为云

使用kv-cache-int8量化 - AI开发平台ModelArts

3fn"。dtype类型不影响int8的scale系数的抽取和加载。 Step3 启动kv-cache-int8量化服务参考Step3 启动推理服务，启动推理服务时添加如下命令。 --kv-cache-dtype int8 #只支持int8，表示kvint8量化 --quantization-param-path

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.911） > 推理模型量化
使用SmoothQuant量化工具转换权重 - AI开发平台ModelArts

--per-channel：权重量化方法，若指定则为per-channel粒度量化，否则为per-tensor粒度量化。启动smoothQuant量化服务。参考Step3 启动推理服务，启动推理服务时添加如下命令。 -q smoothquant 或者 --quantization smoothquant 父主题：

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.907） > 推理模型量化
使用AWQ量化工具转换权重 - AI开发平台ModelArts

/home/ma-user/Qwen1.5-72B-Chat-AWQ 参数说明： --model：模型路径。 Step3 启动AWQ量化服务参考Step3 启动推理服务，在启动服务时添加如下命令。 --q awq 或者--quantization awq 父主题：推理模型量化

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.906） > 推理模型量化
使用kv-cache-int8量化 - AI开发平台ModelArts

3fn"。dtype类型不影响int8的scale系数的抽取和加载。 Step3 启动kv-cache-int8量化服务参考Step3 启动推理服务，启动推理服务时添加如下命令。 --kv-cache-dtype int8 #只支持int8，表示kvint8量化 --quantization-param-path

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.906） > 推理模型量化
使用SmoothQuant量化 - AI开发平台ModelArts

如果指定则为per-channel粒度量化，否则为per-tensor粒度量化。启动smoothQuant量化服务。参考Step6 启动推理服务，启动推理服务时添加如下命令。 -q smoothquant 或者 --quantization smoothquant --dtype=float16

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于DevServer适配PyTorch NPU推理指导（6.3.907） > 推理模型量化
Eagle投机小模型训练 - AI开发平台ModelArts

训练一个自回归层。这使得其训练成本相较于训练一个独立的LLM模型要小得多。为每个模型提供针对性的投机模型： Eagle的模型大小及结构，与基模型的某一层完全相同，这使得它的大小远远小于其基模型。解决了对于部分原始LLM模型，找不到合适的投机模型的问题。投机小模型训练端到端示例

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配Ascend-vLLM PyTorch NPU推理指导（6.3.912） > 推理关键特性使用 > 投机推理
执行训练任务【新】 - AI开发平台ModelArts

tensor-model-parallel-size 8 表示张量并行。 pipeline-model-parallel-size 4 表示流水线并行。一般此值与训练节点数相等，与权重转换时设置的值相等。 context-parallel-size 1 表示context并行，默认为1。应用于训练长序列文本的

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Standard+OBS+SFS适配ModelLink PyTorch NPU训练指导（6.3.912） > 执行训练任务
Step1 创建用户组并加入用户 - AI开发平台ModelArts

骤介绍如何创建用户组、子账号、并将子账号加入用户组中。主用户登录管理控制台，单击右上角用户名，在下拉框中选择“统一身份认证”，进入IAM服务。图1 统一身份认证创建用户组。在左侧菜单栏中，选择“用户组”。单击右上角“创建用户组”，在“用户组名称”中填入“用户组02”，然后单击“确定”完成用户组创建。

帮助中心 > AI开发平台ModelArts > 最佳实践 > Standard权限管理 > 典型场景配置实践 > 配置ModelArts基本使用权限
使用AWQ量化 - AI开发平台ModelArts

/home/ma-user/Qwen1.5-72B-Chat-AWQ 参数说明： model：模型路径。 Step3 启动AWQ量化服务参考Step6 启动推理服务，在启动服务时添加如下命令。 -q awq 或者--quantization awq 父主题：推理模型量化

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Lite Server适配PyTorch NPU推理指导（6.3.911） > 推理模型量化
在云监控平台查看在线服务性能指标 - AI开发平台ModelArts

NPU显存使用率该指标用于统计ModelArts用户服务的NPU显存使用情况。单位：百分比。 ≥ 0% ModelArts模型负载 1分钟 successfully_called_times 调用成功次数统计ModelArts用户调用服务的成功次数。单位：次/分钟。 ≥Count/min

帮助中心 > AI开发平台ModelArts > ModelArts用户指南（Standard） > 使用ModelArts Standard部署模型并推理预测 > 管理同步在线服务
Standard支持的AI框架 - AI开发平台ModelArts

prebuilt PySpark 2.4.5 and is able to attach to preconfigured spark cluster including MRS and DLI. CPU 否是 mlstudio-pyspark2.3.2-ubuntu16.04 C

帮助中心 > AI开发平台ModelArts > 产品介绍 > 功能介绍 > Standard功能介绍
准备代码 - AI开发平台ModelArts
准备代码 - AI开发平台ModelArts

├── config ├── config.json # 请求的参数，根据实际启动的服务来调整 ├── mmlu_subject_mapping.json # 数据集配置

 帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于Standard适配PyTorch NPU推理指导（6.3.905） > 准备工作
创建预测分析项目 - AI开发平台ModelArts

数据校验：对您的数据集的数据进行校验，是否存在数据异常。预测分析：将发布好的数据集版本进行训练，生成对应的模型。模型注册：将训练后的结果注册到模型管理中。服务部署：将生成的模型部署为在线服务。快速查找创建好的项目在自动学习总览页，您可以通过搜索框，根据自动学习的属性类型（项目名称）快速搜索过滤到相应的工作流，可节省您的时间。

帮助中心 > AI开发平台ModelArts > ModelArts用户指南（Standard） > 使用自动学习实现零代码AI开发 > 使用自动学习实现预测分析
管理Workflow Execution - AI开发平台ModelArts

"infer_address" : "$ref/consumptions/service_step/service_output/access_address" } } ], "used_steps" : [ "service_step2" ]

帮助中心 > AI开发平台ModelArts > API参考 > Workflow工作流管理
启动智能任务 - AI开发平台ModelArts

4：连续多张相似图片的预测结果不一致。 5：图像的分辨率与训练数据集的特征分布存在较大偏移。 6：图像的高宽比与训练数据集的特征分布存在较大偏移。 7：图像的亮度与训练数据集的特征分布存在较大偏移。 8：图像的饱和度与训练数据集的特征分布存在较大偏移。 9：图像的色彩丰富程度与训练数据集的特征分布存在较大偏移。

帮助中心 > AI开发平台ModelArts > API参考 > 历史API > 数据管理（旧版）
终止训练作业 - AI开发平台ModelArts

npu_proc_restart: NPU原地热恢复 gpu_proc_restart: GPU原地热恢复 proc_restart: 进程原地重启 pod_reschedule: Pod级重调度 job_reschedule: Job级重调度 job_reschedule_with_taint: 隔离式Job重调度

 帮助中心 > AI开发平台ModelArts > API参考 > 训练管理
创建图像分类数据集并进行标注任务 - AI开发平台ModelArts

一步记录的值。 “labels”为样本需要标注的标签。返回状态码为“200 OK”表示标注成功，响应Body如下所示： { "success" : true } 调用查询数据集的统计信息接口查看数据集的标注统计信息。消息请求体： URI格式：GET https://{ma

帮助中心 > AI开发平台ModelArts > API参考 > 应用示例
执行训练任务 - AI开发平台ModelArts

model_name_or_path /home/ma-user/ws/tokenizers/Qwen2-72B 必须修改。加载tokenizer与Hugging Face权重时存放目录绝对或相对路径。请根据实际规划修改。 template qwen 必须修改。用于指定模板。如果设置为"

帮助中心 > AI开发平台ModelArts > 最佳实践 > LLM大语言模型训练推理 > 主流开源大模型基于DevServer适配LlamaFactory PyTorch NPU训练指导（6.3.911）
费用账单 - AI开发平台ModelArts
费用账单 - AI开发平台ModelArts

他统计维度和周期，详细介绍请参见流水与明细账单。查看训练作业的账单 ModelArts训练作业查询资源账单首先需要获取作业ID，而ModelArts控制台展示作业ID与账单中上报的资源ID不一致，您需要先了解作业ID的查询方法，以及作业ID与账单中上报的资源ID二者的对应关系。详细操作如下所述：

帮助中心 > AI开发平台ModelArts > 计费说明
下载数据 - AI开发平台ModelArts
下载数据 - AI开发平台ModelArts

单击目标数据集进入详情页面。在详情页面可以查看数据集的“描述”、“预览”、“限制”、“版本”和“评论”等信息。在详情页面单击“下载”。弹出“选择云服务区域”，选择区域后单击“确定”进入下载详情页面。根据数据集下载至OBS还是ModelArts数据集列表，填写不同配置信息： ModelAr

帮助中心 > AI开发平台ModelArts > ModelArts用户指南（AI Gallery） > AI Gallery（旧版） > 订阅使用

总条数： 1175

点击加载更多

您搜索到想要的结果了吗？

是的没搜到

意见反馈

/200

提交反馈取消

使用kv-cache-int8量化 - AI开发平台ModelArts

使用SmoothQuant量化工具转换权重 - AI开发平台ModelArts

使用AWQ量化工具转换权重 - AI开发平台ModelArts

使用kv-cache-int8量化 - AI开发平台ModelArts

使用SmoothQuant量化 - AI开发平台ModelArts

Eagle投机小模型训练 - AI开发平台ModelArts

执行训练任务【新】 - AI开发平台ModelArts

Step1 创建用户组并加入用户 - AI开发平台ModelArts

使用AWQ量化 - AI开发平台ModelArts

在云监控平台查看在线服务性能指标 - AI开发平台ModelArts

Standard支持的AI框架 - AI开发平台ModelArts

准备代码 - AI开发平台ModelArts

创建预测分析项目 - AI开发平台ModelArts

管理Workflow Execution - AI开发平台ModelArts

启动智能任务 - AI开发平台ModelArts

终止训练作业 - AI开发平台ModelArts

创建图像分类数据集并进行标注任务 - AI开发平台ModelArts

执行训练任务 - AI开发平台ModelArts

费用账单 - AI开发平台ModelArts

下载数据 - AI开发平台ModelArts

意见反馈

7*24

备案

专业服务

退订

建议反馈

售前咨询热线