检测到您已登录华为云国际站账号,为了您更好的体验,建议您访问国际站服务网站 https://www.huaweicloud.com/intl/zh-cn
不再显示此消息
loss结果 sft全参微调NPU训练结果loss收敛且趋势与GPU训练loss一致 图3 sft全参微调单机loss曲线对比结果 图4 sft全参微调双机loss曲线对比结果 lora微调NPU训练结果loss收敛且趋势与GPU训练loss一致 图5 lora微调双机loss曲线对比结果
Server资源开通,购买Lite Server资源,并确保机器已开通,密码已获取,能通过SSH登录,不同机器之间网络互通。 当容器需要提供服务给多个用户,或者多个用户共享使用该容器时,应限制容器访问Openstack的管理地址(169.254.169.254),以防止容器获取宿主机的元数据。具体操作请参见禁止容器获取宿主机元数据。
DevServer资源,并确保机器已开通,密码已获取,能通过SSH登录,不同机器之间网络互通。 当容器需要提供服务给多个用户,或者多个用户共享使用该容器时,应限制容器访问Openstack的管理地址(169.254.169.254),以防止容器获取宿主机的元数据。具体操作请参见禁止容器获取宿主机元数据。
该指标用于统计测量对象已使用的显存。 兆字节(Megabytes) ≥0 NA NA NA 共享GPU任务运行数据 node_gpu_share_job_count 针对一个GPU卡,当前运行的共享资源使用的任务数量。 个 ≥0 NA NA NA GPU温度 DCGM_FI_DEV_GPU_TEMP
└── videos ├── 1.mp4 ├── 2.mp4 ├── ... 每个 txt 与视频同名,为视频的标签。视频与标签应该一一对应。通常情况下,不使用一个视频对应多个标签。 如果为风格微调,请准备至少50条风格相似的视频和标签,以利于拟合。
tensor-model-parallel-size 8 表示张量并行。 pipeline-model-parallel-size 4 表示流水线并行。一般此值与训练节点数相等,与权重转换时设置的值相等。 context-parallel-size 1 表示context并行,默认为1。应用于训练长序列文本的
参数类型 描述 pfs 是 PFSSummary object obs并行文件系统输出。 表17 PFSSummary 参数 是否必选 参数类型 描述 pfs_path 是 String obs并行文件系统路径url。 表18 DataSource 参数 是否必选 参数类型 描述
json文件,其中xx表示当前实例的IP地址。 NODE_PORTS:仅在服务入口实例生效,用于与全量推理实例、增量推理实例的信息交互。该参数入参为形如{port1},{port2},{portn}的字符串,与全量或增量推理实例启动的--port参数相关。--port表示服务部署的端口。每个全
json文件,其中xx表示当前实例的IP地址。 NODE_PORTS:仅在服务入口实例生效,用于与全量推理实例、增量推理实例的信息交互。该参数入参为形如{port1},{port2},{portn}的字符串,与全量或增量推理实例启动的--port参数相关。--port表示服务部署的端口。每个全
LogDir 参数 参数类型 描述 pfs PFSSummary object obs并行文件系统输出。 表26 PFSSummary 参数 参数类型 描述 pfs_path String obs并行文件系统路径url。 表27 DataSource 参数 参数类型 描述 job JobSummary
json文件,其中xx表示当前实例的IP地址。 NODE_PORTS:仅在服务入口实例生效,用于与全量推理实例、增量推理实例的信息交互。该参数入参为形如{port1},{port2},{portn}的字符串,与全量或增量推理实例启动的--port参数相关。--port表示服务部署的端口。每个全
LogDir 参数 参数类型 描述 pfs PFSSummary object obs并行文件系统输出。 表27 PFSSummary 参数 参数类型 描述 pfs_path String obs并行文件系统路径url。 表28 DataSource 参数 参数类型 描述 job JobSummary
LogDir 参数 参数类型 描述 pfs PFSSummary object obs并行文件系统输出。 表29 PFSSummary 参数 参数类型 描述 pfs_path String obs并行文件系统路径url。 表30 DataSource 参数 参数类型 描述 job JobSummary
json文件,其中xx表示当前实例的IP地址。 NODE_PORTS:仅在服务入口实例生效,用于与全量推理实例、增量推理实例的信息交互。该参数入参为形如{port1},{port2},{portn}的字符串,与全量或增量推理实例启动的--port参数相关。--port表示服务部署的端口。每个全
该指标用于统计测量空闲的显存。 兆字节(Megabytes) >0 NA NA NA 共享GPU任务运行数据 node_gpu_share_job_count 针对一个GPU卡,当前运行的共享资源使用的任务数量。 个 ≥0 NA NA NA GPU温度 DCGM_FI_DEV_GPU_TEMP
DETAIL_TIME_LOG #关闭打印详细日志 配置后重启服务生效。 启动服务与请求。此处提供vLLM服务API接口启动和OpenAI服务API接口启动2种方式。详细启动服务与请求方式参考:https://docs.vllm.ai/en/latest/getting_started/quickstart
如果需要增加模型量化功能,启动推理服务前,先参考使用AWQ量化或使用SmoothQuant量化章节对模型做量化处理。 启动服务与请求。此处提供vLLM服务API接口启动和OpenAI服务API接口启动2种方式。详细启动服务与请求方式参考:https://docs.vllm.ai/en/latest/getting_started/quickstart
如果需要增加模型量化功能,启动推理服务前,先参考使用AWQ量化或使用SmoothQuant量化章节对模型做量化处理。 启动服务与请求。此处提供vLLM服务API接口启动和OpenAI服务API接口启动2种方式。详细启动服务与请求方式参考:https://docs.vllm.ai/en/latest/getting_started/quickstart
WQ量化、使用SmoothQuant量化或使用GPTQ量化章节对模型做量化处理。 启动服务与请求。此处提供vLLM服务API接口启动和OpenAI服务API接口启动2种方式。详细启动服务与请求方式参考:https://docs.vllm.ai/en/latest/getting_started/quickstart
请删除.torchair_cache文件夹,避免由于缓存文件与实际推理不匹配而报错。 若要使用eagle投机,配置环境变量,使eagle投机对齐实验室版本实现。目前默认开启此模式,若不开启,目前vllm0.6.0版本与实验室版本权重无法对齐,会导致小模型精度问题。 export