MindIE集成部署问题定位基本流程(atb-models版)
收藏回复举报
MindIE集成部署问题定位基本流程(atb-models版)
新人帖
发表于2024-09-20 13:49:16
0 查看

基本调用流程

MindIE-Service -> MindIE-LLM -> Torch/Torch_npu -> atb-models  -> ascend-toolkit -> driver/fireware

根据基本调用流程,我们可以至下而上,做一些小测试:

1.npu-smi info查看device info

目的:测试底层驱动、固件是否部署正常

操作:执行命令 npu-smi info

预期:可以正常显示device info

2.torch/torch_npu小测试

目的:测试torch/torch_npu、ascend-toolkit部署是否正常

操作:使用python执行如下代码

import torch

import torch_npu

a = torch.ones(10000).half().npu()

a = a + a

print(a)

预期:可以正确打印出来tensor a的值

3.卡间集合通信小测试(可选)

目的:如果用户需要使用多卡执行模型实例,需要先确保卡间集合通信是否正常

操作:参考https://www.hiascend.com/developer/ascendhub/detail/hccl-test

预期:卡间集合通信正常

4.atb-models的modeltest小测试

目的:测试atb-models纯模型(不带服务化)可以正常对话

操作

a. 首先检查以下几个环境变量所对应的安装路径是否正常,执行命令

env | grep ASCEND_HOME_PATH (ascend-toolkit安装路径)

env | grep ATB_SPEED_HOME_PATH (atb-models安装路径)

env | grep ATB_HOME_PATH (ascned-transformer-boost安装路径)

b. 仔细阅读 $ATB_SPEED_HOME_PATH/tests/modeltest/README.md,测试自己想要跑的模型

预期:纯模型对话正常,性能测试正常,数据集跑分正常

如果第4步测试成功,接下来用户可以按照MindIE官方文档,继续下一步的服务化集成部署(https://www.hiascend.com/document/detail/zh/mindie/10RC2/mindieservice/servicedev/mindie_service0001.html)。

本帖最后由 匿名用户2025/04/01 16:54:50 编辑

我要发帖子