华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
在mindie-service目录下运行./bin/mindservice_daemon时显示如下信息,随后卡住。
arm架构
cann-kernels=8.0.RC2
cann-toolkit=8.0.RC2
cann-nnal=8.0.RC2
mindie=1.0.RC2
python=3.10
torch=2.1.0
torch_npu=2.1.0
ATB Models 已安装
conf/config.json:
{ "OtherParam": { "ResourceParam" : { "cacheBlockSize" : 128 }, "LogParam" : { "logLevel" : "Info", "logPath" : "logs/mindservice.log" }, "ServeParam" : { "ipAddress" : "127.0.0.1", "managementIpAddress" : "127.0.0.2", "port" : 1025, "managementPort" : 1026, "maxLinkNum" : 1000, "httpsEnabled" : false, "tlsCaPath" : "security/ca/", "tlsCaFile" : ["ca.pem"], "tlsCert" : "security/certs/server.pem", "tlsPk" : "security/keys/server.key.pem", "tlsPkPwd" : "security/pass/key_pwd.txt", "tlsCrl" : "security/certs/server_crl.pem", "managementTlsCaFile" : ["management_ca.pem"], "managementTlsCert" : "security/certs/management/server.pem", "managementTlsPk" : "security/keys/management/server.key.pem", "managementTlsPkPwd" : "security/pass/management/key_pwd.txt", "managementTlsCrl" : "security/certs/management/server_crl.pem", "kmcKsfMaster" : "tools/pmt/master/ksfa", "kmcKsfStandby" : "tools/pmt/standby/ksfb", "multiNodesInferPort": 1120, "interNodeTLSEnabled": true, "interNodeTlsCaFile": "security/grpc/ca/ca.pem", "interNodeTlsCert": "security/grpc/certs/server.pem", "interNodeTlsPk": "security/grpc/keys/server.key.pem", "interNodeTlsPkPwd": "security/grpc/pass/key_pwd.txt", "interNodeKmcKsfMaster": "tools/pmt/master/ksfa", "interNodeKmcKsfStandby": "tools/pmt/standby/ksfb" } }, "WorkFlowParam": { "TemplateParam" : { "templateType": "Standard", "templateName" : "Standard_llama" } }, "ModelDeployParam": { "engineName" : "mindieservice_llm_engine", "modelInstanceNumber" : 1, "tokenizerProcessNumber" : 8, "maxSeqLen" : 2560, "npuDeviceIds" : [[0,1,2,3]], "multiNodesInferEnabled" : false, "ModelParam" : [ { "modelInstanceType": "Standard", "modelName" : "llama-2-7b-hf", "modelWeightPath" : "/root/models/shakechen/Llama-2-7b-hf", "worldSize" : 4, "cpuMemSize" : 5, "npuMemSize" : 8, "backendType": "atb", "pluginParams" : "" } ] }, "ScheduleParam": { "maxPrefillBatchSize" : 50, "maxPrefillTokens" : 8192, "prefillTimeMsPerReq" : 150, "prefillPolicyType" : 0, "decodeTimeMsPerReq" : 50, "decodePolicyType" : 0, "maxBatchSize" : 200, "maxIterTimes" : 512, "maxPreemptCount" : 0, "supportSelectBatch" : false, "maxQueueDelayMicroseconds" : 5000 } }
我要发帖子
问题
在mindie-service目录下运行./bin/mindservice_daemon时显示如下信息,随后卡住。
环境
arm架构
cann-kernels=8.0.RC2
cann-toolkit=8.0.RC2
cann-nnal=8.0.RC2
mindie=1.0.RC2
python=3.10
torch=2.1.0
torch_npu=2.1.0
ATB Models 已安装
conf/config.json:
{ "OtherParam": { "ResourceParam" : { "cacheBlockSize" : 128 }, "LogParam" : { "logLevel" : "Info", "logPath" : "logs/mindservice.log" }, "ServeParam" : { "ipAddress" : "127.0.0.1", "managementIpAddress" : "127.0.0.2", "port" : 1025, "managementPort" : 1026, "maxLinkNum" : 1000, "httpsEnabled" : false, "tlsCaPath" : "security/ca/", "tlsCaFile" : ["ca.pem"], "tlsCert" : "security/certs/server.pem", "tlsPk" : "security/keys/server.key.pem", "tlsPkPwd" : "security/pass/key_pwd.txt", "tlsCrl" : "security/certs/server_crl.pem", "managementTlsCaFile" : ["management_ca.pem"], "managementTlsCert" : "security/certs/management/server.pem", "managementTlsPk" : "security/keys/management/server.key.pem", "managementTlsPkPwd" : "security/pass/management/key_pwd.txt", "managementTlsCrl" : "security/certs/management/server_crl.pem", "kmcKsfMaster" : "tools/pmt/master/ksfa", "kmcKsfStandby" : "tools/pmt/standby/ksfb", "multiNodesInferPort": 1120, "interNodeTLSEnabled": true, "interNodeTlsCaFile": "security/grpc/ca/ca.pem", "interNodeTlsCert": "security/grpc/certs/server.pem", "interNodeTlsPk": "security/grpc/keys/server.key.pem", "interNodeTlsPkPwd": "security/grpc/pass/key_pwd.txt", "interNodeKmcKsfMaster": "tools/pmt/master/ksfa", "interNodeKmcKsfStandby": "tools/pmt/standby/ksfb" } }, "WorkFlowParam": { "TemplateParam" : { "templateType": "Standard", "templateName" : "Standard_llama" } }, "ModelDeployParam": { "engineName" : "mindieservice_llm_engine", "modelInstanceNumber" : 1, "tokenizerProcessNumber" : 8, "maxSeqLen" : 2560, "npuDeviceIds" : [[0,1,2,3]], "multiNodesInferEnabled" : false, "ModelParam" : [ { "modelInstanceType": "Standard", "modelName" : "llama-2-7b-hf", "modelWeightPath" : "/root/models/shakechen/Llama-2-7b-hf", "worldSize" : 4, "cpuMemSize" : 5, "npuMemSize" : 8, "backendType": "atb", "pluginParams" : "" } ] }, "ScheduleParam": { "maxPrefillBatchSize" : 50, "maxPrefillTokens" : 8192, "prefillTimeMsPerReq" : 150, "prefillPolicyType" : 0, "decodeTimeMsPerReq" : 50, "decodePolicyType" : 0, "maxBatchSize" : 200, "maxIterTimes" : 512, "maxPreemptCount" : 0, "supportSelectBatch" : false, "maxQueueDelayMicroseconds" : 5000 } }