镜像: swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC2-300I-Duo-py311-openeuler24.03-lts
备注: 能使用同一镜像 加载 qwen3_4b模型, 并进行推理. 但 8b启动报错.
File "/usr/local/Ascend/atb-models/atb_llm/models/qwen2/flash_causal_qwen2.py", line 668, in init_kvcache kcache_id_diff = self.ascend_kcache_id != id(kv_cache[0][0]) ~~~~~~~~^^^ IndexError: list index out of range [2025-11-13 09:00:52.013+0800] [9020] [281462376886624] [batchscheduler] [ERROR] [model.py:64] : [MIE04E13030A] [Model] >>> return initialize error result: {'status': 'error', 'npuBlockNum': '0', 'cpuBlockNum': '0', 'memPoolId': '-1'}
卡环境:

config.json:
{
"Version" : "1.0.0",
"ServerConfig" :
{
"ipAddress" : "172.17.0.2",
"managementIpAddress" : "127.0.0.2",
"port" : 1025,
"managementPort" : 1026,
"metricsPort" : 1027,
"allowAllZeroIpListening" : false,
"maxLinkNum" : 1000,
"httpsEnabled" : false,
"fullTextEnabled" : false,
"tlsCaPath" : "security/ca/",
"tlsCaFile" : ["ca.pem"],
"tlsCert" : "security/certs/server.pem",
"tlsPk" : "security/keys/server.key.pem",
"tlsPkPwd" : "security/pass/key_pwd.txt",
"tlsCrlPath" : "security/certs/",
"tlsCrlFiles" : ["server_crl.pem"],
"managementTlsCaFile" : ["management_ca.pem"],
"managementTlsCert" : "security/certs/management/server.pem",
"managementTlsPk" : "security/keys/management/server.key.pem",
"managementTlsPkPwd" : "security/pass/management/key_pwd.txt",
"managementTlsCrlPath" : "security/management/certs/",
"managementTlsCrlFiles" : ["server_crl.pem"],
"kmcKsfMaster" : "tools/pmt/master/ksfa",
"kmcKsfStandby" : "tools/pmt/standby/ksfb",
"inferMode" : "standard",
"interCommTLSEnabled" : true,
"interCommPort" : 1121,
"interCommTlsCaPath" : "security/grpc/ca/",
"interCommTlsCaFiles" : ["ca.pem"],
"interCommTlsCert" : "security/grpc/certs/server.pem",
"interCommPk" : "security/grpc/keys/server.key.pem",
"interCommPkPwd" : "security/grpc/pass/key_pwd.txt",
"interCommTlsCrlPath" : "security/grpc/certs/",
"interCommTlsCrlFiles" : ["server_crl.pem"],
"openAiSupport" : "vllm",
"tokenTimeout" : 600,
"e2eTimeout" : 600,
"distDPServerEnabled":false
},
"BackendConfig" : {
"backendName" : "mindieservice_llm_engine",
"modelInstanceNumber" : 1,
"npuDeviceIds" : [[0]],
"tokenizerProcessNumber" : 8,
"multiNodesInferEnabled" : false,
"multiNodesInferPort" : 1120,
"interNodeTLSEnabled" : true,
"interNodeTlsCaPath" : "security/grpc/ca/",
"interNodeTlsCaFiles" : ["ca.pem"],
"interNodeTlsCert" : "security/grpc/certs/server.pem",
"interNodeTlsPk" : "security/grpc/keys/server.key.pem",
"interNodeTlsPkPwd" : "security/grpc/pass/mindie_server_key_pwd.txt",
"interNodeTlsCrlPath" : "security/grpc/certs/",
"interNodeTlsCrlFiles" : ["server_crl.pem"],
"interNodeKmcKsfMaster" : "tools/pmt/master/ksfa",
"interNodeKmcKsfStandby" : "tools/pmt/standby/ksfb",
"ModelDeployConfig" :
{
"maxSeqLen" : 1024,
"maxInputTokenLen" : 1024,
"truncation" : false,
"ModelConfig" : [
{
"modelInstanceType" : "Standard",
"modelName" : "Qwen3-8B",
"modelWeightPath" : "/Qwen3-8B/",
"worldSize" : 1,
"cpuMemSize" : 5,
"npuMemSize" : 10240,
"backendType" : "atb",
"trustRemoteCode" : false,
"async_scheduler_wait_time": 120,
"kv_trans_timeout": 10,
"kv_link_timeout": 1080
}
]
},
"ScheduleConfig" :
{
"templateType" : "Standard",
"templateName" : "Standard_LLM",
"cacheBlockSize" : 128,
"maxPrefillBatchSize" : 50,
"maxPrefillTokens" : 1024,
"prefillTimeMsPerReq" : 150,
"prefillPolicyType" : 0,
"decodeTimeMsPerReq" : 50,
"decodePolicyType" : 0,
"maxBatchSize" : 200,
"maxIterTimes" : 1024,
"maxPreemptCount" : 0,
"supportSelectBatch" : false,
"maxQueueDelayMicroseconds" : 5000
}
}
} 进行容器后执行
/usr/local/Ascend/mindie/latest/mindie-service/bin/mindieservice_daemon
详细日志如下
[2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1870] data:0x12c0010ac600, storage_offset:0, format:2, shape:[1], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1871] data:0x12c00109e200, storage_offset:0, format:2, shape:[128], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1872] data:0x12c00109e400, storage_offset:0, format:2, shape:[128], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1873] data:0x12c0010a2a00, storage_offset:0, format:2, shape:[4096], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1874] data:0x12c5c0000000, storage_offset:0, format:29, shape:[151936, 4096], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.013+0800] [9020] [281462376886624] [batchscheduler] [ERROR] [model.py:61] : [Model] >>> Exception:list index out of range Traceback (most recent call last): File "/usr/local/lib/python3.11/site-packages/model_wrapper/model.py", line 59, in initialize return self.python_model.initialize(config) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/model_wrapper/standard_model.py", line 133, in initialize self.generator = Generator( ^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 308, in __init__ self.cache_manager = self.warm_up( ^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 464, in warm_up cache_manager = self.__warmup_specified(max_prefill_tokens, max_seq_len, max_input_len, max_iter_times) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 659, in __warmup_specified self.__execute_warm_up(cache_manager, input_metadata, self.inference_mode) File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 510, in __execute_warm_up self.generator_backend._warm_up(model_inputs, inference_mode=self.inference_mode, File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 570, in _warm_up super()._warm_up(model_inputs, **kwargs) File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_backend.py", line 247, in _warm_up logits = self.forward(model_inputs, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/utils/decorators/time_decorator.py", line 69, in wrapper return func(*args, **kwargs) ^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 230, in forward logits = self._forward(model_inputs, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 621, in _forward logits = self.model_wrapper.forward(model_inputs, self.cache_pool.npu_cache, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 125, in forward result = self.forward_from_model_inputs(model_inputs, npu_cache, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 197, in forward_from_model_inputs result = self.forward_tensor( ^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 237, in forward_tensor result = self.model_runner.forward( ^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/Ascend/atb-models/atb_llm/runner/model_runner.py", line 310, in forward res = self.model.forward(**kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/Ascend/atb-models/atb_llm/models/base/flash_causal_lm.py", line 527, in forward self.init_kvcache(kv_cache) File "/usr/local/Ascend/atb-models/atb_llm/models/qwen2/flash_causal_qwen2.py", line 668, in init_kvcache kcache_id_diff = self.ascend_kcache_id != id(kv_cache[0][0]) ~~~~~~~~^^^ IndexError: list index out of range [2025-11-13 09:00:52.013+0800] [9020] [281462376886624] [batchscheduler] [ERROR] [model.py:64] : [MIE04E13030A] [Model] >>> return initialize error result: {'status': 'error', 'npuBlockNum': '0', 'cpuBlockNum': '0', 'memPoolId': '-1'} [2025-11-13 09:00:52.844+08:00] [8818] [8820] [server] [WARN] [llm_daemon.cpp:74] : [MIE04W01011A] [daemon] Received exit signal[17] [2025-11-13 09:00:52.845+08:00] [8818] [8820] [server] [ERROR] [llm_daemon.cpp:90] : [MIE04E010109] [daemon] Process 9020 was terminated by signal 9 (Killed) [ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!
镜像: swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC2-300I-Duo-py311-openeuler24.03-lts
备注: 能使用同一镜像 加载 qwen3_4b模型, 并进行推理. 但 8b启动报错.
File "/usr/local/Ascend/atb-models/atb_llm/models/qwen2/flash_causal_qwen2.py", line 668, in init_kvcache kcache_id_diff = self.ascend_kcache_id != id(kv_cache[0][0]) ~~~~~~~~^^^ IndexError: list index out of range [2025-11-13 09:00:52.013+0800] [9020] [281462376886624] [batchscheduler] [ERROR] [model.py:64] : [MIE04E13030A] [Model] >>> return initialize error result: {'status': 'error', 'npuBlockNum': '0', 'cpuBlockNum': '0', 'memPoolId': '-1'}
卡环境:
config.json:
{ "Version" : "1.0.0", "ServerConfig" : { "ipAddress" : "172.17.0.2", "managementIpAddress" : "127.0.0.2", "port" : 1025, "managementPort" : 1026, "metricsPort" : 1027, "allowAllZeroIpListening" : false, "maxLinkNum" : 1000, "httpsEnabled" : false, "fullTextEnabled" : false, "tlsCaPath" : "security/ca/", "tlsCaFile" : ["ca.pem"], "tlsCert" : "security/certs/server.pem", "tlsPk" : "security/keys/server.key.pem", "tlsPkPwd" : "security/pass/key_pwd.txt", "tlsCrlPath" : "security/certs/", "tlsCrlFiles" : ["server_crl.pem"], "managementTlsCaFile" : ["management_ca.pem"], "managementTlsCert" : "security/certs/management/server.pem", "managementTlsPk" : "security/keys/management/server.key.pem", "managementTlsPkPwd" : "security/pass/management/key_pwd.txt", "managementTlsCrlPath" : "security/management/certs/", "managementTlsCrlFiles" : ["server_crl.pem"], "kmcKsfMaster" : "tools/pmt/master/ksfa", "kmcKsfStandby" : "tools/pmt/standby/ksfb", "inferMode" : "standard", "interCommTLSEnabled" : true, "interCommPort" : 1121, "interCommTlsCaPath" : "security/grpc/ca/", "interCommTlsCaFiles" : ["ca.pem"], "interCommTlsCert" : "security/grpc/certs/server.pem", "interCommPk" : "security/grpc/keys/server.key.pem", "interCommPkPwd" : "security/grpc/pass/key_pwd.txt", "interCommTlsCrlPath" : "security/grpc/certs/", "interCommTlsCrlFiles" : ["server_crl.pem"], "openAiSupport" : "vllm", "tokenTimeout" : 600, "e2eTimeout" : 600, "distDPServerEnabled":false }, "BackendConfig" : { "backendName" : "mindieservice_llm_engine", "modelInstanceNumber" : 1, "npuDeviceIds" : [[0]], "tokenizerProcessNumber" : 8, "multiNodesInferEnabled" : false, "multiNodesInferPort" : 1120, "interNodeTLSEnabled" : true, "interNodeTlsCaPath" : "security/grpc/ca/", "interNodeTlsCaFiles" : ["ca.pem"], "interNodeTlsCert" : "security/grpc/certs/server.pem", "interNodeTlsPk" : "security/grpc/keys/server.key.pem", "interNodeTlsPkPwd" : "security/grpc/pass/mindie_server_key_pwd.txt", "interNodeTlsCrlPath" : "security/grpc/certs/", "interNodeTlsCrlFiles" : ["server_crl.pem"], "interNodeKmcKsfMaster" : "tools/pmt/master/ksfa", "interNodeKmcKsfStandby" : "tools/pmt/standby/ksfb", "ModelDeployConfig" : { "maxSeqLen" : 1024, "maxInputTokenLen" : 1024, "truncation" : false, "ModelConfig" : [ { "modelInstanceType" : "Standard", "modelName" : "Qwen3-8B", "modelWeightPath" : "/Qwen3-8B/", "worldSize" : 1, "cpuMemSize" : 5, "npuMemSize" : 10240, "backendType" : "atb", "trustRemoteCode" : false, "async_scheduler_wait_time": 120, "kv_trans_timeout": 10, "kv_link_timeout": 1080 } ] }, "ScheduleConfig" : { "templateType" : "Standard", "templateName" : "Standard_LLM", "cacheBlockSize" : 128, "maxPrefillBatchSize" : 50, "maxPrefillTokens" : 1024, "prefillTimeMsPerReq" : 150, "prefillPolicyType" : 0, "decodeTimeMsPerReq" : 50, "decodePolicyType" : 0, "maxBatchSize" : 200, "maxIterTimes" : 1024, "maxPreemptCount" : 0, "supportSelectBatch" : false, "maxQueueDelayMicroseconds" : 5000 } } }进行容器后执行
/usr/local/Ascend/mindie/latest/mindie-service/bin/mindieservice_daemon
详细日志如下
[2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1870] data:0x12c0010ac600, storage_offset:0, format:2, shape:[1], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1871] data:0x12c00109e200, storage_offset:0, format:2, shape:[128], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1872] data:0x12c00109e400, storage_offset:0, format:2, shape:[128], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1873] data:0x12c0010a2a00, storage_offset:0, format:2, shape:[4096], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1874] data:0x12c5c0000000, storage_offset:0, format:29, shape:[151936, 4096], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.013+0800] [9020] [281462376886624] [batchscheduler] [ERROR] [model.py:61] : [Model] >>> Exception:list index out of range Traceback (most recent call last): File "/usr/local/lib/python3.11/site-packages/model_wrapper/model.py", line 59, in initialize return self.python_model.initialize(config) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/model_wrapper/standard_model.py", line 133, in initialize self.generator = Generator( ^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 308, in __init__ self.cache_manager = self.warm_up( ^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 464, in warm_up cache_manager = self.__warmup_specified(max_prefill_tokens, max_seq_len, max_input_len, max_iter_times) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 659, in __warmup_specified self.__execute_warm_up(cache_manager, input_metadata, self.inference_mode) File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 510, in __execute_warm_up self.generator_backend._warm_up(model_inputs, inference_mode=self.inference_mode, File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 570, in _warm_up super()._warm_up(model_inputs, **kwargs) File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_backend.py", line 247, in _warm_up logits = self.forward(model_inputs, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/utils/decorators/time_decorator.py", line 69, in wrapper return func(*args, **kwargs) ^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 230, in forward logits = self._forward(model_inputs, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 621, in _forward logits = self.model_wrapper.forward(model_inputs, self.cache_pool.npu_cache, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 125, in forward result = self.forward_from_model_inputs(model_inputs, npu_cache, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 197, in forward_from_model_inputs result = self.forward_tensor( ^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 237, in forward_tensor result = self.model_runner.forward( ^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/Ascend/atb-models/atb_llm/runner/model_runner.py", line 310, in forward res = self.model.forward(**kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/Ascend/atb-models/atb_llm/models/base/flash_causal_lm.py", line 527, in forward self.init_kvcache(kv_cache) File "/usr/local/Ascend/atb-models/atb_llm/models/qwen2/flash_causal_qwen2.py", line 668, in init_kvcache kcache_id_diff = self.ascend_kcache_id != id(kv_cache[0][0]) ~~~~~~~~^^^ IndexError: list index out of range [2025-11-13 09:00:52.013+0800] [9020] [281462376886624] [batchscheduler] [ERROR] [model.py:64] : [MIE04E13030A] [Model] >>> return initialize error result: {'status': 'error', 'npuBlockNum': '0', 'cpuBlockNum': '0', 'memPoolId': '-1'} [2025-11-13 09:00:52.844+08:00] [8818] [8820] [server] [WARN] [llm_daemon.cpp:74] : [MIE04W01011A] [daemon] Received exit signal[17] [2025-11-13 09:00:52.845+08:00] [8818] [8820] [server] [ERROR] [llm_daemon.cpp:90] : [MIE04E010109] [daemon] Process 9020 was terminated by signal 9 (Killed) [ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!