使用 2.1.RC2-300I-Duo-py311-openeuler24.03-lts 运行 qwen3_8B 报错: kcache_id_diff = self.ascend_kcache_id != id(kv_cache[0][0]
收藏回复举报
使用 2.1.RC2-300I-Duo-py311-openeuler24.03-lts 运行 qwen3_8B 报错: kcache_id_diff = self.ascend_kcache_id != id(kv_cache[0][0]
t('forum.solved') 已解决
发表于2025-11-13 09:12:56
0 查看

镜像: swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:2.1.RC2-300I-Duo-py311-openeuler24.03-lts

备注: 能使用同一镜像 加载 qwen3_4b模型, 并进行推理. 但 8b启动报错.

File "/usr/local/Ascend/atb-models/atb_llm/models/qwen2/flash_causal_qwen2.py", line 668, in init_kvcache kcache_id_diff = self.ascend_kcache_id != id(kv_cache[0][0]) ~~~~~~~~^^^ IndexError: list index out of range [2025-11-13 09:00:52.013+0800] [9020] [281462376886624] [batchscheduler] [ERROR] [model.py:64] : [MIE04E13030A] [Model] >>> return initialize error result: {'status': 'error', 'npuBlockNum': '0', 'cpuBlockNum': '0', 'memPoolId': '-1'}

卡环境:

cke_64263.png

config.json:

{
    "Version" : "1.0.0",

    "ServerConfig" :
    {
        "ipAddress" : "172.17.0.2",
        "managementIpAddress" : "127.0.0.2",
        "port" : 1025,
        "managementPort" : 1026,
        "metricsPort" : 1027,
        "allowAllZeroIpListening" : false,
        "maxLinkNum" : 1000,
        "httpsEnabled" : false,
        "fullTextEnabled" : false,
        "tlsCaPath" : "security/ca/",
        "tlsCaFile" : ["ca.pem"],
        "tlsCert" : "security/certs/server.pem",
        "tlsPk" : "security/keys/server.key.pem",
        "tlsPkPwd" : "security/pass/key_pwd.txt",
        "tlsCrlPath" : "security/certs/",
        "tlsCrlFiles" : ["server_crl.pem"],
        "managementTlsCaFile" : ["management_ca.pem"],
        "managementTlsCert" : "security/certs/management/server.pem",
        "managementTlsPk" : "security/keys/management/server.key.pem",
        "managementTlsPkPwd" : "security/pass/management/key_pwd.txt",
        "managementTlsCrlPath" : "security/management/certs/",
        "managementTlsCrlFiles" : ["server_crl.pem"],
        "kmcKsfMaster" : "tools/pmt/master/ksfa",
        "kmcKsfStandby" : "tools/pmt/standby/ksfb",
        "inferMode" : "standard",
        "interCommTLSEnabled" : true,
        "interCommPort" : 1121,
        "interCommTlsCaPath" : "security/grpc/ca/",
        "interCommTlsCaFiles" : ["ca.pem"],
        "interCommTlsCert" : "security/grpc/certs/server.pem",
        "interCommPk" : "security/grpc/keys/server.key.pem",
        "interCommPkPwd" : "security/grpc/pass/key_pwd.txt",
        "interCommTlsCrlPath" : "security/grpc/certs/",
        "interCommTlsCrlFiles" : ["server_crl.pem"],
        "openAiSupport" : "vllm",
        "tokenTimeout" : 600,
        "e2eTimeout" : 600,
        "distDPServerEnabled":false
    },

    "BackendConfig" : {
        "backendName" : "mindieservice_llm_engine",
        "modelInstanceNumber" : 1,
        "npuDeviceIds" : [[0]],
        "tokenizerProcessNumber" : 8,
        "multiNodesInferEnabled" : false,
        "multiNodesInferPort" : 1120,
        "interNodeTLSEnabled" : true,
        "interNodeTlsCaPath" : "security/grpc/ca/",
        "interNodeTlsCaFiles" : ["ca.pem"],
        "interNodeTlsCert" : "security/grpc/certs/server.pem",
        "interNodeTlsPk" : "security/grpc/keys/server.key.pem",
        "interNodeTlsPkPwd" : "security/grpc/pass/mindie_server_key_pwd.txt",
        "interNodeTlsCrlPath" : "security/grpc/certs/",
        "interNodeTlsCrlFiles" : ["server_crl.pem"],
        "interNodeKmcKsfMaster" : "tools/pmt/master/ksfa",
        "interNodeKmcKsfStandby" : "tools/pmt/standby/ksfb",
        "ModelDeployConfig" :
        {
            "maxSeqLen" : 1024,
            "maxInputTokenLen" : 1024,
            "truncation" : false,
            "ModelConfig" : [
                {
                    "modelInstanceType" : "Standard",
                    "modelName" : "Qwen3-8B",
                    "modelWeightPath" : "/Qwen3-8B/",
                    "worldSize" : 1,
                    "cpuMemSize" : 5,
                    "npuMemSize" : 10240,
                    "backendType" : "atb",
                    "trustRemoteCode" : false,
                    "async_scheduler_wait_time": 120,
                    "kv_trans_timeout": 10,
                    "kv_link_timeout": 1080
                }
            ]
        },

        "ScheduleConfig" :
        {
            "templateType" : "Standard",
            "templateName" : "Standard_LLM",
            "cacheBlockSize" : 128,

            "maxPrefillBatchSize" : 50,
            "maxPrefillTokens" : 1024,
            "prefillTimeMsPerReq" : 150,
            "prefillPolicyType" : 0,

            "decodeTimeMsPerReq" : 50,
            "decodePolicyType" : 0,

            "maxBatchSize" : 200,
            "maxIterTimes" : 1024,
            "maxPreemptCount" : 0,
            "supportSelectBatch" : false,
            "maxQueueDelayMicroseconds" : 5000
        }
    }
}

进行容器后执行 

/usr/local/Ascend/mindie/latest/mindie-service/bin/mindieservice_daemon

详细日志如下

[2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1870] data:0x12c0010ac600, storage_offset:0, format:2, shape:[1], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1871] data:0x12c00109e200, storage_offset:0, format:2, shape:[128], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1872] data:0x12c00109e400, storage_offset:0, format:2, shape:[128], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1873] data:0x12c0010a2a00, storage_offset:0, format:2, shape:[4096], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.729] [9020] [281454893724000] [llmmodels] [DEBUG] [model_torch.cpp:138] ModelTorch atWeightTensors[1874] data:0x12c5c0000000, storage_offset:0, format:29, shape:[151936, 4096], options:TensorOptions(dtype=c10::Half, device=npu:0, layout=Strided, requires_grad=false (default), pinned_memory=false (default), memory_format=(nullopt)) [2025-11-13 09:00:52.013+0800] [9020] [281462376886624] [batchscheduler] [ERROR] [model.py:61] : [Model] >>> Exception:list index out of range Traceback (most recent call last): File "/usr/local/lib/python3.11/site-packages/model_wrapper/model.py", line 59, in initialize return self.python_model.initialize(config) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/model_wrapper/standard_model.py", line 133, in initialize self.generator = Generator( ^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 308, in __init__ self.cache_manager = self.warm_up( ^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 464, in warm_up cache_manager = self.__warmup_specified(max_prefill_tokens, max_seq_len, max_input_len, max_iter_times) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 659, in __warmup_specified self.__execute_warm_up(cache_manager, input_metadata, self.inference_mode) File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 510, in __execute_warm_up self.generator_backend._warm_up(model_inputs, inference_mode=self.inference_mode, File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 570, in _warm_up super()._warm_up(model_inputs, **kwargs) File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_backend.py", line 247, in _warm_up logits = self.forward(model_inputs, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/utils/decorators/time_decorator.py", line 69, in wrapper return func(*args, **kwargs) ^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 230, in forward logits = self._forward(model_inputs, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 621, in _forward logits = self.model_wrapper.forward(model_inputs, self.cache_pool.npu_cache, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 125, in forward result = self.forward_from_model_inputs(model_inputs, npu_cache, **kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 197, in forward_from_model_inputs result = self.forward_tensor( ^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 237, in forward_tensor result = self.model_runner.forward( ^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/Ascend/atb-models/atb_llm/runner/model_runner.py", line 310, in forward res = self.model.forward(**kwargs) ^^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/Ascend/atb-models/atb_llm/models/base/flash_causal_lm.py", line 527, in forward self.init_kvcache(kv_cache) File "/usr/local/Ascend/atb-models/atb_llm/models/qwen2/flash_causal_qwen2.py", line 668, in init_kvcache kcache_id_diff = self.ascend_kcache_id != id(kv_cache[0][0]) ~~~~~~~~^^^ IndexError: list index out of range [2025-11-13 09:00:52.013+0800] [9020] [281462376886624] [batchscheduler] [ERROR] [model.py:64] : [MIE04E13030A] [Model] >>> return initialize error result: {'status': 'error', 'npuBlockNum': '0', 'cpuBlockNum': '0', 'memPoolId': '-1'} [2025-11-13 09:00:52.844+08:00] [8818] [8820] [server] [WARN] [llm_daemon.cpp:74] : [MIE04W01011A] [daemon] Received exit signal[17] [2025-11-13 09:00:52.845+08:00] [8818] [8820] [server] [ERROR] [llm_daemon.cpp:90] : [MIE04E010109] [daemon] Process 9020 was terminated by signal 9 (Killed) [ERROR] TBE Subprocess[task_distribute] raise error[], main process disappeared!

我要发帖子