310P MindIE 2.3.0 运行Qwen3-32B w16a16s和w16a16sc 开prefixcache异常
收藏回复举报
310P MindIE 2.3.0 运行Qwen3-32B w16a16s和w16a16sc 开prefixcache异常
t('forum.solved') 已解决
新人帖
发表于2026-04-14 10:51:32
0 查看
310P MindIE 2.3.0 运行Qwen3-32B 的Qwen3-32B-w16a16sc-310-mindie和Qwen3-32B-w16a16s-310,不开prefixcache可以起服务,开了warmup报错

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/utils/status.py", line 17, in run

    self._target(*self._args, **self._kwargs)

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/connector/request_router/request_router.py", line 85, in do_inference

    self.initialize(execute_request.config)

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/connector/request_router/request_router.py", line 70, in initialize

    initialize_result = self.router_impl.initialize(config)

                        ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/connector/request_router/router_impl.py", line 168, in initialize

    self.generator = Generator(model_config={**model_config.model_config})

File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 291, in __init__

    self.cache_manager = self.warm_up(

                         ^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 485, in warm_up

    npu_mem = self.__warmup_standard(max_prefill_tokens, max_seq_len, max_input_len, max_iter_times)

              ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 791, in __warmup_standard

    npu_mem = self.__warmup_prefill(max_prefill_tokens, max_seq_len, max_input_len, max_iter_times)

              ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 779, in __warmup_prefill

    npu_mem = self.__auto_warmup(max_prefill_tokens, max_seq_len, max_input_len, max_iter_times, is_prefill=True)

              ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 880, in __auto_warmup

    self.__execute_warm_up(cache_manager, input_metadata, dummy=True)

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 666, in __execute_warm_up

    raise e

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/generator.py", line 657, in __execute_warm_up

    self.generator_backend._warm_up(model_inputs, inference_mode=self.inference_mode,

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 617, in _warm_up

    super()._warm_up(model_inputs, q_lens=q_lens, attn_mask=spec_mask, **kwargs)

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_backend.py", line 270, in _warm_up

    logits = self.forward(model_inputs, **kwargs)

             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/utils/decorators/time_decorator.py", line 68, in wrapper

    return func(*args, **kwargs)

           ^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 212, in forward

    logits = self._forward(model_inputs, **kwargs)

             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/text_generator/adapter/generator_torch.py", line 750, in _forward

    logits = self.model_wrapper.forward(model_inputs, self.cache_pool.npu_cache, **kwargs)

             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 133, in forward

    result = self.forward_from_model_inputs(model_inputs, npu_cache, **kwargs)

             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 223, in forward_from_model_inputs

    result = self.forward_tensor(

             ^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 298, in forward_tensor

    raise e

  File "/usr/local/lib/python3.11/site-packages/mindie_llm/modeling/model_wrapper/atb/atb_model_wrapper.py", line 283, in forward_tensor

    result = self.model_runner.forward(

             ^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/Ascend/atb-models/atb_llm/runner/model_runner.py", line 344, in forward

    res = self.model.forward(**kwargs)

          ^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/Ascend/atb-models/atb_llm/models/base/flash_causal_lm_v2.py", line 328, in forward

    logits = BaseLMCpp.execute_engine(self, is_prefill=is_prefill, enable_mem_pool=self.enable_mem_pool, **kwargs)

             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^

  File "/usr/local/Ascend/atb-models/atb_llm/models/base/base_lm_cpp.py", line 209, in execute_engine

    engine_outputs = engine.execute(self.engine_inputs, json.dumps(self.engine_runtime_param))

我要发帖子