昇腾mmdetection mmcv使用npu报错SoftmaxFocalLoss Segmentation fault (core dumped)
收藏回复举报
昇腾mmdetection mmcv使用npu报错SoftmaxFocalLoss Segmentation fault (core dumped)
t('forum.solved') 已解决
新人帖
发表于2023-03-01 11:35:24
0 查看

各位大佬好,我目前使用Atlas 300I,想搭建mmdetection的环境,在验证mmcv环境的时候报错了

使用的docker容器环境是昇腾提供的pytorch-modelzoo镜像

https://ascendhub.huawei.com/#/detail/pytorch-modelzoo

pip list的环境大致如下

cke_7924.png

运行的验证mmcv的代码,参考https://mmcv.readthedocs.io/zh_CN/latest/get_started/build.html?highlight=npu#npu-mmcv-full

import torch
import torch_npu
from mmcv.ops import softmax_focal_loss
# Init tensor to the NPU
x = torch.randn(3, 10).npu()
y = torch.tensor([1, 5, 3]).npu()
w = torch.ones(10).float().npu()
output = softmax_focal_loss(x, y, 2.0, 0.25, w, 'none')
print(output)

报错如下:

cke_1904.png

SoftmaxFocalLoss
Segmentation fault (core dumped)
root@guest:/opt/code/mmdetection# Process ForkServerProcess-2:
Traceback (most recent call last):
  File "/usr/local/python3.7.5/lib/python3.7/multiprocessing/process.py", line 297, in _bootstrap
    self.run()
  File "/usr/local/python3.7.5/lib/python3.7/multiprocessing/process.py", line 99, in run
    self._target(*self._args, **self._kwargs)
  File "/usr/local/Ascend/ascend-toolkit/latest/fwkacllib/python/site-packages/tbe/common/repository_manager/route.py", line 61, in wrapper
    raise exp
  File "/usr/local/Ascend/ascend-toolkit/latest/fwkacllib/python/site-packages/tbe/common/repository_manager/route.py", line 58, in wrapper
    func(*args, **kwargs)
  File "/usr/local/Ascend/ascend-toolkit/latest/fwkacllib/python/site-packages/tbe/common/repository_manager/route.py", line 268, in task_distribute
    key, func_name, detail = resource_proxy[TASK_QUEUE].get()
  File "<string>", line 2, in get
  File "/usr/local/python3.7.5/lib/python3.7/multiprocessing/managers.py", line 819, in _callmethod
    kind, result = conn.recv()
  File "/usr/local/python3.7.5/lib/python3.7/multiprocessing/connection.py", line 250, in recv
    buf = self._recv_bytes()
  File "/usr/local/python3.7.5/lib/python3.7/multiprocessing/connection.py", line 407, in _recv_bytes
    buf = self._recv(4)
  File "/usr/local/python3.7.5/lib/python3.7/multiprocessing/connection.py", line 383, in _recv
    raise EOFError
EOFError
/usr/local/python3.7.5/lib/python3.7/multiprocessing/semaphore_tracker.py:144: UserWarning: semaphore_tracker: There appear to be 91 leaked semaphores to clean up at shutdown

直接pip安装和编译安装mmcv-full都试过,1.7.0和1.7.1也都试过,都是报上面的错误,不知道有没有大佬遇到过?

我要发帖子