Atlas 300I DUO ”DeepSeek-R1-Distill-Qwen32B+多模态模型InternVL2_5-8B“共用4卡8芯爆OOM。使用910B4机器可以共用8卡运行,是否是300I DUO机器不支持?
收藏回复举报
Atlas 300I DUO ”DeepSeek-R1-Distill-Qwen32B+多模态模型InternVL2_5-8B“共用4卡8芯爆OOM。使用910B4机器可以共用8卡运行,是否是300I DUO机器不支持?
t('forum.solved') 已解决
发表于2025-04-28 15:09:30
0 查看

1、问题描述

Atlas300I DUO 96G *4 机器,1张卡有96G,将“DeepSeek-R1-Distill-Qwen32B(权重大小为62G)+多模态模型InternVL2_5-8B(权重大小为16G)“同时占用相同的4张卡启MindIE服务化,通过“watch npu-smi info”实时查看两个模型运行时的一张卡内占用的总显存显示并未超过卡的显存,却爆OOM

      2、版本配套:

MindIE镜像:swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts

CANN:8.0.0

HDK:24.1.rc3.b999

3、复现关键步骤:

      (1)创建容器

             【DeepSeek-R1-Distill-Qwen32B】

docker run -it -d --net=host  --ipc=host   --privileged=true  -e ASCEND_RUNTIME_OPTIONS=NODRV  --cap-add=SYS_PTRACE  --security-opt seccomp=unconfined   --shm-size=100g   -w /usr/local/Ascend/mindie/latest/mindie-service/ --name  MindIE-DS  --device=/dev/davinci_manager   --device=/dev/hisi_hdc    --device=/dev/devmm_svm    -v   /usr/local/dcmi:/usr/local/dcmi  

-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi:ro    -v /usr/local/Ascend/driver:/usr/local/Ascend/driver:ro    -v /usr/local/sbin:/usr/local/sbin:ro    -v  /data/ DeepSeek-R1-Distill-Qwen32B:/data/ DeepSeek-R1-Distill-Qwen32B  --entrypoint=bash    swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts        

             【InternVL2_5-8B】

docker run -it -d --net=host  --ipc=host   --privileged=true  -e ASCEND_RUNTIME_OPTIONS=NODRV  --cap-add=SYS_PTRACE  --security-opt seccomp=unconfined   --shm-size=100g   -w /usr/local/Ascend/mindie/latest/mindie-service/ --name  MindIE- InternVL2_5-8B   --device=/dev/davinci_manager   --device=/dev/hisi_hdc    --device=/dev/devmm_svm    -v   /usr/local/dcmi:/usr/local/dcmi  

-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi:ro    -v /usr/local/Ascend/driver:/usr/local/Ascend/driver:ro    -v /usr/local/sbin:/usr/local/sbin:ro    -v  /data/InternVL2_5-8B:/data/InternVL2_5-8B  --entrypoint=bash    swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts

      (2)两种模型MindIE服务化配置文件config.json关键部分修改:

             "maxSeqLen" : 40000,

        "maxInputTokenLen" : 12000,

"npuDeviceIds" : [[0,1,2,3,4,5,6,7]],

             "worldSize" : 8,

             "npuMemSize" : 1,

"maxPrefillBatchSize" : 10,

"maxPrefillTokens" : 12000

"maxBatchSize" : 20,

        "maxIterTimes" : 12000

3、模型显存占用

      (1)DeepSeek-R1-Distill-Qwen32B 单独跑4卡8芯:

cke_11352.png

            (2)多模态InternVL2_5-8B单独跑4卡8芯:

             cke_16445.png

            (3)DeepSeek-R1-Distill-Qwen32B+多模态InternVL2_5-8B 共用4张卡爆OOM:

             cke_23718.png

我要发帖子