1、问题描述
Atlas300I DUO 96G *4 机器,1张卡有96G,将“DeepSeek-R1-Distill-Qwen32B(权重大小为62G)+多模态模型InternVL2_5-8B(权重大小为16G)“同时占用相同的4张卡启MindIE服务化,通过“watch npu-smi info”实时查看两个模型运行时的一张卡内占用的总显存显示并未超过卡的显存,却爆OOM
2、版本配套:
MindIE镜像:swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts
CANN:8.0.0
HDK:24.1.rc3.b999
3、复现关键步骤:
(1)创建容器
【DeepSeek-R1-Distill-Qwen32B】
docker run -it -d --net=host --ipc=host --privileged=true -e ASCEND_RUNTIME_OPTIONS=NODRV --cap-add=SYS_PTRACE --security-opt seccomp=unconfined --shm-size=100g -w /usr/local/Ascend/mindie/latest/mindie-service/ --name MindIE-DS --device=/dev/davinci_manager --device=/dev/hisi_hdc --device=/dev/devmm_svm -v /usr/local/dcmi:/usr/local/dcmi
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi:ro -v /usr/local/Ascend/driver:/usr/local/Ascend/driver:ro -v /usr/local/sbin:/usr/local/sbin:ro -v /data/ DeepSeek-R1-Distill-Qwen32B:/data/ DeepSeek-R1-Distill-Qwen32B --entrypoint=bash swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts
【InternVL2_5-8B】
docker run -it -d --net=host --ipc=host --privileged=true -e ASCEND_RUNTIME_OPTIONS=NODRV --cap-add=SYS_PTRACE --security-opt seccomp=unconfined --shm-size=100g -w /usr/local/Ascend/mindie/latest/mindie-service/ --name MindIE- InternVL2_5-8B --device=/dev/davinci_manager --device=/dev/hisi_hdc --device=/dev/devmm_svm -v /usr/local/dcmi:/usr/local/dcmi
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi:ro -v /usr/local/Ascend/driver:/usr/local/Ascend/driver:ro -v /usr/local/sbin:/usr/local/sbin:ro -v /data/InternVL2_5-8B:/data/InternVL2_5-8B --entrypoint=bash swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts
(2)两种模型MindIE服务化配置文件config.json关键部分修改:
"maxSeqLen" : 40000,
"maxInputTokenLen" : 12000,
"npuDeviceIds" : [[0,1,2,3,4,5,6,7]],
"worldSize" : 8,
"npuMemSize" : 1,
"maxPrefillBatchSize" : 10,
"maxPrefillTokens" : 12000
"maxBatchSize" : 20,
"maxIterTimes" : 12000
3、模型显存占用
(1)DeepSeek-R1-Distill-Qwen32B 单独跑4卡8芯:

(2)多模态InternVL2_5-8B单独跑4卡8芯:

(3)DeepSeek-R1-Distill-Qwen32B+多模态InternVL2_5-8B 共用4张卡爆OOM:

1、问题描述
Atlas300I DUO 96G *4 机器,1张卡有96G,将“DeepSeek-R1-Distill-Qwen32B(权重大小为62G)+多模态模型InternVL2_5-8B(权重大小为16G)“同时占用相同的4张卡启MindIE服务化,通过“watch npu-smi info”实时查看两个模型运行时的一张卡内占用的总显存显示并未超过卡的显存,却爆OOM
2、版本配套:
MindIE镜像:swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts
CANN:8.0.0
HDK:24.1.rc3.b999
3、复现关键步骤:
(1)创建容器
【DeepSeek-R1-Distill-Qwen32B】
docker run -it -d --net=host --ipc=host --privileged=true -e ASCEND_RUNTIME_OPTIONS=NODRV --cap-add=SYS_PTRACE --security-opt seccomp=unconfined --shm-size=100g -w /usr/local/Ascend/mindie/latest/mindie-service/ --name MindIE-DS --device=/dev/davinci_manager --device=/dev/hisi_hdc --device=/dev/devmm_svm -v /usr/local/dcmi:/usr/local/dcmi
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi:ro -v /usr/local/Ascend/driver:/usr/local/Ascend/driver:ro -v /usr/local/sbin:/usr/local/sbin:ro -v /data/ DeepSeek-R1-Distill-Qwen32B:/data/ DeepSeek-R1-Distill-Qwen32B --entrypoint=bash swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts
【InternVL2_5-8B】
docker run -it -d --net=host --ipc=host --privileged=true -e ASCEND_RUNTIME_OPTIONS=NODRV --cap-add=SYS_PTRACE --security-opt seccomp=unconfined --shm-size=100g -w /usr/local/Ascend/mindie/latest/mindie-service/ --name MindIE- InternVL2_5-8B --device=/dev/davinci_manager --device=/dev/hisi_hdc --device=/dev/devmm_svm -v /usr/local/dcmi:/usr/local/dcmi
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi:ro -v /usr/local/Ascend/driver:/usr/local/Ascend/driver:ro -v /usr/local/sbin:/usr/local/sbin:ro -v /data/InternVL2_5-8B:/data/InternVL2_5-8B --entrypoint=bash swr.cn-south-1.myhuaweicloud.com/ascendhub/mindie:1.0.0-300I-Duo-py311-openeuler24.03-lts
(2)两种模型MindIE服务化配置文件config.json关键部分修改:
"maxSeqLen" : 40000,
"maxInputTokenLen" : 12000,
"npuDeviceIds" : [[0,1,2,3,4,5,6,7]],
"worldSize" : 8,
"npuMemSize" : 1,
"maxPrefillBatchSize" : 10,
"maxPrefillTokens" : 12000
"maxBatchSize" : 20,
"maxIterTimes" : 12000
3、模型显存占用
(1)DeepSeek-R1-Distill-Qwen32B 单独跑4卡8芯:
(2)多模态InternVL2_5-8B单独跑4卡8芯:
(3)DeepSeek-R1-Distill-Qwen32B+多模态InternVL2_5-8B 共用4张卡爆OOM: