求助,跑ModelZoo中LLaMA 7B模型(https://www.hiascend.com/software/modelzoo/models/detail/296c23cf975c47b9b7a829b9586a5b0c),报错507033,我的机器是4张910B的昇腾卡32G,因为单卡内存不足加载完模型,做了流水线模型并行,4张卡加载一个模型,使用例子中的以下命令:
python ./tools/ckpt_convert/llama/convert_weights_from_huggingface.py \ --input-model-dir ./dataset/llama-7b-hf/ \ --output-model-dir ./dataset/llama-7b-as/ \ --tensor-model-parallel-size 1 \ --pipeline-model-parallel-size 4 \ --type 7B \ --deepspeed
执行shell脚本也做了对应修改:
deepspeed pretrain_llama.py \ --DDP-impl local \ --tensor-model-parallel-size 1 \ --pipeline-model-parallel-size 4 \ --num-layers 32 \ --hidden-size 4096 \
但结果报错507033 和E30003,求助怎么解决

求助,跑ModelZoo中LLaMA 7B模型(https://www.hiascend.com/software/modelzoo/models/detail/296c23cf975c47b9b7a829b9586a5b0c),报错507033,我的机器是4张910B的昇腾卡32G,因为单卡内存不足加载完模型,做了流水线模型并行,4张卡加载一个模型,使用例子中的以下命令:
python ./tools/ckpt_convert/llama/convert_weights_from_huggingface.py \ --input-model-dir ./dataset/llama-7b-hf/ \ --output-model-dir ./dataset/llama-7b-as/ \ --tensor-model-parallel-size 1 \ --pipeline-model-parallel-size 4 \ --type 7B \ --deepspeed
执行shell脚本也做了对应修改:
deepspeed pretrain_llama.py \ --DDP-impl local \ --tensor-model-parallel-size 1 \ --pipeline-model-parallel-size 4 \ --num-layers 32 \ --hidden-size 4096 \
但结果报错507033 和E30003,求助怎么解决