关于Atlas 300IDUO 推理性能问题
收藏回复举报
关于Atlas 300IDUO 推理性能问题
t('forum.solved') 已解决
发表于2025-07-25 14:05:46
0 查看

求助论坛的版主、大佬们,我在使用Atlas 300IDUO,对一些开源模型进行推理测试的时候发现,整体性能要比NVIDIA卡的推理速度很多,以Qwen3-32B为例:

使用镜像:mindie_2.0.T18.B010-300I-py3.11-openeuler24.03-lts-aarch64、以及参照论坛大佬的经验帖自行修改的MindIE 2.0RC1镜像

MindIE参数(config.json):中仅修改设备卡参数(npuDeviceIds、worldSize)以及输入输出参数(maxSeqLen、maxInputTokenLen、maxIterTimes),其余未作修改

测试推理卡组合:单卡-双芯、双卡-双芯 

经过测试发现:

a) 单卡-双芯下Qwen3-32B的生成速度约 5 tokens/s,且提升并发量至5后约3 tokens/s,损耗较高; 

b) 双卡-双芯下Qwen3-32B的生成速度约 8 tokens/s 

c) 单卡-双芯、双卡-双芯下均匀存在输入超长文本(长度约5000字符),首字出字等待时间较长(约6-9秒)

想请教下: 

1、相关主流开源模型(Qwen3系列、deepseek-R1/V2等),官方有在300IDUO下推理得性能指标数据吗?

2、使用MindeIE,在300IDUO上进行推理时,有推荐的参数配置信息吗?,通过调整哪些可控参数或者操作,可以提升推理速度性能?

3、在昇腾设备(Atlas 300IDUO)下,想对开源模型进行推理性能加速,除了使用MindeIE以外,还用别的可以使用得框架或者方案吗?

我要发帖子