使用mindie+8*910b做qwen2.5-32b-instruct大模型推理,最大输入长度是967,最大输出长度198,并发是1,请求了8次,客户那边使用mindie+8*910b测试不带lora启动平均推理速度是50tokens/s,带lora启动是30+tokens/s,他们使用vllm+8*A100测试不带lora启动是80+tokens/s,想问一下我们使用mindie+8*910b做qwen2.5-32b-instruct大模型推理,正常的平均推理速度大概是多少,和A100相比差距是不是正常的
使用800IA2(910B 8卡)做qwen2.5-32b-instruct推理速度慢
已解决



