正常提问请勿删帖,谢谢审核!atlas 300i duo使用vllm-ascend部署qwen2.5-vl-3b的推理运算精度问题,应该如何提高推理效率?
收藏回复举报
正常提问请勿删帖,谢谢审核!atlas 300i duo使用vllm-ascend部署qwen2.5-vl-3b的推理运算精度问题,应该如何提高推理效率?
t('forum.solved') 已解决
发表于2025-09-05 16:33:44
0 查看

硬件及软件:

cpu:kunpeng 920S 

npu:atlas 300i dou 推理卡 *2

系统:麒麟v10

cann:8.2.RC1

npu-smi:25.2.0

vllm-ascend镜像:

docker pull quay.io/ascend/vllm-ascend:v0.10.1rc1-310p

python:3.11.13

pip核心包:

过程描述:

首先,参照vllm-ascend的官方文档进行基于vllm的monkeyocr框架,该框架基于vllm部署的qwen2.5-vl-3b模型运行。

经过测试,使用vllm-ascend提供的docker镜像可以单独正常拉起qwen2.5-vl-3b并进行推理。速度大概30s内完成单图解析。

接着,部署monkeyocr框架,经过一系列调试后,可以正常调用npu并启动ocr的测试服务

npu也正常使用到空间及核心:

完成部署后,首次推理总会有如下提示:

Warning: The oprator of ne is executed, Currently High Accuracy but Low Performance OP with 64-bit has been used, Please Do Some Cast at Python Functions with 32-bit for Better Performance! (function operator())

且同一张单图在服务启动后,首次的识别时间约为140秒,后继每次识别约60秒。识别速度很慢。nvidia 5090同一张图速度约15秒完成。

为了提升推理速度。经过查阅,没找到相关性问题,也没找到合适的解决办法。初步判断,是由于上面关于64位精度问题导致的推理性能较低。

目前推理速度太慢,无法达到预期要求。

问题:

想请教一下是否有人遇到跟我相似的性能问题?如何消除这个运算方法的精度警告从而提高推理速度。或者可以告诉一下,如何进行优化可以提高效率?

我要发帖子