硬件及软件:
cpu:kunpeng 920S
npu:atlas 300i dou 推理卡 *2
系统:麒麟v10
cann:8.2.RC1
npu-smi:25.2.0
vllm-ascend镜像:
python:3.11.13
pip核心包:

过程描述:
首先,参照vllm-ascend的官方文档进行基于vllm的monkeyocr框架,该框架基于vllm部署的qwen2.5-vl-3b模型运行。
经过测试,使用vllm-ascend提供的docker镜像可以单独正常拉起qwen2.5-vl-3b并进行推理。速度大概30s内完成单图解析。
接着,部署monkeyocr框架,经过一系列调试后,可以正常调用npu并启动ocr的测试服务

npu也正常使用到空间及核心:

完成部署后,首次推理总会有如下提示:

Warning: The oprator of ne is executed, Currently High Accuracy but Low Performance OP with 64-bit has been used, Please Do Some Cast at Python Functions with 32-bit for Better Performance! (function operator())
且同一张单图在服务启动后,首次的识别时间约为140秒,后继每次识别约60秒。识别速度很慢。nvidia 5090同一张图速度约15秒完成。

为了提升推理速度。经过查阅,没找到相关性问题,也没找到合适的解决办法。初步判断,是由于上面关于64位精度问题导致的推理性能较低。
目前推理速度太慢,无法达到预期要求。
问题:
想请教一下是否有人遇到跟我相似的性能问题?如何消除这个运算方法的精度警告从而提高推理速度。或者可以告诉一下,如何进行优化可以提高效率?
硬件及软件:
cpu:kunpeng 920S
npu:atlas 300i dou 推理卡 *2
系统:麒麟v10
cann:8.2.RC1
npu-smi:25.2.0
vllm-ascend镜像:
python:3.11.13
pip核心包:
过程描述:
首先,参照vllm-ascend的官方文档进行基于vllm的monkeyocr框架,该框架基于vllm部署的qwen2.5-vl-3b模型运行。
经过测试,使用vllm-ascend提供的docker镜像可以单独正常拉起qwen2.5-vl-3b并进行推理。速度大概30s内完成单图解析。
接着,部署monkeyocr框架,经过一系列调试后,可以正常调用npu并启动ocr的测试服务
npu也正常使用到空间及核心:
完成部署后,首次推理总会有如下提示:
Warning: The oprator of ne is executed, Currently High Accuracy but Low Performance OP with 64-bit has been used, Please Do Some Cast at Python Functions with 32-bit for Better Performance! (function operator())
且同一张单图在服务启动后,首次的识别时间约为140秒,后继每次识别约60秒。识别速度很慢。nvidia 5090同一张图速度约15秒完成。
为了提升推理速度。经过查阅,没找到相关性问题,也没找到合适的解决办法。初步判断,是由于上面关于64位精度问题导致的推理性能较低。
目前推理速度太慢,无法达到预期要求。
问题:
想请教一下是否有人遇到跟我相似的性能问题?如何消除这个运算方法的精度警告从而提高推理速度。或者可以告诉一下,如何进行优化可以提高效率?