华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
容器版本1.0.0的服务化推理Qwen2.5-Coder-32B-Instruct及Qwen2.5-72B-Instruct模型时,推理速度较RC3版本大幅下降,每秒只有约1~2Token。
NPU执行效率如下:
AICore使用率始终在8%左右
root@ai-server2:~# npu-smi info +--------------------------------------------------------------------------------------------------------+ | npu-smi 24.1.rc2 Version: 24.1.rc2 | +-------------------------------+-----------------+------------------------------------------------------+ | NPU Name | Health | Power(W) Temp(C) Hugepages-Usage(page) | | Chip Device | Bus-Id | AICore(%) Memory-Usage(MB) | +===============================+=================+======================================================+ | 2 310P3 | OK | NA 77 18350 / 18350 | | 0 0 | 0000:01:00.0 | 7 38176/ 44280 | +-------------------------------+-----------------+------------------------------------------------------+ | 2 310P3 | OK | NA 76 18092 / 18092 | | 1 1 | 0000:01:00.0 | 6 37640/ 43693 | +===============================+=================+======================================================+ | 3 310P3 | OK | NA 78 18350 / 18350 | | 0 2 | 0000:03:00.0 | 7 38429/ 44280 | +-------------------------------+-----------------+------------------------------------------------------+ | 3 310P3 | OK | NA 78 18092 / 18092 | | 1 3 | 0000:03:00.0 | 7 37389/ 43693 | +===============================+=================+======================================================+ | 5 310P3 | OK | NA 78 18350 / 18350 | | 0 4 | 0000:81:00.0 | 8 38108/ 44280 | +-------------------------------+-----------------+------------------------------------------------------+ | 5 310P3 | OK | NA 77 18092 / 18092 | | 1 5 | 0000:81:00.0 | 8 37705/ 43693 | +===============================+=================+======================================================+ | 6 310P3 | OK | NA 82 18350 / 18350 | | 0 6 | 0000:84:00.0 | 10 38346/ 44280 | +-------------------------------+-----------------+------------------------------------------------------+ | 6 310P3 | OK | NA 83 18092 / 18092 | | 1 7 | 0000:84:00.0 | 8 37469/ 43693 | +===============================+=================+======================================================+ +-------------------------------+-----------------+------------------------------------------------------+ | NPU Chip | Process id | Process name | Process memory(MB) | +===============================+=================+======================================================+ | 2 0 | 573593 | mindie_llm_back | 36784 | | 2 1 | 573595 | mindie_llm_back | 36268 | +===============================+=================+======================================================+ | 3 0 | 573597 | mindie_llm_back | 36784 | | 3 1 | 573606 | mindie_llm_back | 36267 | +===============================+=================+======================================================+ | 5 0 | 573618 | mindie_llm_back | 36783 | | 5 1 | 573625 | mindie_llm_back | 36268 | +===============================+=================+======================================================+ | 6 0 | 573632 | mindie_llm_back | 36784 | | 6 1 | 573639 | mindie_llm_back | 36267 | +===============================+=================+======================================================+
请问如何实现NPU的满血输出?
我要发帖子
容器版本1.0.0的服务化推理Qwen2.5-Coder-32B-Instruct及Qwen2.5-72B-Instruct模型时,推理速度较RC3版本大幅下降,每秒只有约1~2Token。
NPU执行效率如下:
AICore使用率始终在8%左右
请问如何实现NPU的满血输出?