Ascend310B1上使用torch-npu插件在NPU上进行pytorch框架大模型的推理,有什么优化思路
收藏回复举报
Ascend310B1上使用torch-npu插件在NPU上进行pytorch框架大模型的推理,有什么优化思路
t('forum.solved') 已解决
发表于2025-04-02 17:04:32
0 查看
我已经在NPU上成功以全精度运行了一个大模型的推理任务(1.3B,有KV cache,但是cache的尺寸是固定的),目前的推理速度不是很理想(0.7s一个token)。但是我的代码层面感觉已经没有多少优化的空间了,接下来的优化角度可能就是在静态图,编译,量化,推理引擎这些非代码的角度进行优化了,想知道一般有什么优化思路呀

本帖最后由 匿名用户2025/04/30 10:30:05 编辑

我要发帖子