我已经在NPU上成功以全精度运行了一个大模型的推理任务(1.3B,有KV cache,但是cache的尺寸是固定的),目前的推理速度不是很理想(0.7s一个token)。但是我的代码层面感觉已经没有多少优化的空间了,接下来的优化角度可能就是在静态图,编译,量化,推理引擎这些非代码的角度进行优化了,想知道一般有什么优化思路呀
Ascend310B1上使用torch-npu插件在NPU上进行pytorch框架大模型的推理,有什么优化思路
已解决
本帖最后由 匿名用户 于 2025/04/30 10:30:05 编辑



