应用开发中,一个场景可以定义成需要对大量的矩阵对进行矩阵乘法运算。
通常在CPU或GPU上,会采取CPU多核并发或GPU上将计算任务分配到大量的Core上面做并行运算。那么在NPU上面,如何处理这种需要上万次调用矩阵乘算子的场景呢?
参考了一些应用开发C++/python 的样例,使用了类似的方法开启多线程,不同的线程分别去做数据前处理、计算、数据后处理。但仍然无法实现上述场景的提速。而且根据代码执行的结果大概观测到,无论开启几个线程几个stream,单device同一时刻只能支持一个算子的运行。请问这个结论是正确的吗,还是使用方法有问题?
应用开发中,一个场景可以定义成需要对大量的矩阵对进行矩阵乘法运算。
通常在CPU或GPU上,会采取CPU多核并发或GPU上将计算任务分配到大量的Core上面做并行运算。那么在NPU上面,如何处理这种需要上万次调用矩阵乘算子的场景呢?
参考了一些应用开发C++/python 的样例,使用了类似的方法开启多线程,不同的线程分别去做数据前处理、计算、数据后处理。但仍然无法实现上述场景的提速。而且根据代码执行的结果大概观测到,无论开启几个线程几个stream,单device同一时刻只能支持一个算子的运行。请问这个结论是正确的吗,还是使用方法有问题?