硬件信息:Atlas 200I A2 加速模块
CANN包版本:6.3.RC1.alpha001
目前我有检测和跟踪两个模型,分别有两个线程进行推理,两个线程都需要调用 aclrtMemcpy 这个接口将 host memory 的数据传入 device memory。检测线程要aclrtMemcpy(HostToDevice)的数据量为 4x3x640x640 Bytes。如果单独只有检测的线程在运行的话, aclrtMemcpy 只会花 3ms 左右;如果检测和跟踪两个线程同时跑,检测线程 aclrtMemcpy 的耗时会增加到 13ms。通过 npu-smi info 查看,发现 AI Core 的利用率已经100%了,这会不会对aclrtMemcpy的耗时增加有影响?有什么方法降低 aclrtMemcpy 的耗时吗?
硬件信息:Atlas 200I A2 加速模块
CANN包版本:6.3.RC1.alpha001
目前我有检测和跟踪两个模型,分别有两个线程进行推理,两个线程都需要调用 aclrtMemcpy 这个接口将 host memory 的数据传入 device memory。检测线程要aclrtMemcpy(HostToDevice)的数据量为 4x3x640x640 Bytes。如果单独只有检测的线程在运行的话, aclrtMemcpy 只会花 3ms 左右;如果检测和跟踪两个线程同时跑,检测线程 aclrtMemcpy 的耗时会增加到 13ms。通过 npu-smi info 查看,发现 AI Core 的利用率已经100%了,这会不会对aclrtMemcpy的耗时增加有影响?有什么方法降低 aclrtMemcpy 的耗时吗?