多线程模型下 aclrtMemcpy(HostToDevice) 速度慢
收藏回复举报
多线程模型下 aclrtMemcpy(HostToDevice) 速度慢
t('forum.solved') 已解决
新人帖
发表于2023-05-22 19:38:19
0 查看

硬件信息:Atlas 200I A2 加速模块

CANN包版本:6.3.RC1.alpha001


目前我有检测和跟踪两个模型,分别有两个线程进行推理,两个线程都需要调用 aclrtMemcpy 这个接口将 host memory 的数据传入 device memory。检测线程要aclrtMemcpy(HostToDevice)的数据量为 4x3x640x640 Bytes。如果单独只有检测的线程在运行的话, aclrtMemcpy 只会花 3ms 左右;如果检测和跟踪两个线程同时跑,检测线程 aclrtMemcpy 的耗时会增加到 13ms。通过 npu-smi info 查看,发现 AI Core 的利用率已经100%了,这会不会对aclrtMemcpy的耗时增加有影响?有什么方法降低 aclrtMemcpy 的耗时吗?

我要发帖子