华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
最近在做基于 CANN 的推理应用开发。在管理 Device 侧的内存时,我注意到 API 提供了 aclrtMalloc 和 aclrtMallocCached 两种分配方式。查阅官方文档后,我理解带有 Cached 的接口使用了缓存机制。但在实际的工程落地中(比如在使用类似 YOLOv8n 这类模型进行连续多帧的高频推理检测任务时),这两个接口在底层驱动层面的开销差异具体有多大
aclrtMalloc
aclrtMallocCached
我要发帖子
最近在做基于 CANN 的推理应用开发。在管理 Device 侧的内存时,我注意到 API 提供了
aclrtMalloc和aclrtMallocCached两种分配方式。查阅官方文档后,我理解带有 Cached 的接口使用了缓存机制。但在实际的工程落地中(比如在使用类似 YOLOv8n 这类模型进行连续多帧的高频推理检测任务时),这两个接口在底层驱动层面的开销差异具体有多大