华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
我这边尝试用ascendC开发一个算子,但host侧的tiling数据拷贝到device侧比较麻烦,我这里尝试用下面那种随算子下发拷贝的方式,但发现性能会变差一些
主要体现在下面这种方式导致了scalar计算单元成为瓶颈
请问一下这种情况有什么办法可以优化一下么
上面那种方式是华为这边各种资料推荐使用的方式,tiling数据是需要先拷贝到device侧传到kernel里,下面那种方式是host侧的tiling数据直接放到栈上,随kernel下发和其他kernel参数一起拷贝到数据段
我要发帖子
我这边尝试用ascendC开发一个算子,但host侧的tiling数据拷贝到device侧比较麻烦,我这里尝试用下面那种随算子下发拷贝的方式,但发现性能会变差一些
主要体现在下面这种方式导致了scalar计算单元成为瓶颈
请问一下这种情况有什么办法可以优化一下么
上面那种方式是华为这边各种资料推荐使用的方式,tiling数据是需要先拷贝到device侧传到kernel里,下面那种方式是host侧的tiling数据直接放到栈上,随kernel下发和其他kernel参数一起拷贝到数据段