华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
原问题:https://www.hiascend.com/forum/thread-0213131190739861077-1-1.html 板主建议我到CANN板块提问。
请问手动优化的模型(特别是LLM)相较于直接转换的OM格式会有性能上的优势么。在昇腾硬件上能否做一些类似于 cuda 中的,flash attention,page attention 的一些优化。或者目前有没有一些现成的优化代码呢。
我要发帖子
原问题:https://www.hiascend.com/forum/thread-0213131190739861077-1-1.html 板主建议我到CANN板块提问。
请问手动优化的模型(特别是LLM)相较于直接转换的OM格式会有性能上的优势么。在昇腾硬件上能否做一些类似于 cuda 中的,flash attention,page attention 的一些优化。或者目前有没有一些现成的优化代码呢。