华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
【行业】:互联网
【服务器型号】:Atlas 800T A2
【版本信息】:
--CANN版本:CANN 7.0.rc1
--mindspore版本:2.2.0
--Python版本:Python3.9.18
【问题描述】:llama2大模型推理时前两个token输出速度特别慢,后续正常,是否可以进行优化。
【Offering】:推理开发
【期望解决时间】:2023年12月29日
我要发帖子
【行业】:互联网
【服务器型号】:Atlas 800T A2
【版本信息】:
--CANN版本:CANN 7.0.rc1
--mindspore版本:2.2.0
--Python版本:Python3.9.18
【问题描述】:llama2大模型推理时前两个token输出速度特别慢,后续正常,是否可以进行优化。
【Offering】:推理开发
【期望解决时间】:2023年12月29日