华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
目前Qwen2没有适配,推理速度慢,llama3.1因为atb_llm对应的transformer版本过老,导致modeling_llama.py内的rope_scaling_type参数不匹配,我们把llama3.1的config强行修改成老版config去匹配atb版本,结果模型输出胡言乱语。
另外一个问题,有没有类似-enable-prefix-caching这样的缓存功能。
我要发帖子
目前Qwen2没有适配,推理速度慢,llama3.1因为atb_llm对应的transformer版本过老,导致modeling_llama.py内的rope_scaling_type参数不匹配,我们把llama3.1的config强行修改成老版config去匹配atb版本,结果模型输出胡言乱语。
另外一个问题,有没有类似-enable-prefix-caching这样的缓存功能。