华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
(上个帖子一天了也没通过审核,再发一次) 使用MindIE 1.0.0 RC2生产化部署Qwen2-72B-Instruct(128k上下文),npuMemSize拉到了32G,把资源吃满
接口开放出来后,发现速度很不理想。使用内置的Benchmark做了性能测试,128并发时生成速度仅有17tokens/s,这显然是无法满足生产需求的,请问有什么解决途径吗,还是说性能上限就在这里了···
我要发帖子
(上个帖子一天了也没通过审核,再发一次)

使用MindIE 1.0.0 RC2生产化部署Qwen2-72B-Instruct(128k上下文),npuMemSize拉到了32G,把资源吃满
接口开放出来后,发现速度很不理想。使用内置的Benchmark做了性能测试,128并发时生成速度仅有17tokens/s,这显然是无法满足生产需求的,请问有什么解决途径吗,还是说性能上限就在这里了···
