MindIE推理速度
收藏回复举报
MindIE推理速度
t('forum.solved') 已解决
发表于2024-08-14 15:21:24
0 查看

(上个帖子一天了也没通过审核,再发一次)
使用MindIE 1.0.0 RC2生产化部署Qwen2-72B-Instruct(128k上下文),npuMemSize拉到了32G,把资源吃满

接口开放出来后,发现速度很不理想。使用内置的Benchmark做了性能测试,128并发时生成速度仅有17tokens/s,这显然是无法满足生产需求的,请问有什么解决途径吗,还是说性能上限就在这里了···

我要发帖子