华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
我在使用MindIE进行模型服务化部署时遇到一个性能方面的问题。模型加载完成后,第一次推理的延迟明显高于后续请求,有时候甚至相差一个数量级。我们的业务场景对首包延迟有严格要求,这种首次推理慢的现象会影响到实际的上线效果。我已经尝试了模型预热,在服务启动后先发送几条假数据,但效果不太理想,首次请求仍然明显偏慢。想请教一下各位,在MindIE的部署实践中,针对这种首次推理延迟偏高的问题,通常有哪些有效的优化手段?
我要发帖子
我在使用MindIE进行模型服务化部署时遇到一个性能方面的问题。模型加载完成后,第一次推理的延迟明显高于后续请求,有时候甚至相差一个数量级。我们的业务场景对首包延迟有严格要求,这种首次推理慢的现象会影响到实际的上线效果。我已经尝试了模型预热,在服务启动后先发送几条假数据,但效果不太理想,首次请求仍然明显偏慢。想请教一下各位,在MindIE的部署实践中,针对这种首次推理延迟偏高的问题,通常有哪些有效的优化手段?