单张昇腾卡部署多个推理服务,出现负载不均、部分实例卡顿
收藏回复举报
单张昇腾卡部署多个推理服务,出现负载不均、部分实例卡顿
t('forum.solved') 已解决
发表于2026-05-30 20:29:16
0 查看
各位社区伙伴,我在单张昇腾推理卡上同时部署三路不同的 AI 推理服务,上线后发现负载分配极不均衡。其中一个服务占用绝大部分算力,另外两个实例推理时延翻倍、频繁卡顿,整体硬件利用率偏低。我已经统一了三个服务的 BatchSize、推理并发数,也调整了程序启动顺序,问题没有改善。目前业务需要共用同一张 NPU 卡,暂时无法拆分硬件资源。我不清楚昇腾多实例的资源隔离与调度规则,想请教大家如何配置参数实现算力均衡分配,有没有成熟的多服务部署方案,望各位指点。

我要发帖子