如何基于2台8卡(每卡20Aicore、64GB)910B3服务器,基于MindIE/CANN原生推理部署调优,实现GLM-5-w4a8大模型分布式部署在昇腾910b上,上下文35k
收藏回复举报
如何基于2台8卡(每卡20Aicore、64GB)910B3服务器,基于MindIE/CANN原生推理部署调优,实现GLM-5-w4a8大模型分布式部署在昇腾910b上,上下文35k
t('forum.solved') 已解决
发表于2026-03-28 11:01:07
0 查看

目前在模型部署及性能调优方案上存在一些问题,求助各位技术专家

目标实现:GLM-5-w4a8大模型分布式部署在昇腾910b上,上下文35k,

性能方面:达到100并发 、ttft<1s 、tpot< 33ms 的稳定服务

现有2台8卡(每卡20Aicore、64GB)910B3服务器,最好基于MindIE/CANN原生推理部署调优,是否有可行或参考的解决方案

如果没有基于现有环境实现的方案,有没有基于目标实现推荐的解决方案,包括服务器配置或模型配置。

我要发帖子