华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
目前在模型部署及性能调优方案上存在一些问题,求助各位技术专家
目标实现:GLM-5-w4a8大模型分布式部署在昇腾910b上,上下文35k,
性能方面:达到100并发 、ttft<1s 、tpot< 33ms 的稳定服务
现有2台8卡(每卡20Aicore、64GB)910B3服务器,最好基于MindIE/CANN原生推理部署调优,是否有可行或参考的解决方案
如果没有基于现有环境实现的方案,有没有基于目标实现推荐的解决方案,包括服务器配置或模型配置。
我要发帖子
目前在模型部署及性能调优方案上存在一些问题,求助各位技术专家
目标实现:GLM-5-w4a8大模型分布式部署在昇腾910b上,上下文35k,
性能方面:达到100并发 、ttft<1s 、tpot< 33ms 的稳定服务
现有2台8卡(每卡20Aicore、64GB)910B3服务器,最好基于MindIE/CANN原生推理部署调优,是否有可行或参考的解决方案
如果没有基于现有环境实现的方案,有没有基于目标实现推荐的解决方案,包括服务器配置或模型配置。