华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
因应业务需求,目前通过 MindIE 镜像能够在一台单机双卡的 300I Duo 上,以:1张卡跑 Deepseek distill qwen 32B,另一张卡跑 qwen2.5-7b 的方式运行模型服务,但是对算力的利用率不算很高。
有没有办法能够通过控制显存占用的方式,将32B和7B的模型分别平摊在2张卡上,提高算力芯片的利用效率?
我要发帖子
因应业务需求,目前通过 MindIE 镜像能够在一台单机双卡的 300I Duo 上,以:1张卡跑 Deepseek distill qwen 32B,另一张卡跑 qwen2.5-7b 的方式运行模型服务,但是对算力的利用率不算很高。
有没有办法能够通过控制显存占用的方式,将32B和7B的模型分别平摊在2张卡上,提高算力芯片的利用效率?