想在300i duo 上部署Qwen3-32B 或Qwen3-Next-80B-A3B-Instruct ,遇到推理速度很慢或者算子不支持的问题。
收藏回复举报
想在300i duo 上部署Qwen3-32B 或Qwen3-Next-80B-A3B-Instruct ,遇到推理速度很慢或者算子不支持的问题。
t('forum.solved') 已解决
发表于2026-01-28 15:25:50
0 查看

我在300i duo 上 ,基于mindie框架, 部署了Qwen3-32B 。速度比较慢,大约10tokens/s 。 mindie框架不支持Qwen3-Next 架构。

然后尝试用vllm-ascend容器 。部署Qwen3-32B ,速度也是比较慢。跟mindie上相当,约10tokens/s 。 用vllm-ascend 容器部署Qwen3-Next-80B-A3B-Instruct ,报算子不支持错误。

然后又看到SGLang框架可以部署Qwen3-Next。想求证,SGLang框架支持300i duo 吗 ? 

我想在300i duo部署Qwen3-32B 和Qwen3-Next-80B-A3B-Instruct ,请问有更快的方案吗?

我要发帖子