部署指导
基于vllm-ascend poc镜像部署Qwen3.5/3.6-MoE (3.5与3.6架构完全相同,复用命令)系列模型推理可以参考如下命令
vllm serve /home/data/Qwen3.5-35B-A3B-w8a8-MTP/
--host 127.0.0.1 --port 2077 -tp 4
--served-model-name qwen3.5
--trust-remote-code
--max_num_seqs 16
--max-model-len 16384 \ # 必选项 --gpu_memory_utilization 0.80
--additional-config '{"ascend_compilation_config": {"fuse_norm_quant": false}}'
--dtype float16 \ # 必选项 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [1,4]}'
--allowed-local-media-path /
--mamba-ssm-cache-dtype float16 # 必选项
性能数据 26.0.RC1大模型性能出口数据.xlsx
精度数据 TextVQA 存在精度掉点2%左右,排查中。。。 常见Q&A npu_recurrent_gated_delta_rule 问题
解决办法:增加必选参数--mamba-ssm-cache-dtype float16 --additional-config '{"ascend_compilation_config": {"fuse_norm_quant": false}}' 此参数必选,因为profile-run会进行fussion-pass,310p无法支持此功能 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [1,4]}' 使用图模式在TP模式下,存在event-id的硬件资源限制问题,目前只能捕获两张计算图,需设置capture-size --max-model-len 16384 必选,目前attention算子没有压缩mask能力,需要传入较大mask,需设置。
部署指导
基于vllm-ascend poc镜像部署Qwen3.5/3.6-MoE (3.5与3.6架构完全相同,复用命令)系列模型推理可以参考如下命令
vllm serve /home/data/Qwen3.5-35B-A3B-w8a8-MTP/
--host 127.0.0.1 --port 2077 -tp 4
--served-model-name qwen3.5
--trust-remote-code
--max_num_seqs 16
--max-model-len 16384 \ # 必选项 --gpu_memory_utilization 0.80
--additional-config '{"ascend_compilation_config": {"fuse_norm_quant": false}}'
--dtype float16 \ # 必选项 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [1,4]}'
--allowed-local-media-path /
--mamba-ssm-cache-dtype float16 # 必选项
性能数据 26.0.RC1大模型性能出口数据.xlsx
精度数据 TextVQA 存在精度掉点2%左右,排查中。。。 常见Q&A npu_recurrent_gated_delta_rule 问题
解决办法:增加必选参数--mamba-ssm-cache-dtype float16 --additional-config '{"ascend_compilation_config": {"fuse_norm_quant": false}}' 此参数必选,因为profile-run会进行fussion-pass,310p无法支持此功能 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [1,4]}' 使用图模式在TP模式下,存在event-id的硬件资源限制问题,目前只能捕获两张计算图,需设置capture-size --max-model-len 16384 必选,目前attention算子没有压缩mask能力,需要传入较大mask,需设置。