ascend vllm v0.18.0部署Eco-Tech/DeepSeek-V4-Flash-w8a8-mtp使用时遇到的两个问题
收藏回复举报
ascend vllm v0.18.0部署Eco-Tech/DeepSeek-V4-Flash-w8a8-mtp使用时遇到的两个问题
t('forum.solved') 已解决
新人帖
发表于2026-05-25 19:54:29
0 查看

我在使用DeepSeek-V4-Flash-w8a8-mtp时遇到了两个问题

一、输出速度很慢,可能每秒20-30个token左右

二、模型输出乱码(opencode调用)

true

我的启动命令是

vllm-ds() {
    export VLLM_PORT=30001
    export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD
    export OMP_PROC_BIND=false
    export OMP_NUM_THREADS=8


    export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
    export ACL_OP_INIT_MODE=1
    export VLLM_ASCEND_ENABLE_FLASHCOMM1=1

    export USE_MULTI_GROUPS_KV_CACHE=1

    export TASK_QUEUE_ENABLE=1
    export HCCL_OP_EXPANSION_MODE="AIV"
    export HCCL_BUFFSIZE=512

    export USE_MULTI_BLOCK_POOL=1

    export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD

    vllm serve ~/.cache \
            --host 0.0.0.0 \
            --port 6070 \
        --safetensors-load-strategy prefetch \
        --max-model-len 1048576 \
        --max-num-batched-tokens 8192 \
        --served-model-name deepseek_v4_flash_w8a8 \
        --gpu-memory-utilization 0.92 \
        --max-num-seqs 16 \
        --data-parallel-size 1 \
        --tensor-parallel-size 8 \
        --enable-expert-parallel \
        --quantization ascend \
        --block-size 128 \
        --enable-chunked-prefill \
        --enable-prefix-caching \
        --tokenizer-mode deepseek_v4 \
        --tool-call-parser deepseek_v4 \
        --enable-auto-tool-choice \
        --reasoning-parser deepseek_v4 \
        --async-scheduling \
        --additional-config '{"enable_cpu_binding":true,"multistream_overlap_shared_expert":false}' \
        --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY","cudagraph_capture_sizes":[2,4,6,8,10,12,14,16,18,20,22,24,32,36,40]}' \
        --model-loader-extra-config '{"enable_multithread_load":true,"num_threads":16}' \
        --speculative-config '{"num_speculative_tokens":1,"method":"mtp"}'
}

我要发帖子