华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
我在使用DeepSeek-V4-Flash-w8a8-mtp时遇到了两个问题
vllm-ds() { export VLLM_PORT=30001 export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD export OMP_PROC_BIND=false export OMP_NUM_THREADS=8 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export ACL_OP_INIT_MODE=1 export VLLM_ASCEND_ENABLE_FLASHCOMM1=1 export USE_MULTI_GROUPS_KV_CACHE=1 export TASK_QUEUE_ENABLE=1 export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_BUFFSIZE=512 export USE_MULTI_BLOCK_POOL=1 export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD vllm serve ~/.cache \ --host 0.0.0.0 \ --port 6070 \ --safetensors-load-strategy prefetch \ --max-model-len 1048576 \ --max-num-batched-tokens 8192 \ --served-model-name deepseek_v4_flash_w8a8 \ --gpu-memory-utilization 0.92 \ --max-num-seqs 16 \ --data-parallel-size 1 \ --tensor-parallel-size 8 \ --enable-expert-parallel \ --quantization ascend \ --block-size 128 \ --enable-chunked-prefill \ --enable-prefix-caching \ --tokenizer-mode deepseek_v4 \ --tool-call-parser deepseek_v4 \ --enable-auto-tool-choice \ --reasoning-parser deepseek_v4 \ --async-scheduling \ --additional-config '{"enable_cpu_binding":true,"multistream_overlap_shared_expert":false}' \ --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY","cudagraph_capture_sizes":[2,4,6,8,10,12,14,16,18,20,22,24,32,36,40]}' \ --model-loader-extra-config '{"enable_multithread_load":true,"num_threads":16}' \ --speculative-config '{"num_speculative_tokens":1,"method":"mtp"}' }
我要发帖子
我在使用DeepSeek-V4-Flash-w8a8-mtp时遇到了两个问题
一、输出速度很慢,可能每秒20-30个token左右
二、模型输出乱码(opencode调用)
我的启动命令是
vllm-ds() { export VLLM_PORT=30001 export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD export OMP_PROC_BIND=false export OMP_NUM_THREADS=8 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export ACL_OP_INIT_MODE=1 export VLLM_ASCEND_ENABLE_FLASHCOMM1=1 export USE_MULTI_GROUPS_KV_CACHE=1 export TASK_QUEUE_ENABLE=1 export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_BUFFSIZE=512 export USE_MULTI_BLOCK_POOL=1 export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD vllm serve ~/.cache \ --host 0.0.0.0 \ --port 6070 \ --safetensors-load-strategy prefetch \ --max-model-len 1048576 \ --max-num-batched-tokens 8192 \ --served-model-name deepseek_v4_flash_w8a8 \ --gpu-memory-utilization 0.92 \ --max-num-seqs 16 \ --data-parallel-size 1 \ --tensor-parallel-size 8 \ --enable-expert-parallel \ --quantization ascend \ --block-size 128 \ --enable-chunked-prefill \ --enable-prefix-caching \ --tokenizer-mode deepseek_v4 \ --tool-call-parser deepseek_v4 \ --enable-auto-tool-choice \ --reasoning-parser deepseek_v4 \ --async-scheduling \ --additional-config '{"enable_cpu_binding":true,"multistream_overlap_shared_expert":false}' \ --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY","cudagraph_capture_sizes":[2,4,6,8,10,12,14,16,18,20,22,24,32,36,40]}' \ --model-loader-extra-config '{"enable_multithread_load":true,"num_threads":16}' \ --speculative-config '{"num_speculative_tokens":1,"method":"mtp"}' }