CPU:Kunpeng-920
NPU:Ascend910B4 * 8 24.1.rc3
模型:QwQ-32B.gguf
推理框架:llama.cpp
编译方式:
cmake -B build -DGGML_CANN=ON -DCMAKE_BUILD_TYPE=RELEASE
cmake --build build --config Release -j 192 --target llama-server
运行方式:
build/bin/llama-server -m /data/model/QwQ-32B.gguf --port 8080 --host 0.0.0.0 -gnl 99 -t 192 --prio 2

CPU:Kunpeng-920
NPU:Ascend910B4 * 8 24.1.rc3
模型:QwQ-32B.gguf
推理框架:llama.cpp
编译方式:
cmake -B build -DGGML_CANN=ON -DCMAKE_BUILD_TYPE=RELEASE
cmake --build build --config Release -j 192 --target llama-server
运行方式:
build/bin/llama-server -m /data/model/QwQ-32B.gguf --port 8080 --host 0.0.0.0 -gnl 99 -t 192 --prio 2