基于香橙派AI pro的Qwen3-0.6B的om模型推理部署
本项目已开源于: gitcode.com/BB_out_snow/qwen-ascend-llm
项目推理的模型为Qwen3-0.6B。
未作推理效果评测,未作模型优化。
本项目实现了Qwen3-0.6B模型在香橙派AI pro的边缘设备上的推理部署。并将转换为OM模型,使其适配昇腾的框架进行部署推理。
一、运行环境
1.1 项目基础环境
1.2 python环境参考
python版本为 3.9
参考依赖包如下:
二、下载项目文件以及模型转换
2.0 增加交换空间
2.1 香橙派的环境配置
1.切换到主目录
2.克隆本项目
3.赋权文件夹
4.切换到本项目的工作目录
5.创建python环境
6.激活环境
7.下载python环境的!!!部分依赖!!!
8.根据华为昇腾官网资料提示下载,防止版本不对
2.2Windows的环境配置
模型从转换需要在上位机上面转换为onnx,在香橙派上转换耗时过长。
1.切换到主目录
2.克隆本项目
4.切换到本项目的工作目录
5.创建python环境
6.激活环境
7.下载python环境的依赖
2.3 下载模型文件
1.切换到工作目录
win
linux香橙派
2.激活python环境
3.下载模型
win
linux 香橙派
4.查看原始模型文件
win
linux 香橙派
2.4 换为onnx模型
1.切换到工作目录
win
linux香橙派
2.激活python环境
3.运行模型转换脚本
win (仅支持--dtype=float32 )
linux香橙派(建议--dtype=float16)
4.查看生成的onnx模型文件
5.win
在win电脑上使用cpu模型转换输出结果,参考如下
6.linux 香橙派
在香橙派上使用NPU模型转换输出结果,参考如下
2.5 运行脚本推理onnx模型
1.切换到工作目录
win
linux香橙派
2.激活python环境
3.运行推理onnx脚本
win
linux香橙派(onnx模型直接爆了,跑不了)
2.6 改变onnx结构适配om的一些算子结构(如果未使用npu转换,可以在此作优化)
1.切换到工作目录
win
2.激活python环境
3.运行改变onnx结构适配om的结构的脚本
win
等待几十分钟后,生成的onnx系列文件参考如下
4.查看生成的onnx模型文件
win
2.7 将onnx模型为om模型
1.切换到工作目录
2.激活python环境
3.运行将onnx模型为om模型的脚本
4.windows的cpu导出onnx模型转换为om模型(--dtype=float32 )
windows的cpu导出onnx模型转换为om模型(--dtype=float32 )
等待 近半个小时的转换后,终端输出参考如下
5.linux香橙派的npu导出的onnx模型转换未om模型(--dtype=float16)
linux香橙派的npu导出的onnx模型转换未om模型(--dtype=float16)
等待 近半个小时的转换后,终端输出参考如下
6.查看生成的om模型文件
三、香橙派AI pro 推理Qwen3-0.6B模型测试
3.1 onnx模型测试
1.切换到工作目录
2.激活python环境
3.运行推理脚本
4.直接爆了。onnx跑不了。
3.2 om模型测试
1.切换到工作目录
2.激活python环境
3.运行推理脚本
4.测试结果如下,勉强可以跑起来。
四、主要参考项目
1.Tlntin的qwen-ascend-llm
2.Qwen3
3.基于昇腾310芯片的大语言模型部署
4.昇腾
基于香橙派AI pro的Qwen3-0.6B的om模型推理部署
本项目已开源于: gitcode.com/BB_out_snow/qwen-ascend-llm
项目推理的模型为Qwen3-0.6B。
未作推理效果评测,未作模型优化。
本项目实现了Qwen3-0.6B模型在香橙派AI pro的边缘设备上的推理部署。并将转换为OM模型,使其适配昇腾的框架进行部署推理。
一、运行环境
1.1 项目基础环境
1.2 python环境参考
python版本为 3.9
参考依赖包如下:
二、下载项目文件以及模型转换
2.0 增加交换空间
2.1 香橙派的环境配置
1.切换到主目录
2.克隆本项目
3.赋权文件夹
4.切换到本项目的工作目录
5.创建python环境
6.激活环境
7.下载python环境的!!!部分依赖!!!
8.根据华为昇腾官网资料提示下载,防止版本不对
2.2Windows的环境配置
模型从转换需要在上位机上面转换为onnx,在香橙派上转换耗时过长。
1.切换到主目录
2.克隆本项目
4.切换到本项目的工作目录
5.创建python环境
6.激活环境
7.下载python环境的依赖
2.3 下载模型文件
1.切换到工作目录
win
linux香橙派
2.激活python环境
3.下载模型
win
linux 香橙派
4.查看原始模型文件
win
linux 香橙派
2.4 换为onnx模型
1.切换到工作目录
win
linux香橙派
2.激活python环境
3.运行模型转换脚本
win (仅支持--dtype=float32 )
linux香橙派(建议--dtype=float16)
4.查看生成的onnx模型文件
5.win
在win电脑上使用cpu模型转换输出结果,参考如下
(ascend-llm) D:\qwen-ascend-llm>python export/export_onnx3.py --device_str=cpu --dtype=float32 --hf_model_dir="./download/Qwen3-0.6B" --onnx_model_path="./output/onnx_cpu/Qwen3-0.6B.onnx" --kv_cache_length=2048 Warning: transformers.models.qwen3.Qwen3Config not found. Using local Qwen3Config. new model config save ok in ./download/Qwen3-0.6B Qwen3 attention_bias setting: False begin export onnx3 The argument `trust_remote_code` is to be used with Auto classes. It has no effect here and is ignored. D:\qwen-ascend-llm\export\modeling_qwen3.py:156: TracerWarning: Converting a tensor to a Python boolean might cause the trace to be incorrect. We can't record the data flow of Python values, so this value will be treated as a constant in the future. This means that the trace might not generalize to other inputs! if seq_len > self.max_seq_len_cached: (ascend-llm) D:\qwen-ascend-llm\output\onnx_cpu>dir 2026/01/05 17:25 <DIR> .. 2026/01/05 17:25 622,329,856 model.embed_tokens.weight .................................................................... 此处省略 .................................................................... 2026/01/05 17:25 2,008,091 Qwen3-0.6B.onnx 2026/01/05 17:25 20,971,520 _model_layers.0_self_attn_rotary_emb_Constant_5_attr__value 2026/01/05 17:25 20,971,520 _model_layers.0_self_attn_rotary_emb_Constant_attr__value 200 个文件 2,427,888,667 字节 2 个目录 188,569,636,864 可用字节6.linux 香橙派
在香橙派上使用NPU模型转换输出结果,参考如下
2.5 运行脚本推理onnx模型
1.切换到工作目录
win
linux香橙派
2.激活python环境
3.运行推理onnx脚本
win
linux香橙派(onnx模型直接爆了,跑不了)
2.6 改变onnx结构适配om的一些算子结构(如果未使用npu转换,可以在此作优化)
1.切换到工作目录
win
2.激活python环境
3.运行改变onnx结构适配om的结构的脚本
win
等待几十分钟后,生成的onnx系列文件参考如下
4.查看生成的onnx模型文件
win
2.7 将onnx模型为om模型
1.切换到工作目录
2.激活python环境
3.运行将onnx模型为om模型的脚本
4.windows的cpu导出onnx模型转换为om模型(--dtype=float32 )
windows的cpu导出onnx模型转换为om模型(--dtype=float32 )
等待 近半个小时的转换后,终端输出参考如下
-sh-5.1# python export/onnx2om.py --hf_model_dir="./download/Qwen3-0.6B" --onnx_model_path="./output/onnx3/Qwen3-0.6B.onnx" --om_model_path="./output/model/Qwen3-0.6B" --kv_cache_length=1024 --cpu_thread=2 --max_prefill_length=2 [INFO] soc_version is `auto`, will auto detect soc version [INFO] {'soc_full_name': 'Ascend310B4', 'soc_short_name': 'Ascend310B'} ============ run command ============== export MS_DEV_FORCE_ACL=1 && export MS_ENABLE_GE=1 && export TE_PARALLEL_COMPILER=2 && export MAX_COMPILE_CORE_NUMBER=2 && atc --framework=5 --model="./output/onnx3/Qwen3-0.6B.onnx" --output="./output/model/Qwen3-0.6B" --soc_version=Ascend310B4 --precision_mode_v2=mixed_float16 --modify_mixlist=/home/HwHiAiUser/ascend_llm/qwen-ascend-llm/ops_info.json --input_format=ND --input_shape="input_ids:1,-1;attention_mask:1,-1;position_ids:1,-1;past_key_values:1,-1,448,128" --dynamic_dims "1,513,1,512;2,514,2,512;1,1025,1,1024;2,1026,2,1024" ======================================= ATC start working now, please wait for a moment. - ... ATC run success, welcome to the next use. -sh-5.1# ls -la output/model/ total 6091596 drwxr-xr-x 2 root root 4096 Apr 18 09:26 . drwxr-xr-x 5 HwHiAiUser HwHiAiUser 4096 Apr 18 07:00 .. -rw------- 1 root root 6237780332 Apr 18 09:27 Qwen3-0.6B.om5.linux香橙派的npu导出的onnx模型转换未om模型(--dtype=float16)
linux香橙派的npu导出的onnx模型转换未om模型(--dtype=float16)
等待 近半个小时的转换后,终端输出参考如下
(ascend-llm) sh-5.1# python export/onnx2om.py --hf_model_dir="./download/Qwen3-0.6B" --onnx_model_path="./output/onnx_npu/Qwen3-0.6B.onnx" --om_model_path="./output/model/Qwen3-0.6B20260105" --kv_cache_length=1024 --cpu_thread=1 --max_prefill_length=2 [INFO] soc_version is `auto`, will auto detect soc version [INFO] {'soc_full_name': 'Ascend310B4', 'soc_short_name': 'Ascend310B'} ============ run command ============== export MS_DEV_FORCE_ACL=1 && export MS_ENABLE_GE=1 && export TE_PARALLEL_COMPILER=1 && export MAX_COMPILE_CORE_NUMBER=1 && atc --framework=5 --model="./output/onnx/Qwen3-0.6B.onnx" --output="./output/model/Qwen3-0.6B20260105" --soc_version=Ascend310B4 --precision_mode_v2=mixed_float16 --modify_mixlist=/home/HwHiAiUser/ascend_llm/qwen-ascend-llm_qwen3/ops_info.json --input_format=ND --input_shape="input_ids:1,-1;attention_mask:1,-1;position_ids:1,-1;past_key_values:1,-1,448,128" --dynamic_dims "1,513,1,512;2,514,2,512;1,1025,1,1024;2,1026,2,1024" ======================================= ATC start working now, please wait for a moment. .................................................................................................. ATC run success, welcome to the next use.6.查看生成的om模型文件
三、香橙派AI pro 推理Qwen3-0.6B模型测试
3.1 onnx模型测试
1.切换到工作目录
2.激活python环境
3.运行推理脚本
4.直接爆了。onnx跑不了。
3.2 om模型测试
1.切换到工作目录
2.激活python环境
3.运行推理脚本
4.测试结果如下,勉强可以跑起来。
四、主要参考项目
1.Tlntin的qwen-ascend-llm
2.Qwen3
3.基于昇腾310芯片的大语言模型部署
4.昇腾