在Orange Pi AI Pro开发板上跑盘古大语言模型的INT8量化
收藏回复举报
在Orange Pi AI Pro开发板上跑盘古大语言模型的INT8量化
t('forum.solved') 已解决
新人帖
发表于2025-12-22 19:58:19
0 查看
cke_635.pngcke_53824.png
您好!我是一名在读研究生,目前在Orange Pi AI Pro版子上能通过在线推理(通过调用华为提供的run_fa_edge.py文件运行模型)的方式运行openPanguEmbedded V1.1模型,模型文件如图所示。目前的需求是将模型由FP16量化为INT8后在板子上运行,从而减少内存提高推理速度。目前查询资料后比较推荐的一种方式是将模型文件导出为.onnx格式,并对其进行INT8定点得到int8格式的.onnx文件,接着使用ATC编译将其转为.om文件,接着运行量化后的.om文件就能达到在板子上跑量化模型的目的,但是这条路得到的模型输出总是乱码(只会输出the,what,等高频词汇)。
现在我不知道这条路走不走得通?并且跑量化是不是只能通过onnx,om这条路走?通过在线推理的方式能不能进行量化(能不能真的调的动底层的INT8计算)?
开发板参数如图

我要发帖子