使用atb_llm下的modeltest分别在npu和A800下测试了Qwen1.5-72B-Chat的推理在CEval下的精度,看测试代码生成参数一样且do_sample=False下,和nvidia下的推理相比精度有0.6%的差距,这块不太理解,个人理解CANN底层算子是不是就已经和CUDA对齐了?如果底层算子都适配了,计算出来的精度应该和nvidia下是相同的吧?
- 精度差异来源于哪里?bug?
- 除了MindIE,Ascend Pytorch + transformers / MindFormers下推理是否也会有精度差异?
使用atb_llm下的modeltest分别在npu和A800下测试了Qwen1.5-72B-Chat的推理在CEval下的精度,看测试代码生成参数一样且do_sample=False下,和nvidia下的推理相比精度有0.6%的差距,这块不太理解,个人理解CANN底层算子是不是就已经和CUDA对齐了?如果底层算子都适配了,计算出来的精度应该和nvidia下是相同的吧?