大模型的训练过程非常复杂，涉及到许多技术和挑战，其中大模型训练需要大量的显存资源是一个难题，对计算卡提出了不小的挑战。为了在单个计算卡显存资源不足时，可以通过多张计算卡进行计算，业界出现了类似Megatron、DeepSpeed等第三方大模型加速库，对模型、输入数据等进行切分并分配到不同的计算卡上，最后再通过集合通信对结果进行汇总。其中DeepSpeed已原生支持昇腾NPU，现已无需进行迁移。

LLM大模型简介