关于用transformers+accelerate+deepspeed编写训练代码时显存一直增加的问题
收藏回复举报
关于用transformers+accelerate+deepspeed编写训练代码时显存一直增加的问题
t('forum.solved') 已解决
发表于2024-10-16 11:08:50
0 查看

现在面临的问题主要是:编写的训练代码和transformers的trainer很接近,但是我运行的时候显存是非常缓慢的逐渐增加,然后爆了OOM。
1. 首先是是否需要手动回收些tensor(loss/grad_norm)变量的问题,感觉昇腾的这个显存回收好像不是很好(是适配问题吗)。

2. 不知道是那部分代码逐渐增加了显存占用或者没有释放显存(起码GPU上好像没有这个问题)。

2. 能不能提供一个transformers+accelerate的base版本的代码,只需要能logging loss的基础训练代码?
训练代码:https://github.com/HackGiter/General-Execute-Architecture/blob/v0.3.1/gea/train/train.py

我要发帖子