怎么将中文数据分词后替换为词向量然后保存为Tensor带入模型,
收藏回复举报
怎么将中文数据分词后替换为词向量然后保存为Tensor带入模型,
t('forum.solved') 已解决
新人帖
发表于2024-02-27 13:47:20
0 查看
目前我使用GeneratorDataset方法将数据读取为一个GeneratorDataset对象,然后使用text.JiebaTokenizer进行了分词,然后我应该怎么做将里面分好的词替换为词向量呢,我使用的是

tencent-ailab-embedding-zh-d100-v0.2.0-s.txt腾讯的中文词向量词典,因为我的中文数据长短不一,我希望就是说,以一个统一的长度进行保存,比如说我一条数据,只有一个词,好,另外一条数据有125词,那么就以125为统一的长度,对于只有一个词的数据进行填充为125词的长度,我应该怎么做这个事情,然后就是一个词对应一个100长度的词向量,所以,我的数据集一个是一个,(数据量,词长度,词向量长度)这样子的一个Tensor带入模型,但是我,不知道怎么替换GeneratorDataset对象里面词为对应的词向量

我要发帖子