目前我使用GeneratorDataset方法将数据读取为一个GeneratorDataset对象,然后使用text.JiebaTokenizer进行了分词,然后我应该怎么做将里面分好的词替换为词向量呢,我使用的是
tencent-ailab-embedding-zh-d100-v0.2.0-s.txt腾讯的中文词向量词典,因为我的中文数据长短不一,我希望就是说,以一个统一的长度进行保存,比如说我一条数据,只有一个词,好,另外一条数据有125词,那么就以125为统一的长度,对于只有一个词的数据进行填充为125词的长度,我应该怎么做这个事情,然后就是一个词对应一个100长度的词向量,所以,我的数据集一个是一个,(数据量,词长度,词向量长度)这样子的一个Tensor带入模型,但是我,不知道怎么替换GeneratorDataset对象里面词为对应的词向量
tencent-ailab-embedding-zh-d100-v0.2.0-s.txt腾讯的中文词向量词典,因为我的中文数据长短不一,我希望就是说,以一个统一的长度进行保存,比如说我一条数据,只有一个词,好,另外一条数据有125词,那么就以125为统一的长度,对于只有一个词的数据进行填充为125词的长度,我应该怎么做这个事情,然后就是一个词对应一个100长度的词向量,所以,我的数据集一个是一个,(数据量,词长度,词向量长度)这样子的一个Tensor带入模型,但是我,不知道怎么替换GeneratorDataset对象里面词为对应的词向量