如何使用gensim load_word2vec_format加载预训练的手套模型?

Ars*_*lan 3 stanford-nlp gensim word2vec word-embedding

我正在尝试将预先训练的手套作为 word2vec 模型加载到 gensim 中。我已经从这里下载了手套文件。我正在使用以下脚本:

from gensim import models
model = models.KeyedVectors.load_word2vec_format('glove.6B.300d.txt', binary=True)
Run Code Online (Sandbox Code Playgroud)

但出现以下错误

ValueError                                Traceback (most recent call last)
<ipython-input-38-e0b48b51f433> in <module>()
      1 from gensim import models
----> 2 model = models.KeyedVectors.load_word2vec_format('glove.6B.300d.txt', binary=True)

2 frames
/usr/local/lib/python3.6/dist-packages/gensim/models/utils_any2vec.py in <genexpr>(.0)
    171     with utils.smart_open(fname) as fin:
    172         header = utils.to_unicode(fin.readline(), encoding=encoding)
--> 173         vocab_size, vector_size = (int(x) for x in header.split())  # throws for invalid file format
    174         if limit:
    175             vocab_size = min(vocab_size, limit)

ValueError: invalid literal for int() with base 10: 'the'
Run Code Online (Sandbox Code Playgroud)

根本问题是什么?gensim 是否需要特定的格式才能加载它?

goj*_*omo 6

GLoVe 格式与 \xe2\x80\x93 略有不同,缺少向量计数和维度 \xe2\x80\x93 的第一行声明。load_word2vec_format()

\n

其中包含一个glove2word2vec实用程序脚本,您可以运行一次来​​转换文件:

\n

https://radimrehurek.com/gensim/scripts/glove2word2vec.html

\n

此外,从 Gensim 4.0.0(目前处于预发布测试中)开始,该load_word2vec_format()方法获得了一个新的可选no_header参数:

\n

https://radimrehurek.com/gensim/models/keyedvectors.html?highlight=load_word2vec_format#gensim.models.keyedvectors.KeyedVectors.load_word2vec_format

\n

如果设置为no_header=True,该方法将从文件的初步扫描中推断出计数/尺寸 - 因此它可以使用该选项 \xe2\x80\x93 读取 GLoVe 文件,但代价是两次完整文件读取而不是一次。(因此,您可能仍然想使用 重新保存对象.save_word2vec_format(),或者使用glove2word2vec脚本,以使将来的加载速度更快。)

\n