我正在尝试使用 gensim 库在 5000 万个可变长度的句子上训练 doc2vec 模型。
一些教程(例如https://github.com/RaRe-Technologies/gensim/blob/develop/docs/notebooks/doc2vec-lee.ipynbmodel.build_vocab )在实际训练过程之前有一个步骤。该部分已经运行了 3 个小时,没有任何更新。
这一步对于训练过程是必要的吗?既然这只是数据的线性传递,为什么这一步会花费这么长时间?
将 gensim 版本 3.4.0 与 python 3.6.0 结合使用