相关疑难解决方法(0)

使用 word2vec 嵌入句子

我想比较不同句子中提到的相同单词的差异,例如“旅行”。我想做的是:

  • 将提及“旅行”一词的句子视为纯文本;
  • 在每个句子中,将“旅行”替换为travel_sent_x。
  • 在这些句子上训练 word2vec 模型。
  • 计算travel_sent1、travel_sent2和其他重新标记的“旅行”之间的距离,因此每个句子的“旅行”都有自己的向量,用于比较。

我知道 word2vec 需要的不仅仅是几个句子来训练可靠的向量。官方页面推荐的数据集包含数十亿个单词,但我的数据集中没有这样的数字(我有数千个单词)。

我试图用以下几句话来测试模型:

    Sentences
    Hawaii makes a move to boost domestic travel and support local tourism
    Honolulu makes a move to boost travel and support local tourism
    Hawaii wants tourists to return so much it's offering to pay for half of their travel expenses
Run Code Online (Sandbox Code Playgroud)

我构建向量的方法是:

from gensim.models import Word2Vec

vocab = df['Sentences']))
model = Word2Vec(sentences=vocab, size=100, window=10, min_count=3, workers=4, sg=0)
df['Sentences'].apply(model.vectorize)
Run Code Online (Sandbox Code Playgroud)

然而,我不知道如何可视化结果以查看它们的相似性并获得一些有用的见解。欢迎任何帮助和建议。

更新:我将使用主成分分析算法来可视化 3 维空间中的嵌入。我知道如何处理每个单词,但我不知道如何处理句子。

python embedding gensim word2vec

3
推荐指数
1
解决办法
5993
查看次数

标签 统计

embedding ×1

gensim ×1

python ×1

word2vec ×1