我想比较不同句子中提到的相同单词的差异,例如“旅行”。我想做的是:
我知道 word2vec 需要的不仅仅是几个句子来训练可靠的向量。官方页面推荐的数据集包含数十亿个单词,但我的数据集中没有这样的数字(我有数千个单词)。
我试图用以下几句话来测试模型:
Sentences
Hawaii makes a move to boost domestic travel and support local tourism
Honolulu makes a move to boost travel and support local tourism
Hawaii wants tourists to return so much it's offering to pay for half of their travel expenses
Run Code Online (Sandbox Code Playgroud)
我构建向量的方法是:
from gensim.models import Word2Vec
vocab = df['Sentences']))
model = Word2Vec(sentences=vocab, size=100, window=10, min_count=3, workers=4, sg=0)
df['Sentences'].apply(model.vectorize)
Run Code Online (Sandbox Code Playgroud)
然而,我不知道如何可视化结果以查看它们的相似性并获得一些有用的见解。欢迎任何帮助和建议。
更新:我将使用主成分分析算法来可视化 3 维空间中的嵌入。我知道如何处理每个单词,但我不知道如何处理句子。