小编use*_*722的帖子

使用Gensim计算2个文档之间的TF-IDF相似度

我正在使用Gensim来计算两个文档之间的相似性.由于某种原因,行tfidf [corpus]返回一个空列表.我不知道为什么会这样

    articles = []
#make a corpus by adding each of the top 25 documents to a list
for x in range(0,25):
    articles.append(str(WikiDoc(sorted_links[0]).jsonify()['text']))
#puts all of the top 25 documents into a list
texts = [[word for word in document.lower().split()] for document in articles]
print texts
#load precomputed dictionary
articles_dict = corpora.Dictionary(texts)
articles_dict.save('./articles.dict')
articles_dict = Dictionary.load('./articles.dict')
#articles_corpus = [articles_dict.doc2bow(text) for text in texts]
#corpora.MmCorpus.serialize('./articles.mm', articles_corpus)
corpus = [articles_dict.doc2bow(text) for text in texts]
corpora.MmCorpus.serialize('./articles.mm', corpus)
corpus = corpora.MmCorpus('./articles.mm')
#build the …
Run Code Online (Sandbox Code Playgroud)

python nlp similarity gensim

5
推荐指数
0
解决办法
1497
查看次数

标签 统计

gensim ×1

nlp ×1

python ×1

similarity ×1