我使用word2vec从大型文档生成了一个标记列表的向量.给定一个句子,是否可以从句子中的标记向量中获取句子的向量.
上下文是:我已经有了一些单词(实际上是短语),这些单词是由应用于互联网搜索查询的kmeans产生的,并且在搜索引擎的结果中使用常见的URL作为距离(如果我简化很多,则会同时显示网址而不是单词) ).
我想使用语义自动标记聚类,换句话说,我想提取围绕一起考虑的一组短语的主要概念.
例如 - 抱歉我的例子 - 如果我有以下一堆问题:['我丈夫袭击了我','他被警察逮捕','审判仍在继续','我的丈夫可以因为骚扰我而入狱?','自由律师']我的研究涉及家庭暴力,但显然这个集群专注于问题的法律方面,所以标签可能是"合法的".
我是NPL的新手,但我必须确切地说我不想使用POS标记提取单词(或者至少这不是预期的最终结果,但可能是必要的初步步骤).
我读到Wordnet的感觉消除歧义,我认为这可能是一个很好的轨道,但我不想计算两个查询之间的相似性(因为集群是输入),也不需要获得一个选定单词的定义,这要归功于提供的上下文通过一大堆词(在这种情况下选择哪个词?).我想使用整个单词来提供上下文(可能使用synset或使用wordnet的xml结构进行分类),然后用一个或几个单词汇总上下文.
有任何想法吗 ?我可以使用R或python,我读了一些关于nltk但我找不到在我的上下文中使用它的方法.