如何在Lucene 3.6.2中使用Porter Stemmber类?这是我有的:
import org.apache.lucene.analysis.PorterStemmer;
...
PorterStemmer stemmer = new PorterStemmer();
term = stemmer.stem(term);
Run Code Online (Sandbox Code Playgroud)
我被告知:在org.apache.lucene.analysis中,PorterStemmer不公开; 无法从外部包裹访问.
编辑:我也广泛阅读有关使用Snowball的内容,但不鼓励这样做.什么是在Java中使用Lucene的正确方法?
我正在构建一个文档分类器来对文档进行分类.
因此,第一步是将每个文档表示为用于训练目的的"特征向量".
经过一些研究,我发现我可以使用Bag of Words方法或N-gram方法将文档表示为向量.
使用OCR检索每个文档中的文本(扫描的pdf和图像),因此某些单词包含错误.我以前没有关于这些文件中使用的语言的知识(不能使用词干).
据我所知,我必须使用n-gram方法.还是有其他方法来表示文件?
如果有人可以将我链接到N-Gram指南以便更清晰地了解并了解其工作方式,我也将不胜感激.
提前致谢
algorithm machine-learning feature-extraction document-classification