最近我接触了NLP,我尝试使用NLTK和TextBlob来分析文本.我想开发一个分析旅行者评论的应用程序,因此我必须管理很多用不同语言编写的文本.我需要做两个主要操作:POS标记和词形还原.我已经看到在NLTK中有可能为这样的句子标记化选择正确的语言:
tokenizer = nltk.data.load('tokenizers/punkt/PY3/italian.pickle')
Run Code Online (Sandbox Code Playgroud)
我还没有找到用不同语言设置POS Tagging和Lemmatizer语言的正确方法.如何为非英语文本(如意大利语,法语,西班牙语或德语)设置正确的语料库/词典?我也看到有可能导入"TreeBank"或"WordNet"模块,但我不明白我如何使用它们.否则,我在哪里可以找到各自的语料库?
你能给我一些建议或参考吗?请注意我不是NLTK的专家.
非常感谢.