最近,我一直在尝试使用Stanford Core NLP训练n-gram实体.我已经按照以下教程 - http://nlp.stanford.edu/software/crf-faq.shtml#b
有了这个,我只能指定unigram令牌及其所属的类.任何人都可以指导我,以便我可以将它扩展到n-gram.我试图从聊天数据集中提取电影名称等已知实体.
如果我错误地解释了斯坦福教程,请指导我,同样可以用于n-gram培训.
我坚持的是以下属性
#structure of your training file; this tells the classifier
#that the word is in column 0 and the correct answer is in
#column 1
map = word=0,answer=1
Run Code Online (Sandbox Code Playgroud)
例如,第一列是单词(unigram),第二列是实体
CHAPTER O
I O
Emma PERS
Woodhouse PERS
Run Code Online (Sandbox Code Playgroud)
现在我需要训练像Hulk,Titanic等已知实体(比如电影名称)作为电影,这种方法很容易.但是如果我需要训练我知道你去年夏天做了什么或者宝宝出去做了什么,最好的办法是什么?
nlp named-entity-recognition stanford-nlp named-entity-extraction opennlp
我正在探索如何使用维基百科的分类信息从我的内容中提取标签/关键字.
我找到了关于DBPedia的文章.DBpedia是一项社区工作,旨在从维基百科中提取结构化信息,并在Web上提供此信息.
有没有人使用他们的网络服务?你知道它们的工作原理和可靠性吗?
现在我使用Jsoup从某些第三方网页中提取某些信息(不是所有文本),我会定期这样做.这工作正常,直到某些网页的HTML发生变化,这种变化导致现有Java代码发生变化,这是一项繁琐的工作,因为这些网页变化非常频繁.它还需要程序员来修复Java代码.以下是我对网页感兴趣的HTML代码示例:
<div>
<p><strong>Score:</strong>2.5/5</p>
<p><strong>Director:</strong> Bryan Singer</p>
</div>
<div>some other info which I dont need</div>
Run Code Online (Sandbox Code Playgroud)
现在这就是我想要做的,我想在本地保存这个网页(一个HTML文件)并从中创建一个模板,如:
<div>
<p><strong>Score:</strong>{MOVIE_RATING}</p>
<p><strong>Director:</strong>{MOVIE_DIRECTOR}</p>
</div>
<div>some other info which I dont need</div>
Run Code Online (Sandbox Code Playgroud)
除了网页的实际URL之外,这些HTML模板将是Java程序的输入,它将找出这些预定义关键字的位置(例如{MOVIE_RATING},{MOVIE_DIRECTOR})并从实际网页中提取值.
这样我每次网页更改时都不必修改Java程序,我只保存网页的HTML并用这些关键字替换数据,其余的将由程序处理.例如,将来实际的HTML代码可能如下所示:
<div>
<div><b>Rating:</b>**1/2</div>
<div><i>Director:</i>Singer, Bryan</div>
</div>
Run Code Online (Sandbox Code Playgroud)
相应的模板如下所示:
<div>
<div><b>Rating:</b>{MOVIE_RATING}</div>
<div><i>Director:</i>{MOVIE_DIRECTOR}</div>
</div>
Run Code Online (Sandbox Code Playgroud)
创建这些模板也可以由非程序员,任何可以编辑文件的人完成.
现在的问题是,我如何在Java中实现这一点,是否有任何现有的和更好的方法来解决这个问题?
注意: 谷歌搜索时我发现了一些研究论文,但大多数都需要一些先前的学习数据,准确性也是一个值得关注的问题.
从自由文本中提取位置的推荐方法有哪些?
我能想到的是使用像"单词......在位置"这样的正则表达式规则.但是有比这更好的方法吗?
此外,我可以考虑使用包含国家和城市名称的查找哈希表表,然后将文本中每个提取的标记与哈希表的标记进行比较.
有人知道更好的方法吗?
编辑:我正在尝试从推文文本中提取位置.因此,大量推文的问题也可能影响我对方法的选择.
nlp named-entity-recognition text-mining information-extraction named-entity-extraction
是否有任何付费或免费命名的实体识别Web服务.
基本上我正在寻找一些东西 - 如果我传递的文字如下:
"约翰在汉堡王吃炸薯条"
它应该是识别 - 沿线的东西:
人:约翰
组织:汉堡王
命名实体识别和命名实体解析之间有什么区别?会欣赏一个实际的例子.
我希望使用Stanford CoreNLP捕获测量结果.(如果你可以建议一个不同的提取器,那也没关系.)
例如,我想找到15千克,15公斤,15.0公斤,15公斤,15磅,15磅等,但其中CoreNLPs抽取规则,我没有看到一个用于测量.
当然,我可以使用纯正则表达式执行此操作,但工具包可以更快地运行,并且它们提供了更高级别的块的机会,例如将gb和GB一起处理,RAM和内存作为构建块 - 即使没有完整语法分析 - 因为它们构建了更大的单元,如128 gb RAM和8 GB内存.
我想要一个基于规则的提取器,而不是基于机器学习的提取器,但是不要将其作为RegexNer或其他地方的一部分.我该怎么做?
IBM命名实体提取可以做到这一点.正则表达式以有效的方式运行,而不是将文本传递给每个正则表达式.并且正则表达式被捆绑以表达有意义的实体,例如将所有测量单元组合成单个概念的实体.
nlp named-entity-recognition stanford-nlp named-entity-extraction
我正在为医学文本开发一个半自动注释工具,我完全迷失了寻找注释的RDF三元组.
我目前正在尝试使用基于NLP的方法.我已经研究过Stanford NER和OpenNLP,他们都没有提取疾病名称的模型.
我的问题是:*如何创建一个新的NER模型来提取疾病名称?我可以从OpenNLP或Standford NER获得任何帮助吗?*除了NLP之外还有另一种方法 - 从文本中提取RDF三元组吗?
任何帮助,将不胜感激!谢谢.
rdf annotations named-entity-recognition named-entity-extraction
我一直在努力寻找NLTK实体类型的完整列表.我只能在这个页面上找到最常见的,但不是完整列表.你能否分享一下NLTK的命名实体类型的完整列表?
我正在尝试使用文本数据进行多类分类。我面临的问题是我拥有非结构化的文本数据。我会用一个例子来解释这个问题。以这张图片为例:
我想提取和分类图像中给出的文本信息。问题是当我提取信息时,OCR 引擎会给出如下输出:
18
EURO 46
KEEP AWAY
FROM FIRE
MADE IN CHINA
2226249917581
7412501
DOROTHY
PERKINS
Run Code Online (Sandbox Code Playgroud)
现在这里的目标类是:
18 -> size
EURO 46 -> price
KEEP AWAY FROM FIRE -> usage_instructions
MADE IN CHINA -> manufacturing_location
2226249917581 -> product_id
7412501 -> style_id
DOROTHY PERKINS -> brand_name
Run Code Online (Sandbox Code Playgroud)
我面临的问题是输入文本不可分离,这意味着“多行可以属于同一个类”,并且可能存在“单行可以有多个类”的情况。
所以我不知道如何在将行传递给分类模型之前拆分/合并行。
有什么方法可以使用 NLP 我可以根据目标类拆分段落。换句话说,给定输入段落根据目标标签对其进行拆分。
nlp named-entity-recognition named-entity-extraction text-classification recurrent-neural-network
nlp ×5
stanford-nlp ×2
annotations ×1
dbpedia ×1
java ×1
nltk ×1
opennlp ×1
rdf ×1
text-mining ×1