标签: named-entity-extraction

使用Stanford NLP训练n-gram NER

最近,我一直在尝试使用Stanford Core NLP训练n-gram实体.我已经按照以下教程 - http://nlp.stanford.edu/software/crf-faq.shtml#b

有了这个,我只能指定unigram令牌及其所属的类.任何人都可以指导我,以便我可以将它扩展到n-gram.我试图从聊天数据集中提取电影名称等已知实体.

如果我错误地解释了斯坦福教程,请指导我,同样可以用于n-gram培训.

我坚持的是以下属性

#structure of your training file; this tells the classifier
#that the word is in column 0 and the correct answer is in
#column 1
map = word=0,answer=1
Run Code Online (Sandbox Code Playgroud)

例如,第一列是单词(unigram),第二列是实体

CHAPTER O
I   O
Emma    PERS
Woodhouse   PERS
Run Code Online (Sandbox Code Playgroud)

现在我需要训练像Hulk,Titanic等已知实体(比如电影名称)作为电影,这种方法很容易.但是如果我需要训练我知道你去年夏天做什么或者宝宝出去什么,最好的办法是什么?

nlp named-entity-recognition stanford-nlp named-entity-extraction opennlp

21
推荐指数
2
解决办法
1万
查看次数

如何使用DBPedia从内容中提取标签/关键字?

我正在探索如何使用维基百科的分类信息从我的内容中提取标签/关键字.

我找到了关于DBPedia的文章.DBpedia是一项社区工作,旨在从维基百科中提取结构化信息,并在Web上提供此信息.

有没有人使用他们的网络服务?你知道它们的工作原理和可靠性吗?

named-entity-extraction dbpedia

20
推荐指数
1
解决办法
9669
查看次数

在Java中基于模板提取网页信息

现在我使用Jsoup从某些第三方网页中提取某些信息(不是所有文本),我会定期这样做.这工作正常,直到某些网页的HTML发生变化,这种变化导致现有Java代码发生变化,这是一项繁琐的工作,因为这些网页变化非常频繁.它还需要程序员来修复Java代码.以下是我对网页感兴趣的HTML代码示例:

<div>
<p><strong>Score:</strong>2.5/5</p>
<p><strong>Director:</strong> Bryan Singer</p>
</div>
<div>some other info which I dont need</div>
Run Code Online (Sandbox Code Playgroud)

现在这就是我想要做的,我想在本地保存这个网页(一个HTML文件)并从中创建一个模板,如:

<div>
<p><strong>Score:</strong>{MOVIE_RATING}</p>
<p><strong>Director:</strong>{MOVIE_DIRECTOR}</p>
</div>
<div>some other info which I dont need</div>
Run Code Online (Sandbox Code Playgroud)

除了网页的实际URL之外,这些HTML模板将是Java程序的输入,它将找出这些预定义关键字的位置(例如{MOVIE_RATING},{MOVIE_DIRECTOR})并从实际网页中提取值.

这样我每次网页更改时都不必修改Java程序,我只保存网页的HTML并用这些关键字替换数据,其余的将由程序处理.例如,将来实际的HTML代码可能如下所示:

<div>
<div><b>Rating:</b>**1/2</div>
<div><i>Director:</i>Singer, Bryan</div>
</div>
Run Code Online (Sandbox Code Playgroud)

相应的模板如下所示:

<div>
<div><b>Rating:</b>{MOVIE_RATING}</div>
<div><i>Director:</i>{MOVIE_DIRECTOR}</div>
</div>
Run Code Online (Sandbox Code Playgroud)

创建这些模板也可以由非程序员,任何可以编辑文件的人完成.

现在的问题是,我如何在Java中实现这一点,是否有任何现有的和更好的方法来解决这个问题?

注意: 谷歌搜索时我发现了一些研究论文,但大多数都需要一些先前的学习数据,准确性也是一个值得关注的问题.

java text-extraction named-entity-extraction

13
推荐指数
1
解决办法
1438
查看次数

从文本中提取位置的方法?

从自由文本中提取位置的推荐方法有哪些?

我能想到的是使用像"单词......在位置"这样的正则表达式规则.但是有比这更好的方法吗?

此外,我可以考虑使用包含国家和城市名称的查找哈希表表,然后将文本中每个提取的标记与哈希表的标记进行比较.

有人知道更好的方法吗?

编辑:我正在尝试从推文文本中提取位置.因此,大量推文的问题也可能影响我对方法的选择.

nlp named-entity-recognition text-mining information-extraction named-entity-extraction

10
推荐指数
1
解决办法
4521
查看次数

实体提取Web服务

是否有任何付费或免费命名的实体识别Web服务.

基本上我正在寻找一些东西 - 如果我传递的文字如下:

"约翰在汉堡王吃炸薯条"

它应该是识别 - 沿线的东西:

人:约翰

组织:汉堡王

从GATE听说过Annie,但我认为它没有网络服务.

named-entity-recognition named-entity-extraction

8
推荐指数
1
解决办法
2348
查看次数

命名实体识别与解析之间的区别?

命名实体识别和命名实体解析之间有什么区别?会欣赏一个实际的例子.

nlp named-entity-recognition named-entity-extraction

8
推荐指数
1
解决办法
2376
查看次数

Stanford CoreNLP命名实体识别如何捕获5英寸,5英寸,5英寸,5英寸等测量值

我希望使用Stanford CoreNLP捕获测量结果.(如果你可以建议一个不同的提取器,那也没关系.)

例如,我想找到15千克,15公斤,15.0公斤,15公斤,15磅,15磅等,但其中CoreNLPs抽取规则,我没有看到一个用于测量.

当然,我可以使用纯正则表达式执行此操作,但工具包可以更快地运行,并且它们提供了更高级别的块的机会,例如将gbGB一起处理,RAM内存作为构建块 - 即使没有完整语法分析 - 因为它们构建了更大的单元,如128 gb RAM8 GB内存.

我想要一个基于规则的提取器,而不是基于机器学习的提取器,但是不要将其作为RegexNer或其他地方的一部分.我该怎么做?

IBM命名实体提取可以做到这一点.正则表达式以有效的方式运行,而不是将文本传递给每个正则表达式.并且正则表达式被捆绑以表达有意义的实体,例如将所有测量单元组合成单个概念的实体.

nlp named-entity-recognition stanford-nlp named-entity-extraction

7
推荐指数
1
解决办法
1142
查看次数

半自动注释工具 - 如何查找RDF三元组

我正在为医学文本开发一个半自动注释工具,我完全迷失了寻找注释的RDF三元组.

我目前正在尝试使用基于NLP的方法.我已经研究过Stanford NER和OpenNLP,他们都没有提取疾病名称的模型.

我的问题是:*如何创建一个新的NER模型来提取疾病名称?我可以从OpenNLP或Standford NER获得任何帮助吗?*除了NLP之外还有另一种方法 - 从文本中提取RDF三元组吗?

任何帮助,将不胜感激!谢谢.

rdf annotations named-entity-recognition named-entity-extraction

6
推荐指数
1
解决办法
1341
查看次数

NLTK的实体类型是什么?

我一直在努力寻找NLTK实体类型的完整列表.我只能在这个页面上找到最常见的,但不是完整列表.你能否分享一下NLTK的命名实体类型的完整列表?

nltk named-entity-extraction

6
推荐指数
1
解决办法
1549
查看次数

如何识别作为光学字符识别 (OCR) 输出的文本中的实体?

我正在尝试使用文本数据进行多类分类。我面临的问题是我拥有非结构化的文本数据。我会用一个例子来解释这个问题。以这张图片为例:

示例数据

我想提取和分类图像中给出的文本信息。问题是当我提取信息时,OCR 引擎会给出如下输出:

18
EURO 46
KEEP AWAY
FROM FIRE
MADE IN CHINA
2226249917581
7412501
DOROTHY
PERKINS
Run Code Online (Sandbox Code Playgroud)

现在这里的目标类是:

18 -> size
EURO 46 -> price
KEEP AWAY FROM FIRE -> usage_instructions
MADE IN CHINA -> manufacturing_location
2226249917581 -> product_id
7412501 -> style_id
DOROTHY PERKINS -> brand_name
Run Code Online (Sandbox Code Playgroud)

我面临的问题是输入文本不可分离,这​​意味着“多行可以属于同一个类”,并且可能存在“单行可以有多个类”的情况。

所以我不知道如何在将行传递给分类模型之前拆分/合并行。
有什么方法可以使用 NLP 我可以根据目标类拆分段落。换句话说,给定输入段落根据目标标签对其进行拆分。

nlp named-entity-recognition named-entity-extraction text-classification recurrent-neural-network

6
推荐指数
1
解决办法
849
查看次数