标签: named-entity-extraction

实体提取库

我正在寻找一个进行文本分析和提取实体的库.

实体的类型/分类并不重要,它是对值得关键的东西的识别.在这种情况下,实体Universe是无限的,它不受固定字典的限制.

似乎有几个Web服务可以做到这一点(NERD让你比较这些Web服务的结果:http://nerd.eurecom.fr/documentation非常有用),但我正在寻找一个本地库而不是远程托管服务.我更喜欢Java或.NET,但如果它是一个好的库,我将学习它所写的任何语言.

类似主题上的旧线程很少,我希望在这个领域找到新的开发,和/或在低级NLP库之上构建的库:

有谁知道一个好的图书馆做得体的工作?

nlp named-entity-recognition named-entity-extraction semantics

5
推荐指数
1
解决办法
2084
查看次数

从文本中提取产品属性/特征

我被分配了一项任务,从产品描述中提取功能/属性。

Levi Strauss slim fit jeans
Big shopping bag in pink and gold
Run Code Online (Sandbox Code Playgroud)

我需要能够提取诸如“牛仔裤”和“修身”或“购物袋”和“粉色”和“金色”等属性。产品描述列表不仅仅适用于服装,基本上可以是任何东西。

我不知道如何解决这个问题。我尝试实现命名实体识别器解决方案和 POS 实现,NER 实现无法识别任何令牌,并且大多数令牌在 POS 解决方案中显示为 NNP(专有名词),这对我没有太大帮助。我需要一种方法来区分品牌名称和产品的功能(例如,如果它是 T 恤、颜色或设计(圆领、V 领)等)。

我确实实现了一个 KMean 解决方案,它将类似的产品聚集在一起,但话又说回来,这不是我正在寻找的结果。

只是寻找有人引导我走向正确的方向。

nlp named-entity-recognition feature-extraction named-entity-extraction

5
推荐指数
1
解决办法
1982
查看次数

扩展NLP实体提取

我们想从一个简单的搜索社区和各个城市的街道中进行识别。我们不仅使用英语,还使用其他西里尔语言。我们需要能够识别位置的拼写错误。在查看python库时,我发现了这个库:http : //polyglot.readthedocs.io/en/latest/NamedEntityRecognition.html

我们尝试使用它,但是找不到扩展实体识别数据库的方法。那怎么办?
如果不是,那么对于多语言nlp是否有其他建议,可以帮助进行拼写检查并提取与自定义数据库匹配的各种实体?

python nlp machine-learning polyglot named-entity-extraction

5
推荐指数
1
解决办法
569
查看次数

Spacy:生成通用句子,然后在其上训练模型。这是个好主意吗?

我正在从头开始训练模型,以便根据文本预测食物。我已经标记了大约500个句子来训练我的模型,准确性非常好。但是,我有点担心看不见的真实世界的数据,所以我想出了一个有趣的想法。所以我想知道一些有经验的人对这个有趣的想法的想法。

因此,想法是将500个句子转换为大约10000个句子。为此,我首先用标记替换了实际实体,然后填充了可能的实体。示例如下:

原始训练句子:

  1. “特易购去年售出了五万个比萨饼。” ---食物=比萨饼
  2. “他一个人时喜欢吃布丁。” ---食物=布丁通用句:
  3. “乐购去年卖了五万。”
  4. “他一个人时喜欢吃东西。”

食物清单:

  1. 比萨
  2. 布丁

新生成的训练语句:

  1. “特易购去年售出了五万个比萨饼。” ---食物=比萨饼
  2. “乐购去年卖了五万布丁。” ---食品=布丁
  3. “他一个人时喜欢吃披萨。” -食物=披萨
  4. “他一个人时喜欢吃布丁。” -食物=布丁

因此生成这样的训练语句是否很好?我认为的好处:

  1. 更多句子。
  2. 单个实体将有更多示例,而不是一两个。
  3. 可能是高精度。

问题可能是:

  • 训练数据充满相似的句型。

谢谢,请让我知道这种方法的想法。

entity nlp named-entity-extraction spacy

0
推荐指数
1
解决办法
48
查看次数