基于开源规则的模式匹配/信息提取框架?

Joh*_*ann 6 text open-source nlp named information-extraction

我正在购买一个开源框架,用于编写自然语言语法规则,以便在注释上进行模式匹配.您可以将其视为正则表达式,但匹配令牌而非字符级别.这样的框架应该使匹配标准能够引用附加到输入令牌或跨度的其他属性,以及在操作中修改这些属性.

我知道有三个选项符合此描述:

目前还有其他类似的选择吗?

相关工具

  • 虽然我知道像Antlr这样的通用解析器生成器也可以用于此目的,但我正在寻找更适合自然语言处理或信息提取的东西.
  • UIMA包含一个Regex Annotator插件,用于在XML中声明规则,但似乎是在角色而不是高级对象上操作.
  • 我知道这种任务通常用统计模型来执行,但对于狭窄的结构化域,手工制作规则是有益的.

*使用GExp'规则'实际上是在代码中实现的,但由于我选择包含它的选项很少.

小智 0

您还可以检查 HTQL。它支持标记的正则表达式搜索。从美国地址搜索州和邮政编码的示例是:

a=htql.RegEx(); 
a.setNameSet('states', states);
a.reSearchList(address.split(), r"&[ws:states]<,>?<\d{5}>", case=False) 
Run Code Online (Sandbox Code Playgroud)