使用PPDB生成英文文本的释义

Jaf*_*son 5 python python-2.7 ppdb

我需要使用PPDB释义数据库生成英语句子的释义

我从网站上下载了数据集.

Dan*_*kin 2

我想说,你的第一步需要将问题简化为更易于管理的组件。其次,弄清楚你是否想要在一对一、词汇、句法、短语或组合的基础上进行释义。为了做出这个决定,我会用一句话并自己解释它,以便了解我在寻找什么。接下来我将开始为下载的数据编写解析器。然后,我将删除停用词并合并词性标记器,例如您的示例短语中 spaCy 或 nltk 中包含的词性标记器。

因为它们似乎为您提供了制作连续字典过滤器所需的所有信息,这就是我要开始的地方。我会编写一个过滤器,在数据集的 [LHS] 列中找到句子中每个单词的词性,并选择与该单词匹配的源,同时最小化/最大化 1 个特征的值(例如最小化 WordLenDiff),其中“businessnow”<-“businessnow”= -1.5 的情况。跟踪目标特征,你就会得到一个基本的释义句子。

使用此策略,您的输出可能会变成:

"the business uses 4 gb standard."
sent_score = 0
Run Code Online (Sandbox Code Playgroud)

进入:

"businessnow uses 4gb standard"
sent_score = -3
Run Code Online (Sandbox Code Playgroud)

有了基本示例后,您可以开始探索 scikit-learn 等中的特征选择算法,并合并单词对齐。但我会认真缩小问题的范围并逐渐扩大。最后,如何解决问题取决于指定的用途以及它需要的功能。

希望这可以帮助。