我想说,你的第一步需要将问题简化为更易于管理的组件。其次,弄清楚你是否想要在一对一、词汇、句法、短语或组合的基础上进行释义。为了做出这个决定,我会用一句话并自己解释它,以便了解我在寻找什么。接下来我将开始为下载的数据编写解析器。然后,我将删除停用词并合并词性标记器,例如您的示例短语中 spaCy 或 nltk 中包含的词性标记器。
因为它们似乎为您提供了制作连续字典过滤器所需的所有信息,这就是我要开始的地方。我会编写一个过滤器,在数据集的 [LHS] 列中找到句子中每个单词的词性,并选择与该单词匹配的源,同时最小化/最大化 1 个特征的值(例如最小化 WordLenDiff),其中“businessnow”<-“businessnow”= -1.5 的情况。跟踪目标特征,你就会得到一个基本的释义句子。
使用此策略,您的输出可能会变成:
"the business uses 4 gb standard."
sent_score = 0
Run Code Online (Sandbox Code Playgroud)
进入:
"businessnow uses 4gb standard"
sent_score = -3
Run Code Online (Sandbox Code Playgroud)
有了基本示例后,您可以开始探索 scikit-learn 等中的特征选择算法,并合并单词对齐。但我会认真缩小问题的范围并逐渐扩大。最后,如何解决问题取决于指定的用途以及它需要的功能。
希望这可以帮助。
| 归档时间: |
|
| 查看次数: |
1615 次 |
| 最近记录: |