为什么 wordnet 中的 NLTK wn.all_synsets() 函数不返回同义词集列表?

李恒通*_*李恒通 3 python nlp generator nltk wordnet

我为这个问题编写代码:

没有下义词的名词同义词集的百分比是多少?您可以使用 wn.all_synsets('n') 获取所有名词同义词集。

这是我的代码:

import nltk
from nltk.corpus import wordnet as wn

all_noun = wn.all_synsets('n')
print(all_noun)
print(wn.all_synsets('n'))
all_num = len(set(all_noun))
noun_have_hypon = [word for word in wn.all_synsets('n') if len(word.hyponyms()) >= 1]
noun_have_num = len(noun_have_hypon)
print('There are %d nouns, and %d nouns without hyponyms, the percentage is %f' %
  (all_num, noun_have_num, (all_num-noun_have_num)/all_num*100))
Run Code Online (Sandbox Code Playgroud)

当我运行这段代码时,输​​出是

<generator object all_synsets at 0x10927b1b0>

<generator object all_synsets at 0x10e6f0bd0>

有名词 82115 个,无下位词名词 16693 个,百分比为 79.671193

但如果改变

noun_have_hypon = [word for word in wn.all_synsets('n') if len(word.hyponyms()) >= 1]

noun_have_hypon = [word for word in all_noun if len(word.hyponyms()) >= 1]

输出更改为

<generator object all_synsets at 0x10917b1b0>

<generator object all_synsets at 0x10e46aab0>

有名词 82115 个,无下位词名词 0 个,百分比 100.000000

为什么两个答案不相等all_noun = wn.all_synsets('n'),0x10927b1b0 和 0x10e6f0bd0 的含义是什么?

alv*_*vas 6

它与 NLTK 关系不大,但更多的是生成器表达式与列表理解之间的差异。

让我们来看一个小例子:

首先,让我们创建一个返回简单列表的函数:

>>> def some_func_that_returns_a_list():
...     list_to_be_returned = []
...     for i in range(10):
...             list_to_be_returned.append(i)
...     return list_to_be_returned
... 
>>> some_func_that_returns_a_list()
[0, 1, 2, 3, 4, 5, 6, 7, 8, 9]
Run Code Online (Sandbox Code Playgroud)

请注意,在some_func_that_returns_a_list()函数中,需要创建一个列表并在函数返回到调用它的代码中的位置之前将值放入其中。

类似地,我们可以使用生成器来实现需要返回的相同列表,但它有点不同,因为它使用了yield关键字:

>>> def some_func_that_returns_a_generator():
...     for i in range(10):
...             yield i
... 
>>> 
Run Code Online (Sandbox Code Playgroud)

请注意,该函数中没有要返回的列表的实例化。

当您尝试调用该函数时:

>>>some_func_that_returns_a_generator()
<generator object some_func_that_returns_a_generator at 0x7f312719a780>
Run Code Online (Sandbox Code Playgroud)

您会收到生成器的字符串表示形式,即只是描述该函数的内容。此时,还没有实例化任何值,并且生成器的指针应该小于实例化列表的函数:

>>> import sys
>>> sys.getsizeof(some_func_that_returns_a_generator())
80
>>> sys.getsizeof(some_func_that_returns_a_list())
200
Run Code Online (Sandbox Code Playgroud)

由于生成器不会实例化您需要的结果列表的值,它只是一次弹出一个项目yield,您需要“手动”循环生成器来获取列表,例如:

>>> list(some_func_that_returns_a_generator())
[0, 1, 2, 3, 4, 5, 6, 7, 8, 9]
>>> [i for i in some_func_that_returns_a_generator()]
[0, 1, 2, 3, 4, 5, 6, 7, 8, 9]
Run Code Online (Sandbox Code Playgroud)

但在这种情况下,它是“即时”创建列表,如果您不打算停止列表而是一次读取一个元素,那么生成器将是有利的(内存方面)。

也可以看看:


因此,对于 NLTK wn.all_synsets()WordNet API,您可以简单地执行以下操作:

>>> from nltk.corpus import wordnet as wn
>>> nouns_in_wordnet = list(wn.all_synsets('n'))
Run Code Online (Sandbox Code Playgroud)

但请注意,它会将作为名词的同义词集的整个列表保存在内存中。

如果您想过滤具有超过 1 个上位词的名词,您可以使用以下函数来避免实例化完整的名词列表filter()

>>> filter(lambda ss: len(ss.hypernyms()) > 0, wn.all_synsets('n'))
Run Code Online (Sandbox Code Playgroud)

最后,要“即时”计数而不将同义词集存储在内存中,您可以执行以下操作:

>>> len(filter(lambda ss: len(ss.hypernyms()) > 0, wn.all_synsets('n')))
74389
Run Code Online (Sandbox Code Playgroud)

或者更简单地说:

>>> sum(1 for ss in wn.all_synsets('n') if len(ss.hypernyms()) > 0)
74389
Run Code Online (Sandbox Code Playgroud)

但最有可能的是,您希望访问同义词集,因此您可能正在寻找:

>>> nouns_with_hyper = filter(lambda ss: len(ss.hypernyms()) > 0, wn.all_synsets('n'))
>>> len(nouns_with_hyper)
74389
Run Code Online (Sandbox Code Playgroud)