str我有一个要映射的列表。这些词可以是“金属”或“圣帕特里克”。目标是根据此列表映射一个新字符串并找到前 N 个相似项。例如,如果我经过“St. Patrick”,我想捕获“st patrick”或“saint patrick”。
str
我知道有 gensim 和 fastText,而且我有一种直觉,我应该追求余弦相似度(或者如果有其他建议,我会洗耳恭听)。我主要处理时间序列,gensim 模型训练似乎不喜欢单词列表。
接下来我应该瞄准什么?
python nlp fasttext
fasttext ×1
nlp ×1
python ×1