Ole*_*kyi 5 python multilingual nlp similarity word-embedding
所以,我有一个任务需要测量两个文本之间的相似度。这些文本是杂货店产品的简短描述。它们始终包含产品名称(例如牛奶),并且可能包含生产商和/或尺寸,以及产品的一些其他特征。
我有一整套这样的文本,然后,当新的文本到达时,我需要确定我的数据库中是否有类似的产品,并测量它们的相似程度(从 0 到 100% 的范围)。
问题是:文本可能采用两种不同的语言:乌克兰语和俄语。另外,如果有外国品牌(例如,Coca Cola),它会用英文书写。
我解决这个任务的最初想法是获得多语言单词嵌入(不同语言中的相似单词位于附近)并找到这些文本之间的距离。但是,我不确定这会有多有效,如果可以的话,该从什么开始。
因为我拥有的每个文本只是一组产品特征,所以一些基于上下文的词嵌入可能不起作用(我不确定这个陈述,这只是我的假设)。
到目前为止,我已经尝试熟悉MUSE框架,但在安装时遇到了问题faiss。
因此,我的问题是:
注意:我有 Windows 10(以防某些库无法在 Windows 上运行),并且我需要该库才能使用乌克兰语和俄语。
预先感谢您的任何帮助!任何建议将不胜感激!
假设您的任务是关于细粒度实体识别。我认为您有一个明确定义的实体:品牌、尺寸等...\n因此,定义产品的这些特征每个都可以是一个向量,这意味着您的产品可以用矩阵表示。\n您可以用以下方式表示每个特征嵌入。\n或者嵌入向量和 one-hot 向量的混合。
\n方法如下。
\nCoca Cola到\n ru \xd0\x9a\xd0\xbe\xd0\xba\xd0\xb0-\xd0\x9a\xd0\xbe\xd0\xbb\xd0\xb0, en Coca Cola。这里没有明确的答案,您需要进行实验和测试,看看什么是最好的解决方案。您可以创建测试集并为您的解决方案制定基准。
\n| 归档时间: |
|
| 查看次数: |
1543 次 |
| 最近记录: |