Yog*_*dav 5 machine-learning similarity tf-idf svd predictionio
我有大约 2-3 百万种产品。每个产品都遵循这个结构
{
"sku": "Unique ID of Product ( String of 20 chars )"
"title":"Title of product eg Oneplus 5 - 6GB + 64GB ",
"brand":"Brand of product eg OnePlus",
"cat1":"First Category of Product Phone",
"cat2":"Second Category of Product Mobile Phones",
"cat3":"Third Category of Product Smart Phones",
"price":500.00,
"shortDescription":"Short description about the product ( Around 8 - 10 Lines )",
"longDescription":"Long description about the product ( Aroung 50 - 60 Lines )"
}
Run Code Online (Sandbox Code Playgroud)
问题陈述是
仅根据内容或产品数据查找类似产品。所以当电子商务用户点击一个产品(SKU)时,我会在推荐中展示与该SKU或产品相似的产品。
比如用户点击apple iphone 6s silver,我会在“类似产品推荐”中展示这些产品
1) 苹果 iphone 6s 金色或其他颜色
2) 苹果 iphone 6s plus 选项
3) 其他配置的苹果 iphone 6s 选项
4)其他苹果iphone
5)该价格范围内的其他智能手机
到目前为止我尝试过的
A) 我曾尝试使用“用户查看事件”来推荐类似产品,但我们没有那么好的数据。它产生良好的结果,但仅适用于少数产品。所以这个模板不适合我的用例。
乙) One hot encoder+ Singular Value Decomposition ( SVD )+Cosine Similarity
我已经训练我的模型周边25万的产品具有尺寸= 500本的修改预测IO模板。它给出了很好的结果。我没有在培训中包含产品的详细描述。
但我在这里有一些问题
1)在我的用例中是否使用One Hot Encoder并且SVD是正确的方法?
2)有什么方法或技巧可以在训练中给予额外的权重title和brand属性。
3)你认为它是可扩展的。我正在尝试将产品大小增加到 100 万个,维度 = 800-1000,但它谈论了很多时间,系统挂起/停止或内存不足。(我正在使用 apache 预测 io )
4) 当我要训练 200 万个产品时,我的维度值应该是多少。
5) 我需要多少内存才能部署SVD经过训练的模型来查找cosine similarity200 万个产品的内存。
我应该在我的用例中使用什么,以便我也可以赋予我的重要属性一些权重,并且我将使用合理的资源获得良好的结果。在这种情况下,我应该使用的最佳机器学习算法是什么。
既然我已经表达了我对该帖子的反对意见,我将就以下问题提供一些指导:
| 归档时间: |
|
| 查看次数: |
2399 次 |
| 最近记录: |