小编Mik*_*_Jr的帖子

是否可以将 word2vec 预训练的可用向量加载到 spark 中?

有没有办法将GoogleGlove 的预训练向量(模型)(例如GoogleNews-vectors-negative300.bin.gz)加载到 spark 中并执行诸如从 spark 提供的 findSynonyms 之类的操作?还是我需要从头开始加载和操作?

在这篇文章在 Spark 中加载 Word2Vec 模型,Tom Lous 建议将 bin 文件转换为 txt 并从那里开始,我已经这样做了..但接下来是什么?

在我昨天发布的一个问题中,我得到了一个答案,即 Parquet 格式的模型可以在 spark 中加载,因此我发布这个问题是为了确保没有其他选择。

scala stanford-nlp apache-spark word2vec

5
推荐指数
1
解决办法
1523
查看次数

将Spark DataFrame转换为对象列表

我知道可以使用以下内容将数据帧列转换为列表:

dataFrame.select("ColumnName").rdd.map(r => r(0)).collect()
Run Code Online (Sandbox Code Playgroud)

假设我已经知道了数据帧的模式,相应地我创建了一个case类,例如:

case class Synonym(URI: String, similarity: Double, FURI: String)
Run Code Online (Sandbox Code Playgroud)

有没有一种有效的方法从数据帧的数据中获取同义词对象列表?

换句话说,我正在尝试创建一个映射器,它将数据帧的每一行转换为我的case类的一个对象,然后以一种我可以在操作结束时拥有这些对象列表的方式返回该对象.这有可能以一种有效的方式吗?

oop scala dataframe apache-spark apache-spark-sql

0
推荐指数
1
解决办法
5595
查看次数