我在数据库中有一些数据,我想使用sparklyr在Spark中使用它.
我可以使用基于DBI的包将数据库中的数据导入到R中
dbconn <- dbConnect(<some connection args>)
data_in_r <- dbReadTable(dbconn, "a table")
Run Code Online (Sandbox Code Playgroud)
然后使用将数据从R复制到Spark
sconn <- spark_connect(<some connection args>)
data_ptr <- copy_to(sconn, data_in_r)
Run Code Online (Sandbox Code Playgroud)
对于大数据集,复制两次很慢.
如何将数据直接从数据库复制到Spark?
sparklyr有几个spark_read_*()导入功能,但没有数据库相关. sdf_import()看起来像是一种可能性,但目前尚不清楚如何在这种情况下使用它.