ste*_*ica 5 sql database hive r dbplyr
我目前可以通过beelineCLI访问 Apache Hive 数据库。我们仍在与 IT 协商以获取R服务器。在那之前,我想(ab)使用该R dbplyr包在另一台机器上生成 SQL 查询,复制它们,然后将它们作为原始 SQL 运行。我已经使用sql_render在dbplyr在那里我有一个有效的数据库连接实例的过去,但我不知道如何做到这一点没有一个有效的数据库连接。对我来说,理想的情况是这样的:
con <- dummy_connection('hive') # this does not exist, I think
qry <- tbl(con,'mytable') %>% # complex logic to build a query
select(var1,var2) %>%
filter(var1 > 0) # etc...
sql_render(qry) %>% # cat it to a file to be used on another machine.
as.character() %>%
cat()
Run Code Online (Sandbox Code Playgroud)
有没有办法建立这种“虚拟”连接?并且可以以我可以指定SQL变体的方式完成吗?
您可以仅使用 R 生成内存 SQLite 数据库:
library(DBI)
library(odbc)
library(RSQLite)
library(tidyverse)
library(dbplyr)
con <- dbConnect(RSQLite::SQLite(), ":memory:")
data("diamonds")
dbWriteTable(con, "diamonds", diamonds)
Run Code Online (Sandbox Code Playgroud)
有了内存 SQL 数据库和数据库连接,您应该能够(滥用)使用dbplyr数据库连接来让 R 为您编写 SQL。
这只是 SQLite,而不是 Hive。但希望它仍然是从 R 到 SQLite 再到 Hive(或您喜欢的 SQL 版本)的加速器。
另请参阅以下链接: