小编pet*_*ler的帖子

Alteryx是ETL工具吗?它与SSIS有何不同?

我的客户希望我使用Alteryx实施ETL流程,因为他们拥有它的许可.我很困惑Alteryx是否是一个ETL工具.我相信Alteryx通常用于为Tableau数据可视化工具准备数据.

请告知是否是ETL工具?它与SSIS有何不同?

谢谢,

ssis etl difference alteryx

4
推荐指数
2
解决办法
3万
查看次数

将 POSIXct 转换为 Date 类的函数

您好,我正在尝试编写一个接受数据帧的函数,并将所有 POSIXct 或 POSIXlt 类型转换为 R 中的日期类型。我已经创建了该函数的一部分,但我一直在迭代每个索引处的元素。

#Basic Data Frame
patientID <- c(1, 2, 3, 4)
AdmDate <- as.POSIXct(c('2010-10-11','2008-3-25','2016-4-23','2011-6-12'))
diabetes <- c("Type1", "Type2", "Type1", "Type2")
status <- c("Poor", "Improved", "Excellent", "Poor")
patientdata <- data.frame(patientID, AdmDate, diabetes, status)


convertallPOSIXct <- function(data){
 if(getdata[[is.POSIXt()=='TRUE']])
   getdata[[]] <- class(as.Date()) 
}

getdata <- function(x) {
  chr_test <- x %>%
    map_chr(~ paste(class(.), collapse = "/"))
}
Run Code Online (Sandbox Code Playgroud)

获取数据函数似乎可以工作,但我不确定如何从 getdata 中获取每个元素并将其转换为 R 中的 Date 类。谢谢!

r lubridate purrr

3
推荐指数
1
解决办法
5822
查看次数

Dockerfile中的多行Rscript

我正在尝试使用R构建一个docker映像,并且我希望能够以一种清晰易读的方式跨越多行来突破我的软件包安装步骤,但是由于以下原因,bash似乎不喜欢这种方法不知道结尾)在哪里。

有没有办法使这行长代码分成多行?

Rscript -e 'devtools::install_cran(c("tidytext","janitor","corrr","officer","devtools","pacman"))'
Run Code Online (Sandbox Code Playgroud)

也许是这样的:

Rscript -e 'devtools::install_cran(c("tidytext","janitor",
                              "corrr","officer","devtools","pacman"))'
Run Code Online (Sandbox Code Playgroud)

这可能与Rscript有关吗?我尝试在每行的末尾使用\,但仍然无法正常工作。

我知道install2.r可以逐行列出软件包,但是我希望有一个向量包,devtools::install_cran如果可能的话,传递给它们。我已经看到其他人只是通过Rscript调用而简单地引用了他们的R脚本,但是我想在Dockerfile中看到我的所有安装步骤,而不是在容器中复制和运行外部R脚本。谢谢你的帮助。

Rscript test.R
Run Code Online (Sandbox Code Playgroud)

bash r rscript docker

3
推荐指数
1
解决办法
737
查看次数

在 Plotly 中分组的分组条形图

我试图在 plotly 中创建一个分组条形图,但我似乎无法在一个组中为我的条形着色(所以它们都是相同的颜色)。有谁知道如何在情节中做到这一点?我想根据子类别为我的条形图着色(因此子类别中的所有条形都有自己的颜色)。我曾尝试向图形添加跟踪,但没有运气。谢谢。

sample <- data.frame(
  Category <- c("Furniture","Furniture","Furniture","Furniture",
                "Office Supplies","Office Supplies", "Office Supplies", "Office Supplies",
                "Office Supplies", "Office Supplies", "Office Supplies", "Office Supplies",
                "Office Supplies", "Technology","Technology","Technology","Technology"),
  SubCategory <- c("Bookcases","Chairs","Furnishings","Tables","Appliances","Art","Binders","Envelopes", 
                   "Fasteners","Labels","Paper","Storage",  "Supplies", "Accessories","Copiers","Machines",
                   "Phones"),
  sales <- c(889222.51,920892.65,239840.16,445823.93,614737.91,225594.68,281494.68,104903.88,50156.06,44269.30,
             150113.36,692903.08,152196.19,463383.33,965899.78,458655.43,1005525.38)
)

#plot code so far
sample %>%
  plot_ly(
    x = Category,
    y = sales,
    type = "bar",
    group = SubCategory
  )
Run Code Online (Sandbox Code Playgroud)

下面是我到目前为止所拥有的,但着色不是基于分组的。当我提供颜色变量时,它不会将 SubCategory 中的所有条形着色为相同的颜色。这是可能的错误吗? 在此处输入图片说明

r plotly

1
推荐指数
1
解决办法
1万
查看次数

by_row vs rowwise迭代

有谁知道有什么区别之间by_row,和rowwise?我试图刮掉3个简单的网站,我似乎无法获得任何一种方法,所以我不确定我是否只是使用purr/ dplyr错误.

数据:

structure(list(beer_brewerid = c("8481", "3228", "10325"), link = 
c("https://www.ratebeer.com/beer/8481/",  "https://www.ratebeer.com/beer/3228/", "https://www.ratebeer.com/beer/10325/" ), scrapedname = c("", "", "")), .Names = c("beer_brewerid",  "link", "scrapedname"), row.names = c(NA, 3L), class = "data.frame")
Run Code Online (Sandbox Code Playgroud)

对于每个URL(或行),我想使用以下函数来抓取网页:

dplyr approach:
    table %>%
      rowwise() %>%
      read_html() %>%
      extract2(2) %>%
      html_nodes("#_brand4 span") %>%
      html_text()
Run Code Online (Sandbox Code Playgroud)

Purr方法:

#Apply function to each row
table %>%
  by_row(..f = parserows(), collate = c("rows"), .to = "scrapedname")

#Takes in row 
parserows = function(){
      read_html() %>%
      extract2(., 2) …
Run Code Online (Sandbox Code Playgroud)

r dplyr purrr

0
推荐指数
1
解决办法
1095
查看次数

标签 统计

r ×4

purrr ×2

alteryx ×1

bash ×1

difference ×1

docker ×1

dplyr ×1

etl ×1

lubridate ×1

plotly ×1

rscript ×1

ssis ×1