Sca*_*bee 3 r dplyr data.table
我需要使用辅助分组变量执行基本group_by/ mutate操作.例如:
df <- data.frame(
u = c(0, 0, 1, 0, 1),
v = c(8, 4, 2, 3, 5)
)
df %>%
group_by(tmp = cumsum(u)) %>%
mutate(w = cumprod(v)) %>%
ungroup %>%
select(-tmp)
Run Code Online (Sandbox Code Playgroud)
我的问题是,如果df恰好已经包含一个名为tmpI 的列,我将失去它.
当然,我可以选择一个非常奇特的名字,而不是tmp减少碰撞的可能性(或者我甚strrep("z", max(nchar(names(df))) + 1)至可以选择一些确定的东西),但我更愿意有一个更清洁的解决方案.
换句话说,我正在寻找dplyr相当于这一data.table行:
setDT(df)[, w := cumprod(v), by = cumsum(u)]
Run Code Online (Sandbox Code Playgroud)
我们可以创建一个功能来处理这个问题.假设要创建的临时分组变量是'tmp',通过与数据集的列名连接并调用make.unique,如果数据集中已存在'tmp'列,则重复的变量将重命名为'tmp.1 ".使用!!'tmp.1'(from nm1)命名列不会影响数据集中已存在的'tmp'.如果没有'tmp'列,则分组列将被命名为'tmp',稍后将删除select
f1 <- function(dat, grpCol, Col) {
grpCol <- enquo(grpCol)
Col <- enquo(Col)
changeCol <- "tmp"
nm1 <- tail(make.unique(c(names(dat), changeCol)), 1)
dat %>%
group_by(!! (nm1) := cumsum(!! grpCol)) %>%
mutate(w = cumprod(!!Col)) %>%
ungroup %>%
select(-one_of(nm1))
}
Run Code Online (Sandbox Code Playgroud)
- 运行功能
f1(df, u, v)
# A tibble: 5 x 3
# u v w
# <dbl> <dbl> <dbl>
#1 0 8.00 8.00
#2 0 4.00 32.0
#3 1.00 2.00 2.00
#4 0 3.00 6.00
#5 1.00 5.00 5.00
f1(df %>% mutate(tmp = 1), u, v) #create a 'tmp' column in dataset
# A tibble: 5 x 4
# u v tmp w
# <dbl> <dbl> <dbl> <dbl>
#1 0 8.00 1.00 8.00
#2 0 4.00 1.00 32.0
#3 1.00 2.00 1.00 2.00
#4 0 3.00 1.00 6.00
#5 1.00 5.00 1.00 5.00
Run Code Online (Sandbox Code Playgroud)
作为后续(@Frank的评论)关于传递表达式
expr <- quos(tmp = cumsum(u), w = cumprod(v))
#additional checks outside the function
names(expr)[1] <- if(names(expr)[1] %in% names(df))
strrep(names(expr)[1], 2) else names(expr)[1]
f2 <- function(dat, exprs ){
dat %>%
group_by(!!! exprs[1]) %>%
mutate(!!! exprs[2])
}
f2(df, expr)
# A tibble: 5 x 4
# Groups: tmp [3]
# u v tmp w
# <dbl> <dbl> <dbl> <dbl>
#1 0 8.00 0 8.00
#2 0 4.00 0 32.0
#3 1.00 2.00 1.00 2.00
#4 0 3.00 1.00 6.00
#5 1.00 5.00 2.00 5.00
Run Code Online (Sandbox Code Playgroud)