使用具有可变功能的多个字符串的向量进行Dplyr标准评估

Bra*_*don 2 r dplyr nse standard-evaluation rlang

我试图提供一个包含多个列名的向量,以mutate()使用该dplyr程序包进行调用。以下是可重现的示例:

stackdf <- data.frame(jack = c(1,NA,2,NA,3,NA,4,NA,5,NA),
                      jill = c(1,2,NA,3,4,NA,5,6,NA,7),
                      jane = c(1,2,3,4,5,6,NA,NA,NA,NA))
two_names <- c('jack','jill')
one_name <- c('jack')

#   jack jill jane
#    1    1    1
#   NA    2    2
#    2   NA    3
#   NA    3    4
#    3    4    5
#   NA   NA    6
#    4    5   NA
#   NA    6   NA
#    5   NA   NA
#   NA    7   NA
Run Code Online (Sandbox Code Playgroud)

我能够弄清楚如何使用“一个变量”版本,但不知道如何将其扩展到多个变量?

# the below works as expected, and is an example of the output I desire
stackdf %>% rowwise %>% mutate(test = anyNA(c(jack,jill)))

# A tibble: 10 x 4
    jack  jill  jane  test
   <dbl> <dbl> <dbl> <lgl>
 1     1     1     1 FALSE
 2    NA     2     2  TRUE
 3     2    NA     3  TRUE
 4    NA     3     4  TRUE
 5     3     4     5 FALSE
 6    NA    NA     6  TRUE
 7     4     5    NA FALSE
 8    NA     6    NA  TRUE
 9     5    NA    NA  TRUE
10    NA     7    NA  TRUE


# using the one_name variable works if I evaluate it and then convert to 
# a name before unquoting it
stackdf %>% rowwise %>% mutate(test = anyNA(!!as.name(eval(one_name))))

# A tibble: 10 x 4
    jack  jill  jane  test
   <dbl> <dbl> <dbl> <lgl>
 1     1     1     1 FALSE
 2    NA     2     2  TRUE
 3     2    NA     3 FALSE
 4    NA     3     4  TRUE
 5     3     4     5 FALSE
 6    NA    NA     6  TRUE
 7     4     5    NA FALSE
 8    NA     6    NA  TRUE
 9     5    NA    NA FALSE
10    NA     7    NA  TRUE
Run Code Online (Sandbox Code Playgroud)

如何扩展上述方法,以便可以使用two_names向量?as.name只使用一个对象,所以它不起作用。

这里的问题是类似的:将变量名的向量传递到dplyr中的ranging()。该解决方案“有效”,因为我可以使用以下代码:

two_names2 <- quos(c(jack, jill))
stackdf %>% rowwise %>% mutate(test = anyNA(!!!two_names2))
Run Code Online (Sandbox Code Playgroud)

但是,如果我必须c(jack, jill)直接键入而不是使用two_names变量,则无法达到目的。是否有一些类似的程序可以two_names直接使用?这个答案如何使用命名传递给dplyr :: select的命名向量?的用法rlang::syms,尽管这样做对选择变量有效(即stackdf %>% select(!!! rlang::syms(two_names)),似乎在变异时不提供参数(即stackdf %>% rowwise %>% mutate(test = anyNA(!!! rlang::syms(two_names)))。)。该答案类似,但不起作用:如何使用dplyr使用非标准评估来评估构造的字符串?

Bra*_*don 6

解决这个问题有几个关键:

  • 访问字符向量中的字符串并将其与dplyr
  • 提供给与 一起使用的函数的参数格式mutate,此处为anyNA

这里的目标是复制此调用,但使用命名变量two_names而不是手动输入c(jack,jill)

stackdf %>% rowwise %>% mutate(test = anyNA(c(jack,jill)))

# A tibble: 10 x 4
    jack  jill  jane  test
   <dbl> <dbl> <dbl> <lgl>
 1     1     1     1 FALSE
 2    NA     2     2  TRUE
 3     2    NA     3  TRUE
 4    NA     3     4  TRUE
 5     3     4     5 FALSE
 6    NA    NA     6  TRUE
 7     4     5    NA FALSE
 8    NA     6    NA  TRUE
 9     5    NA    NA  TRUE
10    NA     7    NA  TRUE
Run Code Online (Sandbox Code Playgroud)

1. 在 dplyr 中使用动态变量

  1. 使用quo/ quos:不接受字符串作为输入。使用此方法的解决方案是:

    two_names2 <- quos(c(jack, jill))
    stackdf %>% rowwise %>% mutate(test = anyNA(!!! two_names2))
    
    Run Code Online (Sandbox Code Playgroud)

    请注意,quo需要单个参数,因此使用 不加引号!!,对于多个参数,您可以分别使用quos!!!。这是不可取的,因为我不使用two_names而是必须键入我希望使用的列。

  2. 使用as.nameor rlang::sym/ rlang::syms:仅as.name接受sym一个输入,但syms将接受多个输入并返回符号对象列表作为输出。

    > two_names
    [1] "jack" "jill"
    > as.name(two_names)
    jack
    > syms(two_names)
    [[1]]
    jack
    
    [[2]]
    jill
    
    Run Code Online (Sandbox Code Playgroud)

    请注意,as.name忽略第一个元素之后的所有内容。然而,syms这里似乎可以正常工作,所以现在我们需要在调用中使用它mutate

mutate2.在usinganyNA或其他变量中使用动态变量

  1. 直接使用symsandanyNA实际上并不能产生正确的结果。

    > stackdf %>% rowwise %>% mutate(test = anyNA(!!! syms(two_names)))
        jack  jill  jane  test
       <dbl> <dbl> <dbl> <lgl>
     1     1     1     1 FALSE
     2    NA     2     2  TRUE
     3     2    NA     3 FALSE
     4    NA     3     4  TRUE
     5     3     4     5 FALSE
     6    NA    NA     6  TRUE
     7     4     5    NA FALSE
     8    NA     6    NA  TRUE
     9     5    NA    NA FALSE
    10    NA     7    NA  TRUE
    
    Run Code Online (Sandbox Code Playgroud)

    检查表明test,这仅考虑了第一个元素,而忽略了第二个元素。但是,如果我使用不同的函数,例如sumor paste0,很明显这两个元素都被使用:

    > stackdf %>% rowwise %>% mutate(test = sum(!!! syms(two_names), 
                                                na.rm = TRUE))
        jack  jill  jane  test
       <dbl> <dbl> <dbl> <dbl>
     1     1     1     1     2
     2    NA     2     2     2
     3     2    NA     3     2
     4    NA     3     4     3
     5     3     4     5     7
     6    NA    NA     6     0
     7     4     5    NA     9
     8    NA     6    NA     6
     9     5    NA    NA     5
    10    NA     7    NA     7
    
    Run Code Online (Sandbox Code Playgroud)

    anyNA当您查看vs的参数时,其原因就会变得清晰sum

    函数 (x, 递归 = FALSE) .Primitive("anyNA")

    函数 (..., na.rm = FALSE) .Primitive("sum")

    anyNA需要单个对象x,而sum可以采用可变的对象列表(...)

  2. 只需提供即可c()解决此问题(请参阅 alistaire 的回答)。

    > stackdf %>% rowwise %>% mutate(test = anyNA(c(!!! syms(two_names))))
        jack  jill  jane  test
       <dbl> <dbl> <dbl> <lgl>
     1     1     1     1 FALSE
     2    NA     2     2  TRUE
     3     2    NA     3  TRUE
     4    NA     3     4  TRUE
     5     3     4     5 FALSE
     6    NA    NA     6  TRUE
     7     4     5    NA FALSE
     8    NA     6    NA  TRUE
     9     5    NA    NA  TRUE
    10    NA     7    NA  TRUE
    
    Run Code Online (Sandbox Code Playgroud)
  3. sapply或者...出于教育目的,可以使用、any、 和的组合anyNA来产生正确的结果。在这里,我们使用list以便将结果作为单个列表对象提供。

    # this produces an error an error because the elements of !!!
    # are being passed to the arguments of sapply (X =, FUN = )
    > stackdf %>% rowwise %>% 
        mutate(test = any(sapply(!!! syms(two_names), anyNA)))
    Error in mutate_impl(.data, dots) : 
      Evaluation error: object 'jill' of mode 'function' was not found.
    
    Run Code Online (Sandbox Code Playgroud)

    提供list解决了这个问题,因为它将所有结果绑定到一个对象中。

    # the below table is the familiar incorrect result that uses only the `jack`
    > stackdf %>% rowwise %>% 
        mutate(test = any(sapply(X=as.list(!!! syms(two_names)), 
                                 FUN=anyNA)))
    
        jack  jill  jane  test
       <dbl> <dbl> <dbl> <lgl>
     1     1     1     1 FALSE
     2    NA     2     2  TRUE
     3     2    NA     3 FALSE
     4    NA     3     4  TRUE
     5     3     4     5 FALSE
     6    NA    NA     6  TRUE
     7     4     5    NA FALSE
     8    NA     6    NA  TRUE
     9     5    NA    NA FALSE
    10    NA     7    NA  TRUE
    
    # this produces the correct answer
    > stackdf %>% rowwise %>% 
        mutate(test = any(X = sapply(list(!!! syms(two_names)), 
                          FUN = anyNA)))
    
    jack  jill  jane  test
    <dbl> <dbl> <dbl> <lgl>
     1     1     1     1 FALSE
     2    NA     2     2  TRUE
     3     2    NA     3  TRUE
     4    NA     3     4  TRUE
     5     3     4     5 FALSE
     6    NA    NA     6  TRUE
     7     4     5    NA FALSE
     8    NA     6    NA  TRUE
     9     5    NA    NA  TRUE
    10    NA     7    NA  TRUE
    
    Run Code Online (Sandbox Code Playgroud)

    当比较他们的行为时,理解为什么这两者的表现不同是有意义的!

    > as.list(two_names)
    [[1]]
    [1] "jack"
    
    [[2]]
    [1] "jill"
    
    > list(two_names)
    [[1]]
    [1] "jack" "jill"
    
    Run Code Online (Sandbox Code Playgroud)


ali*_*ire 5

您可以使用rlang::syms(由dplyr重新导出;或者直接调用它)将字符串强制转换为quosures,因此

library(dplyr)

stackdf <- data.frame(jack = c(1,NA,2,NA,3,NA,4,NA,5,NA),
                      jill = c(1,2,NA,3,4,NA,5,6,NA,7),
                      jane = c(1,2,3,4,5,6,NA,NA,NA,NA))
two_names <- c('jack','jill')

stackdf %>% rowwise %>% mutate(test = anyNA(c(!!!syms(two_names))))
#> Source: local data frame [10 x 4]
#> Groups: <by row>
#> 
#> # A tibble: 10 x 4
#>     jack  jill  jane test 
#>    <dbl> <dbl> <dbl> <lgl>
#>  1    1.    1.    1. FALSE
#>  2   NA     2.    2. TRUE 
#>  3    2.   NA     3. TRUE 
#>  4   NA     3.    4. TRUE 
#>  5    3.    4.    5. FALSE
#>  6   NA    NA     6. TRUE 
#>  7    4.    5.   NA  FALSE
#>  8   NA     6.   NA  TRUE 
#>  9    5.   NA    NA  TRUE 
#> 10   NA     7.   NA  TRUE
Run Code Online (Sandbox Code Playgroud)

或者,使用小底数R代替整洁的eval:

stackdf %>% mutate(test = rowSums(is.na(.[two_names])) > 0)
#>    jack jill jane  test
#> 1     1    1    1 FALSE
#> 2    NA    2    2  TRUE
#> 3     2   NA    3  TRUE
#> 4    NA    3    4  TRUE
#> 5     3    4    5 FALSE
#> 6    NA   NA    6  TRUE
#> 7     4    5   NA FALSE
#> 8    NA    6   NA  TRUE
#> 9     5   NA   NA  TRUE
#> 10   NA    7   NA  TRUE
Run Code Online (Sandbox Code Playgroud)

...这可能会快很多,因为迭代rowwise进行n呼叫而不是向量化呼叫。