希望有人可以帮助我解决这个看似简单的问题,我无法弄明白!
name = c('alan', 'alan', 'alan','alan', 'alan', 'alan', 'albert','albert','albert', 'alvin','alvin','alvin','alvin')
var = c(0, 1, 0, 1, 1, 0, 0, 0, 1, 1, 1, 0 ,0)
df = data.frame(name, var)
Run Code Online (Sandbox Code Playgroud)
我拥有的数据集如下:
name var
1 alan 0
2 alan 1
3 alan 0
4 alan 1
5 alan 1
6 alan 0
7 albert 0
8 albert 0
9 albert 1
10 alvin 1
11 alvin 1
12 alvin 0
13 alvin 0
Run Code Online (Sandbox Code Playgroud)
我想使用ddply来计算所有1,但每个名称.换句话说,艾伦应该得到三个1,阿尔伯特得到一个1,而阿尔文得到两个1.所以理想的输出是:
name counter
1 alan 3
2 albert 1
3 alvin 2
Run Code Online (Sandbox Code Playgroud)
这是我的代码不起作用:
df.ddply = ddply(df, c('name'), transform, counter=length(df[df['var']>0, 'var']))
Run Code Online (Sandbox Code Playgroud)
我想在这里使用长度函数的原因是因为var列的值可以是0-9.
这是上面一行的输出:
name counter
1 alan 6
2 albert 6
3 alvin 6
Run Code Online (Sandbox Code Playgroud)
我在这里错过了什么吗?任何输入都非常感谢!
这里没有必要plyr,它比基地R更快或更容易阅读.只需使用agggregate
aggregate(var ~ name, df, function(x) sum(x == 1))
# name var
# 1 alan 3
# 2 albert 1
# 3 alvin 2
Run Code Online (Sandbox Code Playgroud)
或者试试 tapply
tapply(df$var, df$name, function(x) sum(x == 1))
# alan albert alvin
# 3 1 2
Run Code Online (Sandbox Code Playgroud)
另一种可能的解决方案 dplyr
library(dplyr)
df %>%
group_by(name) %>%
tally(var == 1)
# Source: local data frame [3 x 2]
#
# name n
# 1 alan 3
# 2 albert 1
# 3 alvin 2
Run Code Online (Sandbox Code Playgroud)
虽然我选择的工具总是data.table包装
library(data.table)
setDT(df)[, .(counter = sum(var == 1)), name]
# name counter
# 1: alan 3
# 2: albert 1
# 3: alvin 2
Run Code Online (Sandbox Code Playgroud)
或者(如@Arun提到的那样)
setDT(df)[var == 1, .(counter = .N), name]
Run Code Online (Sandbox Code Playgroud)
虽然这对于大数据集来说应该是最快的(键控by结合二分搜索)
setkey(df, var)[J(1), .(counter = .N), name]
Run Code Online (Sandbox Code Playgroud)