我一直在寻找有关美国命名趋势的一些数据.我成功地获得了2008年出生的婴儿的前1000名.这个数据在这个庄园中形成:
male.name n.male female.name n.female
Jacob 22272 Emma 18587
Michael 20298 Isabella 18377
Ethan 20004 Emily 17217
Joshua 18924 Madison 16853
Daniel 18717 Ava 16850
Alexander 18423 Olivia 16845
Anthony 18158 Sophia 15887
William 18149 Abigail 14901
Christopher 17783 Elizabeth 11815
Matthew 17337 Chloe 11699
Run Code Online (Sandbox Code Playgroud)
我想得到data.frame2个变量:name和gender.这可以通过循环来完成,但我认为这是解决此问题的相当低效的方法.我认为某些reshape功能可满足我的需求.
让我们假设这个制表符分隔的数据被保存到一个data.frame命名中bnames.循环可以通过功能完成:
tmp <- character()
for (i in 1:nrow(bnames)) {
tmp <- c(tmp, rep(bnames[i,1], bnames[i,2]))
}
Run Code Online (Sandbox Code Playgroud)
但我希望通过基于矢量的方法实现这一目标.有什么建议?
因此,一个快速版本将转换data.frame并使用该rbind()函数来获得您想要的.
dataNEW <- data.frame(bnames[,1],c("m"), bnames[,c(2,3)], c("f"), bnames[,4])
colnames(dataNEW) <- c("name", "gender", "value", "name", "gender", "value")
Run Code Online (Sandbox Code Playgroud)
这会给你:
name gender value name gender value
1 Jacob m 22272 Emma f 18587
2 Michael m 20298 Isabella f 18377
3 Ethan m 20004 Emily f 17217
4 Joshua m 18924 Madison f 16853
5 Daniel m 18717 Ava f 16850
6 Alexander m 18423 Olivia f 16845
7 Anthony m 18158 Sophia f 15887
8 William m 18149 Abigail f 14901
9 Christopher m 17783 Elizabeth f 11815
10 Matthew m 17337 Chloe f 11699
Run Code Online (Sandbox Code Playgroud)
现在你可以使用rbind():
dataNGV <- rbind(dataNEW[1:3],dataNEW[4:6])
Run Code Online (Sandbox Code Playgroud)
这导致:
name gender value
1 Jacob m 22272
2 Michael m 20298
3 Ethan m 20004
4 Joshua m 18924
5 Daniel m 18717
6 Alexander m 18423
7 Anthony m 18158
8 William m 18149
9 Christopher m 17783
10 Matthew m 17337
11 Emma f 18587
12 Isabella f 18377
13 Emily f 17217
14 Madison f 16853
15 Ava f 16850
16 Olivia f 16845
17 Sophia f 15887
18 Abigail f 14901
19 Elizabeth f 11815
20 Chloe f 11699
Run Code Online (Sandbox Code Playgroud)