在R中将字符串拆分为多行

Roh*_*Das 3 string r reshape

这已经在各个地方被问过SQL,但是在R中找不到一个简单的方法

我有这样的数据集

                                                             Ids    v1  v2  v3  v4  v5
548|14721,678|17604,716|18316,732|18505,745|18626,752|18716 9186    639 9045    316 28396
548|14721,678|17603,716|18316,732|18507,745|18626,752|18716 9041    598 8897    283 28054
548|14722,678|17603,716|18316,732|18507,745|18626,752|18716 8799    588 8669    246 27433
548|14721,678|17603,716|18316,732|18505,745|18626,752|18715 8914    614 8765    273 27347
716|18316,745|18626                                         4113    497 4050    270 27267
548|14722,678|17604,716|18316,732|18507,745|18626,752|18716 8829    589 8713    254 25270
Run Code Online (Sandbox Code Playgroud)

我想基于逗号的第一列进行拆分,并为每个条目创建一行,重复其余行中的条目.

我写的功能是

split.data <- function(data, split = ",") {
  y <- NULL
  for( i in 1:nrow(data)){
    y <- rbind(y,cbind(data.frame(unlist(strsplit(as.character(data[i,1]), split = split))),data[i,-1]))
  }
  names(y) <- names(data)
  y <- sapply(y,as.character)
  return(as.data.frame(y))
}
Run Code Online (Sandbox Code Playgroud)

这有效,但速度极慢.有没有办法对此进行矢量化并使其更快.我的文件有超过5000个这样的行,运行需要一段时间.

我在SQL中找到的相关文章: 在多行上拆分值 将逗号分隔的字符串转换为单独的行

A5C*_*2T1 11

更新的答案(2013年10月21日)

如果您使用concat.split.multiple我的"splitstackshape"包,可以组合这些步骤.此功能count.fields自动使用,因此不应该受到评论中提到的问题的影响:

library(splitstackshape)
out <- concat.split.multiple(mydf, "Ids", seps=",", "long")
head(out)
#     v1  v2   v3  v4    v5 time       Ids
# 1 9186 639 9045 316 28396    1 548|14721
# 2 9041 598 8897 283 28054    1 548|14721
# 3 8799 588 8669 246 27433    1 548|14722
# 4 8914 614 8765 273 27347    1 548|14721
# 5 4113 497 4050 270 27267    1 716|18316
# 6 8829 589 8713 254 25270    1 548|14722
tail(out)
#      v1  v2   v3  v4    v5 time       Ids
# 31 9186 639 9045 316 28396    6 752|18716
# 32 9041 598 8897 283 28054    6 752|18716
# 33 8799 588 8669 246 27433    6 752|18716
# 34 8914 614 8765 273 27347    6 752|18715
# 35 4113 497 4050 270 27267    6      <NA>
# 36 8829 589 8713 254 25270    6 752|18716
Run Code Online (Sandbox Code Playgroud)

原答案(2013年2月27日)

您需要组合拆分"Ids"字符串,然后"重塑"您的数据(如果我正确理解您的目标).

我没有分开你的方式,而是继续利用read.csv和论证fill = TRUE.请注意,如果"Ids"列中的值是当前因素,则需要使用text = as.character(mydf$Ids).

以下是我的进展方式:

mydf2 <- cbind(read.csv(text = mydf$Ids, fill = TRUE, header = FALSE), mydf[-1])
mydf2
#          V1        V2        V3        V4        V5        V6   v1  v2   v3  v4    v5
# 1 548|14721 678|17604 716|18316 732|18505 745|18626 752|18716 9186 639 9045 316 28396
# 2 548|14721 678|17603 716|18316 732|18507 745|18626 752|18716 9041 598 8897 283 28054
# 3 548|14722 678|17603 716|18316 732|18507 745|18626 752|18716 8799 588 8669 246 27433
# 4 548|14721 678|17603 716|18316 732|18505 745|18626 752|18715 8914 614 8765 273 27347
# 5 716|18316 745|18626                                         4113 497 4050 270 27267
# 6 548|14722 678|17604 716|18316 732|18507 745|18626 752|18716 8829 589 8713 254 25270
Run Code Online (Sandbox Code Playgroud)

该数据目前采用"广泛"格式.让我们把它变成一种"长"格式.该reshape功能需要一些有关如何继续的信息.特别是,它需要知道:

  • 哪些列表示"id"变量.与直觉相反,从名字你的数据集,这是不是从原来的"IDS"变量中的值,但存在其他变量.("mydf2"数据集中位置7到11的"v1" - "v5"(小写"v")).显然,对于实际数据,您需要指定要视为idvars 的实际列.
  • 哪些列"变化"并且需要以"长"格式"堆叠".在这种情况下,它是我们使用时创建的新变量,read.csv通过手动检查它们的索引,我们可以看到它们位于1到6位置.显然,您需要从实际数据集中指定列号.

对于您提供的示例数据集,我们将使用reshape如下:

mydf3 <- reshape(mydf2, direction = "long", idvar=7:ncol(mydf2), 
                 varying=1:6, sep = "")
rownames(mydf3) <- NULL
Run Code Online (Sandbox Code Playgroud)

这里的headtail由此而来的data.frame:

> head(mydf3)
    v1  v2   v3  v4    v5 time         V
1 9186 639 9045 316 28396    1 548|14721
2 9041 598 8897 283 28054    1 548|14721
3 8799 588 8669 246 27433    1 548|14722
4 8914 614 8765 273 27347    1 548|14721
5 4113 497 4050 270 27267    1 716|18316
6 8829 589 8713 254 25270    1 548|14722
> tail(mydf3)
     v1  v2   v3  v4    v5 time         V
31 9186 639 9045 316 28396    6 752|18716
32 9041 598 8897 283 28054    6 752|18716
33 8799 588 8669 246 27433    6 752|18716
34 8914 614 8765 273 27347    6 752|18715
35 4113 497 4050 270 27267    6          
36 8829 589 8713 254 25270    6 752|18716
Run Code Online (Sandbox Code Playgroud)

这是假设我们从一个名为"mydf"的对象开始,看起来像这样:

mydf <- structure(list(Ids = c("548|14721,678|17604,716|18316,732|18505,745|18626,752|18716", 
  "548|14721,678|17603,716|18316,732|18507,745|18626,752|18716", 
  "548|14722,678|17603,716|18316,732|18507,745|18626,752|18716", 
  "548|14721,678|17603,716|18316,732|18505,745|18626,752|18715", 
  "716|18316,745|18626", "548|14722,678|17604,716|18316,732|18507,745|18626,752|18716"
  ), v1 = c(9186L, 9041L, 8799L, 8914L, 4113L, 8829L), v2 = c(639L, 
  598L, 588L, 614L, 497L, 589L), v3 = c(9045L, 8897L, 8669L, 8765L, 
  4050L, 8713L), v4 = c(316L, 283L, 246L, 273L, 270L, 254L), v5 = c(28396L, 
  28054L, 27433L, 27347L, 27267L, 25270L)), .Names = c("Ids", "v1", 
  "v2", "v3", "v4", "v5"), class = "data.frame", row.names = c(NA, 
  -6L))
Run Code Online (Sandbox Code Playgroud)