我有数百个 .csv 文件需要使用 fread 读取并另存为一个数据表。每个 .csv 的基本结构都相同。有需要跳过的标题信息(使用 skip = 很容易)。我很难跳过每个 .csv 文件的最后一行。每个 .csv 文件都有不同的行数。
如果我在 Test 文件夹中只有一个文件,这个脚本会完美地跳过第一行(使用 skip = )和最后一行(使用 nrows = ):
file <- list.files("Q:/Test/", full.names=TRUE)
all <- fread(file, skip = 7, select = c(1:7,9),
nrows = length(readLines(file))-9)
Run Code Online (Sandbox Code Playgroud)
在 Test 文件夹中保存多个文件时,这是我尝试的代码:
file <- list.files("Q:/Test/", full.names=TRUE)
L <- lapply(file, fread, skip = 7, select = c(1:7,9),
nrows = length(readLines(file))-9)
dt <- rbindlist(L)
Run Code Online (Sandbox Code Playgroud)
它不会创建 L 并给我这个错误:
Error in file(con, "r") : invalid 'description' argument
Run Code Online (Sandbox Code Playgroud)
关于如何在每个 .csv 的行数不同时跳过每个 .csv 的最后一行的任何想法?
我正在使用 data.table 版本 1.9.6。谢谢。
有点晚了,但这对我有用:
library(data.table)
fnames <- dir("path", pattern = "csv")
read_data <- function(z){
dat <- fread(z, skip = 1, select = 1)
return(dat[1:(nrow(dat)-1),])
}
datalist <- lapply(fnames, read_data)
bigdata <- rbindlist(datalist, use.names = TRUE)
Run Code Online (Sandbox Code Playgroud)
这里path指的是您正在查看的目录。我假设所有读取文件的名称都相似,如果不是,您始终可以定义一个新名称以bigdata使用names. 希望这可以帮助!
| 归档时间: |
|
| 查看次数: |
3699 次 |
| 最近记录: |