我有一些数据,如:
data<-data.frame(comment=c('scan','scanned','SCANNED','scan and sent','FAXED','faxed to','faxed- pt'))
1 scan
2 scanned
3 SCANNED
4 scan and sent
5 FAXED
6 faxed to
7 faxed- pt
Run Code Online (Sandbox Code Playgroud)
我想知道如何使用R来清理数据:
1 scanned
2 scanned
3 scanned
4 scanned
5 faxed
6 faxed
7 faxed
Run Code Online (Sandbox Code Playgroud)
谢谢!!
您可能想要签出stringdist包裹,例如:
library(stringdist)
toMatch <- c('scan', 'scanned', 'SCANNED', 'scan and sent', 'FAXED', 'faxed to', 'faxed- pt')
possibleValues <- c("scanned", "faxed")
possibleValues[amatch(x = toMatch, table = possibleValues, maxDist = Inf)]
Run Code Online (Sandbox Code Playgroud)
返回:
[1] "scanned" "scanned" "scanned" "scanned" "faxed" "faxed" "faxed"
Run Code Online (Sandbox Code Playgroud)