如何使用R清理和标准化单词

YIF*_*ANG 1 r data-cleaning

我有一些数据,如:

data<-data.frame(comment=c('scan','scanned','SCANNED','scan and sent','FAXED','faxed to','faxed- pt'))


1          scan
2       scanned
3       SCANNED
4 scan and sent
5         FAXED
6      faxed to
7     faxed- pt
Run Code Online (Sandbox Code Playgroud)

我想知道如何使用R来清理数据:

1  scanned
2  scanned
3  scanned
4  scanned
5    faxed
6    faxed
7    faxed
Run Code Online (Sandbox Code Playgroud)

谢谢!!

Ale*_*ord 5

您可能想要签出stringdist包裹,例如:

library(stringdist)

toMatch <- c('scan', 'scanned', 'SCANNED', 'scan and sent', 'FAXED', 'faxed to', 'faxed- pt')
possibleValues <- c("scanned", "faxed")

possibleValues[amatch(x = toMatch, table = possibleValues, maxDist = Inf)]
Run Code Online (Sandbox Code Playgroud)

返回:

[1] "scanned" "scanned" "scanned" "scanned" "faxed"   "faxed"   "faxed"
Run Code Online (Sandbox Code Playgroud)