SMOTE过采样和交叉验证

kve*_*err 5 machine-learning weka text-classification

我正在研究Weka中的二进制分类问题,其中包含高度不平衡的数据集(一个类别为90%,另一个类别为10%).我首先将SMOTE(http://www.cs.cmu.edu/afs/cs/project/jair/pub/volume16/chawla02a-html/node6.html)应用于整个数据集以均匀分类,然后执行对新获得的数据进行10倍交叉验证.我发现(过度?)乐观的结果,F1大约90%.

这是由于过采样?对应用SMOTE的数据执行交叉验证是不好的做法吗?有什么方法可以解决这个问题吗?

jai*_*nez 10

我认为你应该首先在测试和训练上分割数据,然后在训练部分上执行SMOTE,然后在没有合成示例的数据集部分测试算法,这样可以更好地了解算法的性能.