我正在研究Weka中的二进制分类问题,其中包含高度不平衡的数据集(一个类别为90%,另一个类别为10%).我首先将SMOTE(http://www.cs.cmu.edu/afs/cs/project/jair/pub/volume16/chawla02a-html/node6.html)应用于整个数据集以均匀分类,然后执行对新获得的数据进行10倍交叉验证.我发现(过度?)乐观的结果,F1大约90%.
这是由于过采样?对应用SMOTE的数据执行交叉验证是不好的做法吗?有什么方法可以解决这个问题吗?