我有一个关于在sklearn中使用文本分类中的交叉验证的问题.在交叉验证之前对所有数据进行矢量化是有问题的,因为分类器将"看到"测试数据中出现的词汇.Weka过滤了分类器来解决这个问题.这个函数的sklearn等价物是什么?我的意思是对于每个折叠,特征集将是不同的,因为训练数据是不同的.
scikit-learn
scikit-learn ×1