特征选择,特征提取,特征权重之间的差异

Rah*_*ghe 13 parallel-processing nlp nltk stanford-nlp

关于"特征选择/提取器/权重"是什么意思以及它们之间的区别,我有点困惑.在我阅读文献时,有时候我会感到迷茫,因为我发现这个术语使用得非常松散,我的主要关注点是 -

  1. 当人们谈论特征频率,特征存在时 - 它是否是特征选择?

  2. 当人们谈论信息增益,最大熵等算法时,它仍然是特征选择.

  3. 如果我训练分类器 - 使用要求分类器记录文档中单词位置的特征集作为示例 - 是否仍然会调用此特征选择?

谢谢Rahul Dighe

Jef*_*eff 18

Rahul-

所有这些都是很好的答案.我要提到的一件事是,选择和提取之间的根本区别与你如何处理数据有关.

特征提取方法具有变革性 - 即您正在对数据应用转换以将其投影到具有较低维度的新要素空间中.PCA和SVD就是这方面的例子.

特征选择方法基于某些标准从原始集合中选择特征,信息增益,相关性和相互信息只是用于过滤掉不重要或冗余特征的标准.嵌入式或包装器方法(称为它们)可以使用专门的分类器来实现特征选择并同时对数据集进行分类.

这里给出了一个非常好的问题空间概述.

祝好运!


小智 8

特征提取:通过将D维向量(线性或非线性)投影到d维向量(d <D)上来降低维度.示例:主成分分析

特征选择:通过选择原始变量的子集来减少维度.示例:前向或后向特征选择


Gal*_*llo 6

功能选择是从您的集合中选择"有趣"功能以进行进一步处理的过程.

特征频率就是特征出现的频率.

信息增益,最大熵等是加权方法,使用特征频率,进而允许您执行特征选择.

可以这样想:

您解析语料库,并创建术语/文档矩阵.该矩阵最初是作为术语的计数,以及它们出现的文档(简单频率).

为了使该矩阵更有意义,您可以根据某些函数(包括术语频率 - 逆文档频率,信息增益,最大熵)对术语进行加权.现在该矩阵包含每个术语相对于矩阵中其他术语的权重或重要性.

完成后,您可以使用功能选择仅保留最重要的术语(如果您正在执行分类或分类等操作)并执行进一步分析.

  • 特征提取是减少数据维度的过程(通常通过SVD,PCA等).请参阅此链接:http://en.wikipedia.org/wiki/Feature_extraction (2认同)