raise ValueError("np.nan 是一个无效的文档,预期的字节或"

Sad*_*ngh 2 python pandas scikit-learn countvectorizer

我在 scikit-learn 中使用 CountVectorizer 对特征序列进行矢量化。当它给出如下错误时我被卡住了:ValueError: np.nan is an invalid document, expected byte or unicode string。

我正在拿一个包含两列内容和情绪的示例 csv 数据集。我的代码如下:

df = pd.read_csv("train.csv",encoding = "ISO-8859-1")
X, y = df.CONTENT, df.sentiment

X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=42)
print X_train, y_train

vect = CountVectorizer(ngram_range=(1,3), analyzer='word', encoding = "ISO-8859-1")
print vect
X=vect.fit_transform(X_train, y_train)
y=vect.fit(X_test) 
print vect.get_feature_names()
Run Code Online (Sandbox Code Playgroud)

我得到的错误是:

File "C:/Users/HP/cntVect.py", line 28, in <module>
    X=vect.fit_transform(X_train, y_train)

  File "C:\ProgramData\Anaconda2\lib\site-packages\sklearn\feature_extraction\text.py", line 839, in fit_transform
    self.fixed_vocabulary_)

  File "C:\ProgramData\Anaconda2\lib\site-packages\sklearn\feature_extraction\text.py", line 762, in _count_vocab
    for feature in analyze(doc):

  File "C:\ProgramData\Anaconda2\lib\site-packages\sklearn\feature_extraction\text.py", line 241, in <lambda>
    tokenize(preprocess(self.decode(doc))), stop_words)

  File "C:\ProgramData\Anaconda2\lib\site-packages\sklearn\feature_extraction\text.py", line 121, in decode
    raise ValueError("np.nan is an invalid document, expected byte or "

ValueError: np.nan is an invalid document, expected byte or unicode string.
Run Code Online (Sandbox Code Playgroud)

Max*_*axU 9

用空格替换 NaN - 这应该CountVectorizer很高兴:

X, y = df.CONTENT.fillna(' '), df.sentiment
Run Code Online (Sandbox Code Playgroud)

  • @SadhanaSingh 既然答案解决了您的问题,请*接受*(答案占用受访者宝贵的时间)-请参阅[当有人回答我的问题时我该怎么办?](https://stackoverflow.com/help/someone-答案) (3认同)