ValueError:未知标签类型:数组([0.11],...)在制作额外树模型时

Question

ValueError:未知标签类型:数组([0.11],...)在制作额外树模型时

我试图在这个数据集上使用额外的树分类器,并且出于某种原因

model.fit(trainx,trainy)

Run Code Online (Sandbox Code Playgroud)

部分,它抛出了我

ValueError: Unknown label type: array([[ 0.11],
       [ 0.12],
       [ 0.64],
       [ 0.83],
       [ 0.33],
       [ 0.72],
       [ 0.49],

Run Code Online (Sandbox Code Playgroud)

错误.数组([0.11]是我的训练数据.我搜索了堆栈溢出,显然它是由于sklearn没有识别数据类型,但我已尝试过所有内容

trainy = np.asarray(trainy,dtype=float)
trainy=trainy.astype(float)

Run Code Online (Sandbox Code Playgroud)

即使类型(trainy)显示其numpy.ndarray,它也无法正常工作.任何人都能指出我在正确的方向吗？

这是代码:

import pandas as pd
import numpy as np
from sklearn.preprocessing import LabelEncoder
from sklearn import metrics
from sklearn.ensemble import ExtraTreesClassifier
from sklearn import cross_validation


def preProcess():
    df= pd.read_csv('C:/Users/X/Desktop/Managerial_and_Decision_Economics_2013_Video_Games_Dataset.csv',encoding ='ISO-8859-1')
    #drop non EA
    df = df[df['EA'] ==1]
    #change categorical variables
    le = LabelEncoder()
    nonnumeric_columns=['Console','Title','Publisher','Genre']
    for feature in nonnumeric_columns:
        df[feature] = le.fit_transform(df[feature])
    #set dataset and target variables
    dataset =df.ix[:, df.columns != 'US Sales (millions)']
    target = df['US Sales (millions)']

    trainx, testx, trainy, testy = cross_validation.train_test_split(
        dataset, target, test_size=0.3, random_state=0)
    #attempt to fix error?
    trainx=np.array(trainx)
    trainy = np.asarray(trainy, dtype="float")
    return trainx,testx,trainy,testy

def classifier():
    model =  ExtraTreesClassifier(n_estimators=250,
                              random_state=0)
    model.fit(trainx,trainy)
    return model.score(testx,testy)


trainx,testx,trainy,testy=preProcess()

Run Code Online (Sandbox Code Playgroud)

我在python 3.5上使用scikit-learn 0.17

Answer 1

Far*_*eer 7

你的标签[[0.11], [ 0.12],.....你应该使用ExtraTreesRegressor而不是ExtraTreesClassifier

源代码ForestClassifier:

 y : array-like, shape = [n_samples] or [n_samples, n_outputs]
            The target values (class labels in classification, real numbers in
            regression).

Run Code Online (Sandbox Code Playgroud)

归档时间：	9 年，10 月前
查看次数：	4288 次
最近记录：	8 年，10 月前