相关疑难解决方法(0)

Numpy hstack - "ValueError:所有输入数组必须具有相同数量的维度" - 但它们确实如此

我想加入两个numpy数组.在一个文本中运行TF-IDF后,我有一组列/功能.在另一个我有一个列/功能是一个整数.所以我读了一列火车和测试数据,在这上面运行TF-IDF,然后我想添加另一个整数列,因为我认为这将有助于我的分类器更准确地了解它应该如何表现.

不幸的是,当我尝试运行hstack将此单列添加到我的其他numpy数组时,我在标题中收到错误.

这是我的代码:

  #reading in test/train data for TF-IDF
  traindata = list(np.array(p.read_csv('FinalCSVFin.csv', delimiter=";"))[:,2])
  testdata = list(np.array(p.read_csv('FinalTestCSVFin.csv', delimiter=";"))[:,2])

  #reading in labels for training
  y = np.array(p.read_csv('FinalCSVFin.csv', delimiter=";"))[:,-2]

  #reading in single integer column to join
  AlexaTrainData = p.read_csv('FinalCSVFin.csv', delimiter=";")[["alexarank"]]
  AlexaTestData = p.read_csv('FinalTestCSVFin.csv', delimiter=";")[["alexarank"]]
  AllAlexaAndGoogleInfo = AlexaTestData.append(AlexaTrainData)

  tfv = TfidfVectorizer(min_df=3,  max_features=None, strip_accents='unicode',  
        analyzer='word',token_pattern=r'\w{1,}',ngram_range=(1, 2), use_idf=1,smooth_idf=1,sublinear_tf=1) #tf-idf object
  rd = lm.LogisticRegression(penalty='l2', dual=True, tol=0.0001, 
                             C=1, fit_intercept=True, intercept_scaling=1.0, 
                             class_weight=None, random_state=None) #Classifier
  X_all = traindata + testdata #adding test and train data to put into …
Run Code Online (Sandbox Code Playgroud)

python arrays numpy pandas scikit-learn

17
推荐指数
2
解决办法
4万
查看次数

标签 统计

arrays ×1

numpy ×1

pandas ×1

python ×1

scikit-learn ×1