小编pns*_*lva的帖子

在HDF5(PyTables)中存储numpy稀疏矩阵

我在使用PyTables存储numpy csr_matrix时遇到问题.我收到这个错误:

TypeError: objects of type ``csr_matrix`` are not supported in this context, sorry; supported objects are: NumPy array, record or scalar; homogeneous list or tuple, integer, float, complex or string
Run Code Online (Sandbox Code Playgroud)

我的代码:

f = tables.openFile(path,'w')

atom = tables.Atom.from_dtype(self.count_vector.dtype)
ds = f.createCArray(f.root, 'count', atom, self.count_vector.shape)
ds[:] = self.count_vector
f.close()
Run Code Online (Sandbox Code Playgroud)

有任何想法吗?

谢谢

python numpy hdf5 scipy pytables

21
推荐指数
3
解决办法
6039
查看次数

斯坦福核心NLP - 理解共指解析

我在理解上一版斯坦福NLP工具中对coref解析器所做的更改时遇到了一些麻烦.例如,下面是一个句子和相应的CorefChainAnnotation:

The atom is a basic unit of matter, it consists of a dense central nucleus surrounded by a cloud of negatively charged electrons.

{1=[1 1, 1 2], 5=[1 3], 7=[1 4], 9=[1 5]}
Run Code Online (Sandbox Code Playgroud)

我不确定我理解这些数字的含义.查看源代码也没有任何帮助.

谢谢

java nlp stanford-nlp

15
推荐指数
2
解决办法
1万
查看次数

在sklearn中保留数据

我正在使用scikit-learn来集中文本文档.我正在使用CountVectorizer,TfidfTransformer和MiniBatchKMeans这两个类来帮助我做到这一点.新文本文档一直添加到系统中,这意味着我需要使用上面的类来转换文本并预测集群.我的问题是:我应该如何将数据存储在磁盘上?我应该简单地挑选矢量化器,变换器和kmeans对象吗?我应该保存数据吗?如果是这样,我如何将它添加回矢量器,变换器和kmeans对象?

任何帮助将不胜感激

python machine-learning data-mining scikit-learn

5
推荐指数
1
解决办法
2660
查看次数

将新术语添加到词袋模型中

我正在使用k-means聚类来分组一组新闻.我使用词袋模型来表示文档,更具体地说,每个文档都表示为术语频率向量.

我的问题:如何在不重新计算所有术语频率向量的情况下添加新文档(看到包含所有文档的所有术语的词汇表都会发生变化)?

nlp cluster-analysis machine-learning data-mining

3
推荐指数
1
解决办法
402
查看次数

坚持Tf-Idf数据

我想存储TF-IDF矩阵,所以我不必一直重新计算它.我正在使用scikit-learn's TfIdfVectorizer.腌制它或将其存储在数据库中是否更有效?

一些上下文:我使用k-means聚类来提供文档推荐.由于经常添加新文档,我想存储文档的TF-IDF值,以便我可以重新计算集群.

python machine-learning pickle scikit-learn

3
推荐指数
1
解决办法
1743
查看次数

使用scikit-learn的顺序k均值聚类

有没有办法使用scikit-learn执行顺序k-means聚类?我似乎找不到合适的方法来添加新数据,而无需重新拟合所有数据.

谢谢

python cluster-analysis machine-learning scikit-learn

1
推荐指数
1
解决办法
4403
查看次数