我在使用PyTables存储numpy csr_matrix时遇到问题.我收到这个错误:
TypeError: objects of type ``csr_matrix`` are not supported in this context, sorry; supported objects are: NumPy array, record or scalar; homogeneous list or tuple, integer, float, complex or string
Run Code Online (Sandbox Code Playgroud)
我的代码:
f = tables.openFile(path,'w')
atom = tables.Atom.from_dtype(self.count_vector.dtype)
ds = f.createCArray(f.root, 'count', atom, self.count_vector.shape)
ds[:] = self.count_vector
f.close()
Run Code Online (Sandbox Code Playgroud)
有任何想法吗?
谢谢
我在理解上一版斯坦福NLP工具中对coref解析器所做的更改时遇到了一些麻烦.例如,下面是一个句子和相应的CorefChainAnnotation:
The atom is a basic unit of matter, it consists of a dense central nucleus surrounded by a cloud of negatively charged electrons.
{1=[1 1, 1 2], 5=[1 3], 7=[1 4], 9=[1 5]}
Run Code Online (Sandbox Code Playgroud)
我不确定我理解这些数字的含义.查看源代码也没有任何帮助.
谢谢
我正在使用scikit-learn来集中文本文档.我正在使用CountVectorizer,TfidfTransformer和MiniBatchKMeans这两个类来帮助我做到这一点.新文本文档一直添加到系统中,这意味着我需要使用上面的类来转换文本并预测集群.我的问题是:我应该如何将数据存储在磁盘上?我应该简单地挑选矢量化器,变换器和kmeans对象吗?我应该保存数据吗?如果是这样,我如何将它添加回矢量器,变换器和kmeans对象?
任何帮助将不胜感激
我正在使用k-means聚类来分组一组新闻.我使用词袋模型来表示文档,更具体地说,每个文档都表示为术语频率向量.
我的问题:如何在不重新计算所有术语频率向量的情况下添加新文档(看到包含所有文档的所有术语的词汇表都会发生变化)?
我想存储TF-IDF矩阵,所以我不必一直重新计算它.我正在使用scikit-learn's TfIdfVectorizer.腌制它或将其存储在数据库中是否更有效?
一些上下文:我使用k-means聚类来提供文档推荐.由于经常添加新文档,我想存储文档的TF-IDF值,以便我可以重新计算集群.
有没有办法使用scikit-learn执行顺序k-means聚类?我似乎找不到合适的方法来添加新数据,而无需重新拟合所有数据.
谢谢
python ×4
scikit-learn ×3
data-mining ×2
nlp ×2
hdf5 ×1
java ×1
numpy ×1
pickle ×1
pytables ×1
scipy ×1
stanford-nlp ×1