Ben*_*Ben 5 python scikit-learn
我正在尝试使用scikit-learn CountVectorizer来计算字符2克,忽略空格.在文档它提到的参数,analyzer其中规定
该功能是否应由单词或字符n-gram组成.选项'char_wb'仅从字边界内的文本创建字符n-gram.
但是,"char_wb"似乎不像我预期的那样工作.例如:
corpus = [
"The blue dog Blue",
"Green the green cat",
"The green mouse",
]
# CountVectorizer character 2-grams with word boundaries
vectorizer = CountVectorizer(analyzer='char_wb', ngram_range=(2, 2), min_df=1)
X = vectorizer.fit_transform(corpus)
vectorizer.get_feature_names()
[' b',
' c',
' d',
' g',
' m',
' t',
'at',
'bl',
'ca', ....
Run Code Online (Sandbox Code Playgroud)
注意像'b'这样的例子,它们包含一个空格.是什么赋予了?
| 归档时间: |
|
| 查看次数: |
1958 次 |
| 最近记录: |