小编kun*_*dan的帖子

如何培养一个以pos-tag序列为特征的朴素贝叶斯分类器?

我有两类句子.每个都有相当明显的pos标签序列.如何训练以POS-Tag序列为特征的Naive-Bayes分类器?Stanford CoreNLP/NLTK(Java或Python)是否提供了使用pos-tag作为特征构建分类器的任何方法?我知道在python中NaiveBayesClassifier允许构建一个NB分类器,但它使用contains-a-wordas作为功能,但它可以扩展为使用pos-tag-sequence作为功能吗?

machine-learning nltk stanford-nlp text-classification naivebayes

6
推荐指数
1
解决办法
2100
查看次数

从时间轴获取推文的问题,因为Twitter没有返回'next_results'

我正在尝试使用此处演示的max_id字段从Twitter时间线获取推文next_results.(带有next_results的Twython搜索API)

对于大多数查询,我得到了所需数量(500+)的推文,但对于一些我得到的推文少于200条.

在查看返回的内容时,next_results我发现在返回100条推文之后,响应的next_results字段缺失.查询主题不能只有200条推文,因为我在热门时搜索此主题,在Twitter上我可以看到超过200条推文.

还有其他人也面临这个问题.有没有解决方法?

下面是输出,在第二个响应'next_results'中缺少字段.

TEST_PROGRAM >> Calling twitter to get tweets for  #TheWorstLieEver

{u'count': 100, u'completed_in': 0.066, u'max_id_str': u'432942833725497345', u'since_id_str': u'0', **u'next_results': u'?max_id=432540545630494719&q=%23TheWorstLieEver&count=100&include
_entities=1&result_type=mixed'**, u'refresh_url': u'?since_id=432942833725497345&q=%23TheWorstLieEver&result_type=mixed&include_entities=1', u'since_id': 0, u'query': u'%23TheWorstLieEver
', u'max_id': 432942833725497345L}

{u'count': 100, u'completed_in': 0.111, u'max_id_str': u'432540545630494719', u'since_id_str': u'0', u'refresh_url': u'?since_id=432540545630494719&q=%23TheWorstLieEver&result_type=mixe
d&include_entities=1', u'since_id': 0, u'query': u'%23TheWorstLieEver', u'max_id': 432540545630494719L}
Run Code Online (Sandbox Code Playgroud)

twitter twython tweepy

5
推荐指数
1
解决办法
630
查看次数