jef*_*eon 33 python java machine-learning nltk mahout
我目前正在开展一个涉及爬行和处理大量数据(数百场演出)的项目,并挖掘它们以提取结构化数据,命名实体识别,重复数据删除,分类等.
我熟悉Java和Python世界的ML工具:Lingpipe,Mahout,NLTK等.但是,当涉及到选择这样一个大规模问题的平台时 - 我缺乏足够的经验来决定Java或Python .
我知道这听起来像一个模糊的问题,但我正在寻找关于选择Java或Python的一般建议.JVM提供了比Python更好的性能(?),但像Lingpipe等库是否与Python生态系统相匹配?如果我使用这个Python,那么扩展它并在多台机器上管理它会有多容易.
我应该选择哪一个?为什么?
Yav*_*var 18
随着Apache的出色表现,如Lucene/Solr/Nutch for Search,Mahout for Big Data Machine Learning,Hadoop for Map Reduce,OpenNLP for NLP,NoSQL等等.最好的部分是代表集成的大"I",这些产品可以很好地相互集成,当然在大多数情况下它们(这些产品)相互补充.
Python也很棒但是如果你从ASF考虑上面那么我会像Sean Owen一样使用Java.Python将始终可用于上述,但大多数情况下像Add on's而不是实际的东西.例如,您可以使用Streaming等使用Python来执行Hadoop.
我部分地从C++切换到Java,以便利用一些非常流行的Apache产品,如Lucene,Solr和OpenNLP以及其他流行的开源NoSQL Java产品,如Neo4j和OrientDB.
如果你正在寻找适合ML任务的NoSQL数据库,那么Neo4J是更准备(相对)并且能够处理BigData的产品之一,它是JAVA原生的,但是带有一个漂亮的REST API开箱即用,因此可以与您选择的平台集成.JAVA将为您提供性能优势.
| 归档时间: |
|
| 查看次数: |
12219 次 |
| 最近记录: |