小编dmc*_*cer的帖子

Java的QP求解器

我正在寻找一个易于使用的基于Java的二次规划(QP)求解器.

谷歌搜索我遇到了ojAlgo(http://ojalgo.org).

但是,我想知道是否还有其他/更好的选择.

java numerical mathematical-optimization quadratic solver

6
推荐指数
1
解决办法
6419
查看次数

自动文本翻译

哪些工具或Web服务可用于机器文本转换.

例如

ENGLISH TEXT > SERVER or LIB > GERMAN TEXT
Run Code Online (Sandbox Code Playgroud)

图书馆也是可以接受的.

谷歌的语言API只有一个?

nlp web-services machine-learning machine-translation

5
推荐指数
1
解决办法
2087
查看次数

用于翻译语言的服务器端软件?

我正在搜索服务器端应用程序(不是服务,我们需要自己托管),它可以获取给定的字符串并将其转换为另一种语言.开源,付费,没关系.

有人可以提供一些建议吗?

translation nlp server-side machine-translation

5
推荐指数
1
解决办法
1249
查看次数

脉冲(尖峰)神经网络是否优于复发神经网络?

脉冲和递归神经网络都可以模拟时变信息.但我不确定哪种模型相对于计算成本更好.是否需要使用更复杂的推式神经网络,或者递归神经网络是否也需要更少的计算?脉冲网是否会更快收敛?

谢谢

artificial-intelligence machine-learning neural-network

5
推荐指数
1
解决办法
501
查看次数

帮助:从文本中提取数据元组...正则表达式或机器学习?

我非常感谢您对以下问题的最佳方法的看法.我正在使用汽车分类列表示例,其性质类似于给出一个想法.

问题:从给定文本中提取数据元组.

以下是数据的一些特征.

  1. 文本中的词汇(单词)仅限于特定领域.让我们假设最多100-200个单词.

  2. 需要解析的文本是标题,如下面显示的汽车广告数据.所以每条记录对应一个元组(行).

  3. 在某些情况下,某些属性可能会丢失.因此,例如,在原始数据行#5中,缺少年份.

  4. 有些词汇(bigrams).喜欢"低里程".

  5. 可用的历史数据= 10,000条记录

  6. 传入的新数据量=每周1000-1500条记录

预期输出应采用(年,制,模型,特征)的形式.所以输出应该是这样的

1 - >(2009,Ford,Fusion,SE)
2 - >(1997,Ford,Taurus,Wagon)
3 - >(2000,Mitsubishi,Mirage,DE)
4 - >(2007,Ford,Expedition,EL Limited)
5 - >(,本田雅阁,EX)
....
....

原始标题数据:


1 - > 2009福特Fusion SE - 7000美元
2 - > 1997福特金牛座旅行车 - 800美元(圣东方)
3 - > '00三菱海市蜃楼DE - 2499美元(saratoga)图片
4 - > 2007福特Expedition EL限量版 - $ 7800(x)
5 - > Honda Accord ex low miles - $ 2800(dublin/pleasanton/livermore)pic
6 - > 2004 HONDA ODASSEY LX 68K MILES - $ 10800(danville/san …

regex nlp classification machine-learning data-extraction

5
推荐指数
1
解决办法
2694
查看次数

意义层次

我正在寻找一种构建单词层次结构的方法.

背景:我是一个"业余"自然语言处理爱好者,现在我感兴趣的一个问题是从一组单词中确定单词语义的层次结构.

例如,如果我有一个包含其他人的"超级"表示的集合,即

[cat, dog, monkey, animal, bird, ... ]
Run Code Online (Sandbox Code Playgroud)

我有兴趣使用任何技术,这些技术可以让我提取"动物"这个词,它具有该组中其他词语最有意义和最准确的表示.

注意:它们的含义不同.猫!=狗!=猴子!=动物但是猫是动物的一个子集,而狗是动物的子集.

我知道现在很多人会告诉我使用wordnet.好吧,我会尝试,但我实际上有兴趣做一个特定领域的WordNet不适用的领域,因为:1)Wordnet中找不到大多数单词2)所有单词都是另一种语言; 翻译是可能的,但效果有限.

另一个例子是:

[ noise reduction, focal length, flash, functionality, .. ]
Run Code Online (Sandbox Code Playgroud)

因此功能包括此集合中的所有内容.

我也试过抓取维基百科页面并在td-idf等上应用一些技术,但维基百科页面也没有做太多.

有人可能会告诉我我的研究应朝哪个方向发展吗?(我可以使用任何东西)

nlp machine-learning wordnet

4
推荐指数
1
解决办法
586
查看次数

有关以下自然语言处理条款的详细信息?

Named Entity Extraction (extract ppl, cities, organizations)
Content Tagging (extract topic tags by scanning doc)
Structured Data Extraction
Topic Categorization (taxonomy classification by scanning doc....bayesian )
Text extraction (HTML page cleaning)
Run Code Online (Sandbox Code Playgroud)

我可以使用哪些库来完成NLP的上述任何功能吗?

真的不想向AlchemyAPI出钱

text-processing nlp libraries

4
推荐指数
1
解决办法
447
查看次数

如何估算网页的质量?

我正在做一个大学项目,必须收集和组合用户提供的主题数据.我遇到的问题是许多术语的Google搜索结果都被低质量的自动生成页面污染,如果我使用它们,我最终会得到错误的事实.如何评估页面的质量/可信度?

您可能会认为"不,Google工程师正在解决这个问题已有10年了,他正在寻求解决方案",但如果您考虑一下,SE必须提供最新的内容,如果它标记为一个好的页面是一个坏的一,用户会不满意.我没有这样的限制,所以如果算法意外地将某些好页面标记为坏,那就不会有问题了.

这是一个例子:说输入是buy aspirin in south la.尝试谷歌搜索它.前三个结果已从网站中删除,但第四个结果很有趣:( radioteleginen.ning.com/profile/BuyASAAspirin我不想创建一个活动链接)

这是文本的第一段:

目前,在美国购买加拿大处方药的情况很少.这是因为在美国,处方药价格飙升,使那些收入有限或集中收入的人购买他们急需的药物变得艰难.美国人为他们的药物支付的费用高于班上的任何人.

文本的其余部分类似,然后是相关关键字列表.这就是我认为的低质量页面.虽然这个特定的文本似乎有意义(除了它太可怕了),我见过的其他例子(现在还找不到)只是一些垃圾,其目的是让一些用户从谷歌获得并在创作后一天被禁止.

nlp information-retrieval machine-learning spam

4
推荐指数
1
解决办法
327
查看次数

如何使用libsvm计算多类预测的概率?

我正在使用libsvm,文档让我相信有一种方法可以输出输出分类准确性的可信概率.是这样吗?如果是这样,任何人都可以提供一个如何在代码中执行此操作的明确示例吗?

目前,我正在以下列方式使用Java库

    SvmModel model = Svm.svm_train(problem, parameters);
    SvmNode x[] = getAnArrayOfSvmNodesForProblem();
    double predictedValue = Svm.svm_predict(model, x);
Run Code Online (Sandbox Code Playgroud)

java machine-learning probability svm libsvm

4
推荐指数
1
解决办法
4820
查看次数

Coreference解析需要NER吗?

......或性别信息是否足够?更具体地说,我有兴趣知道我是否可以减少斯坦福Core NLP加载的模型数量来提取核心参考.我对实际的命名实体识别不感兴趣.

谢谢

nlp named-entity-recognition stanford-nlp

4
推荐指数
1
解决办法
1102
查看次数