哪些工具或Web服务可用于机器文本转换.
例如
ENGLISH TEXT > SERVER or LIB > GERMAN TEXT
Run Code Online (Sandbox Code Playgroud)
图书馆也是可以接受的.
是谷歌的语言API只有一个?
我正在搜索服务器端应用程序(不是服务,我们需要自己托管),它可以获取给定的字符串并将其转换为另一种语言.开源,付费,没关系.
有人可以提供一些建议吗?
脉冲和递归神经网络都可以模拟时变信息.但我不确定哪种模型相对于计算成本更好.是否需要使用更复杂的推式神经网络,或者递归神经网络是否也需要更少的计算?脉冲网是否会更快收敛?
谢谢
我非常感谢您对以下问题的最佳方法的看法.我正在使用汽车分类列表示例,其性质类似于给出一个想法.
问题:从给定文本中提取数据元组.
以下是数据的一些特征.
文本中的词汇(单词)仅限于特定领域.让我们假设最多100-200个单词.
需要解析的文本是标题,如下面显示的汽车广告数据.所以每条记录对应一个元组(行).
在某些情况下,某些属性可能会丢失.因此,例如,在原始数据行#5中,缺少年份.
有些词汇(bigrams).喜欢"低里程".
可用的历史数据= 10,000条记录
传入的新数据量=每周1000-1500条记录
预期输出应采用(年,制,模型,特征)的形式.所以输出应该是这样的
1 - >(2009,Ford,Fusion,SE)
2 - >(1997,Ford,Taurus,Wagon)
3 - >(2000,Mitsubishi,Mirage,DE)
4 - >(2007,Ford,Expedition,EL Limited)
5 - >(,本田雅阁,EX)
....
....
原始标题数据:
1 - > 2009福特Fusion SE - 7000美元
2 - > 1997福特金牛座旅行车 - 800美元(圣东方)
3 - > '00三菱海市蜃楼DE - 2499美元(saratoga)图片
4 - > 2007福特Expedition EL限量版 - $ 7800(x)
5 - > Honda Accord ex low miles - $ 2800(dublin/pleasanton/livermore)pic
6 - > 2004 HONDA ODASSEY LX 68K MILES - $ 10800(danville/san …
我正在寻找一种构建单词层次结构的方法.
背景:我是一个"业余"自然语言处理爱好者,现在我感兴趣的一个问题是从一组单词中确定单词语义的层次结构.
例如,如果我有一个包含其他人的"超级"表示的集合,即
[cat, dog, monkey, animal, bird, ... ]
Run Code Online (Sandbox Code Playgroud)
我有兴趣使用任何技术,这些技术可以让我提取"动物"这个词,它具有该组中其他词语最有意义和最准确的表示.
注意:它们的含义不同.猫!=狗!=猴子!=动物但是猫是动物的一个子集,而狗是动物的子集.
我知道现在很多人会告诉我使用wordnet.好吧,我会尝试,但我实际上有兴趣做一个特定领域的WordNet不适用的领域,因为:1)Wordnet中找不到大多数单词2)所有单词都是另一种语言; 翻译是可能的,但效果有限.
另一个例子是:
[ noise reduction, focal length, flash, functionality, .. ]
Run Code Online (Sandbox Code Playgroud)
因此功能包括此集合中的所有内容.
我也试过抓取维基百科页面并在td-idf等上应用一些技术,但维基百科页面也没有做太多.
有人可能会告诉我我的研究应朝哪个方向发展吗?(我可以使用任何东西)
Named Entity Extraction (extract ppl, cities, organizations)
Content Tagging (extract topic tags by scanning doc)
Structured Data Extraction
Topic Categorization (taxonomy classification by scanning doc....bayesian )
Text extraction (HTML page cleaning)
Run Code Online (Sandbox Code Playgroud)
我可以使用哪些库来完成NLP的上述任何功能吗?
真的不想向AlchemyAPI出钱
我正在做一个大学项目,必须收集和组合用户提供的主题数据.我遇到的问题是许多术语的Google搜索结果都被低质量的自动生成页面污染,如果我使用它们,我最终会得到错误的事实.如何评估页面的质量/可信度?
您可能会认为"不,Google工程师正在解决这个问题已有10年了,他正在寻求解决方案",但如果您考虑一下,SE必须提供最新的内容,如果它标记为一个好的页面是一个坏的一,用户会不满意.我没有这样的限制,所以如果算法意外地将某些好页面标记为坏,那就不会有问题了.
这是一个例子:说输入是buy aspirin in south la.尝试谷歌搜索它.前三个结果已从网站中删除,但第四个结果很有趣:( radioteleginen.ning.com/profile/BuyASAAspirin我不想创建一个活动链接)
这是文本的第一段:
目前,在美国购买加拿大处方药的情况很少.这是因为在美国,处方药价格飙升,使那些收入有限或集中收入的人购买他们急需的药物变得艰难.美国人为他们的药物支付的费用高于班上的任何人.
文本的其余部分类似,然后是相关关键字列表.这就是我认为的低质量页面.虽然这个特定的文本似乎有意义(除了它太可怕了),我见过的其他例子(现在还找不到)只是一些垃圾,其目的是让一些用户从谷歌获得并在创作后一天被禁止.
我正在使用libsvm,文档让我相信有一种方法可以输出输出分类准确性的可信概率.是这样吗?如果是这样,任何人都可以提供一个如何在代码中执行此操作的明确示例吗?
目前,我正在以下列方式使用Java库
SvmModel model = Svm.svm_train(problem, parameters);
SvmNode x[] = getAnArrayOfSvmNodesForProblem();
double predictedValue = Svm.svm_predict(model, x);
Run Code Online (Sandbox Code Playgroud) ......或性别信息是否足够?更具体地说,我有兴趣知道我是否可以减少斯坦福Core NLP加载的模型数量来提取核心参考.我对实际的命名实体识别不感兴趣.
谢谢
nlp ×7
java ×2
libraries ×1
libsvm ×1
numerical ×1
probability ×1
quadratic ×1
regex ×1
server-side ×1
solver ×1
spam ×1
stanford-nlp ×1
svm ×1
translation ×1
web-services ×1
wordnet ×1