我知道一些机器学习算法就像随机森林,它们本质上应该并行实现.我做家务并发现有这三个并行编程框架,所以我有兴趣知道这三种并行性之间的主要区别是什么?
特别是,如果有人能指点我一些研究比较它们之间的区别,那将是完美的!
请列出每个并行度的优缺点,谢谢
在RI希望对所有预测因子的多变量响应进行一些回归,对于单变量响应,我知道公式就像
y~., 这是使用所有预测变量来回归y,如果现在我面临100响应,我不能输入100 yi
y1+y2+y3...+y4~x,那么如何使用所有预测变量来回归多变量?
我已经编写了自己的hadoop程序,并且我可以在自己的笔记本电脑中使用伪分发模式运行,但是,当我将程序放在可以运行示例jar的hadoop的集群中时,它默认启动本地作业,虽然我指示了hdfs文件路径,下面是输出,给出建议?
./hadoop -jar MyRandomForest_oob_distance.jar hdfs://montana-01:8020/user/randomforest/input/genotype1.txt hdfs://montana-01:8020/user/randomforest/input/phenotype1.txt hdfs://montana-01:8020/user/randomforest/output1_distance/ hdfs://montana-01:8020/user/randomforest/input/genotype101.txt hdfs://montana-01:8020/user/randomforest/input/phenotype101.txt 33 500 1
12/03/16 16:21:25 INFO jvm.JvmMetrics: Initializing JVM Metrics with processName=JobTracker, sessionId=
12/03/16 16:21:25 WARN mapred.JobClient: Use GenericOptionsParser for parsing the arguments. Applications should implement Tool for the same.
12/03/16 16:21:25 INFO mapred.JobClient: Running job: job_local_0001
12/03/16 16:21:25 INFO mapred.MapTask: io.sort.mb = 100
12/03/16 16:21:25 INFO mapred.MapTask: data buffer = 79691776/99614720
12/03/16 16:21:25 INFO mapred.MapTask: record buffer = 262144/327680
12/03/16 16:21:25 WARN mapred.LocalJobRunner: job_local_0001
java.io.FileNotFoundException: File /user/randomforest/input/genotype1.txt does not exist. …Run Code Online (Sandbox Code Playgroud) 我检查了我的参考文献,在我看来,为了适应x和y的数据集,许多教程需要首先绘制x和y,然后拟合的线是图.正常程序如下:
## Calculate the fitted line
smoothingSpline = smooth.spline(tree_number[2:100], jaccard[1:99], spar=0.35)
plot(tree_number[2:100],jaccard[1:99]) #plot the data points
lines(smoothingSpline) # add the fitted spline line.
Run Code Online (Sandbox Code Playgroud)
但是,我不想绘制tree_number和jaccard,而是我只想在绘图中绘制拟合的样条线,我该怎么办?