我是Spark的新手.我的输入文件包含训练数据4000x1800.当我尝试训练此数据(编写python)时出现以下错误:
14/11/15 22:39:13错误PythonRDD:Python工作人员意外退出(崩溃)java.net.SocketException:连接由peer重置:socket write error
org.apache.spark.SparkException:作业因阶段失败而中止:阶段0.0中的任务0失败1次,最近失败:阶段0.0中丢失的任务0.0(TID 0,本地主机):java.net.SocketException:连接重置by peer:套接字写错误
使用spark 1.1.0.任何建议都会有很大帮助.
码:
from pyspark.mllib.classification import SVMWithSGD
from pyspark.mllib.regression import LabeledPoint
from pyspark.mllib.linalg import Vectors
from pyspark import SparkContext
from pyspark import SparkConf, SparkContext
from numpy import array
#Train the model using feature matrix
# Load and parse the data
def parsePoint(line):
values = [float(x) for x in line.split(' ')]
return LabeledPoint(values[0], values[1:])
#create spark Context
conf = (SparkConf()
.setMaster("local")
.setAppName("My app")
.set("spark.executor.memory", "1g"))
sc = SparkContext(conf = conf)
data = sc.textFile("myfile.txt") …Run Code Online (Sandbox Code Playgroud) 我是Boost的新手.我有以下结构,并希望使用Boost将其存储在共享内存中.
struct InData{
int x,y,h,w;
char* lbl;
};
Run Code Online (Sandbox Code Playgroud)
反过来,这个结构将存储在Vector中.大多数示例都讨论了Vectors的int或string数据类型.我想如果有人可以举例说明如何将用户定义的数据类型存储到boost共享内存中.