小编Mru*_*jay的帖子

Apache Spark:大型数据集的pyspark崩溃

我是Spark的新手.我的输入文件包含训练数据4000x1800.当我尝试训练此数据(编写python)时出现以下错误:

  1. 14/11/15 22:39:13错误PythonRDD:Python工作人员意外退出(崩溃)java.net.SocketException:连接由peer重置:socket write error

  2. org.apache.spark.SparkException:作业因阶段失败而中止:阶段0.0中的任务0失败1次,最近失败:阶段0.0中丢失的任务0.0(TID 0,本地主机):java.net.SocketException:连接重置by peer:套接字写错误

使用spark 1.1.0.任何建议都会有很大帮助.

码:

 from pyspark.mllib.classification import SVMWithSGD
    from pyspark.mllib.regression import LabeledPoint
    from pyspark.mllib.linalg import Vectors 
    from pyspark import SparkContext
    from pyspark import SparkConf, SparkContext
    from numpy import array


    #Train the model using feature matrix
    # Load and parse the data
    def parsePoint(line):
        values = [float(x) for x in line.split(' ')]
        return LabeledPoint(values[0], values[1:])

    #create spark Context
    conf = (SparkConf()
         .setMaster("local")
         .setAppName("My app")
         .set("spark.executor.memory", "1g"))
    sc = SparkContext(conf = conf)

    data = sc.textFile("myfile.txt") …
Run Code Online (Sandbox Code Playgroud)

apache-spark

13
推荐指数
2
解决办法
1万
查看次数

Boost共享内存中的结构和向量

我是Boost的新手.我有以下结构,并希望使用Boost将其存储在共享内存中.

struct InData{
    int x,y,h,w;
    char* lbl;
};
Run Code Online (Sandbox Code Playgroud)

反过来,这个结构将存储在Vector中.大多数示例都讨论了Vectors的int或string数据类型.我想如果有人可以举例说明如何将用户定义的数据类型存储到boost共享内存中.

boost shared-memory

5
推荐指数
1
解决办法
709
查看次数

标签 统计

apache-spark ×1

boost ×1

shared-memory ×1