我很想知道为什么我收到这个错误?我已经从网站beezid.com(carousel.js)文件中完全复制了它,我正在尝试将它们与我们网站上的相同幻灯片更新它.正如您所看到的那样,我遇到了问题?他们的网站没有提出这个错误?
carousel.js:26未捕获的ReferenceError:未定义类
Carousel = Class.create(Abstract, {
initialize: function (scroller, slides, controls, options) {
this.scrolling = false;
this.scroller = $(scroller);
this.slides = slides;
this.controls = controls;
this.menu = false;
this.menuTitleLen = 20;
Run Code Online (Sandbox Code Playgroud) 我给了样本表.我想从每个组"源"列的"值"列中获取中值.其中source列的String DataType值列为double DataType
scala> sqlContext.sql("SELECT * from tTab order by source").show
+---------------+-----+
| Source|value|
+---------------+-----+
|131.183.222.110| 1.0|
| 131.183.222.85| 1.0|
| 131.183.222.85| 0.0|
| 131.183.222.85| 0.5|
| 131.183.222.85| 1.0|
| 131.183.222.85| 1.0|
| 43.230.146.7| 0.0|
| 43.230.146.7| 1.0|
| 43.230.146.7| 1.0|
| 43.230.146.8| 1.0|
| 43.230.146.8| 1.0|
+---------------+-----+
scala> tTab.printSchema
root
|-- Source: string (nullable = true)
|-- value: double (nullable = true)
Run Code Online (Sandbox Code Playgroud)
预期答案:
+---------------+-----+
| Source|value|
+---------------+-----+
|131.183.222.110| 1.0|
| 131.183.222.85| 1.0|
| 43.230.146.7| 1.0|
| 43.230.146.8| 1.0|
+---------------+-----+ …Run Code Online (Sandbox Code Playgroud) 我找不到只参与rdd. take看起来很有希望,但它返回一个list而不是rdd. 我当然可以将其转换为rdd,但这似乎既浪费又丑陋。
my_rdd = sc.textFile("my_file.csv")
part_of_my_rdd = sc.parallelize(my_rdd.take(10000))
Run Code Online (Sandbox Code Playgroud)
我有更好的方法来做到这一点吗?
我正在尝试使用Spark 2.0中的新东西将一些代码从Spark 1.6移植到Spark 2.0.首先,我想使用Spark 2.0的csv阅读器.顺便说一下,我正在使用pyspark.
使用"旧" textFile功能,我可以设置最小分区数.例如:
file= sc.textFile('/home/xpto/text.csv', minPartitions=10)
header = file.first() #extract header
data = file.filter(lambda x:x !=header) #csv without header
...
Run Code Online (Sandbox Code Playgroud)
现在,使用Spark 2.0,我可以直接读取csv:
df = spark.read.csv('/home/xpto/text.csv', header=True)
...
Run Code Online (Sandbox Code Playgroud)
但我没有找到一种方法来设置minPartitions.
我需要这个来测试我的代码的性能.
谢谢,弗雷德
我有一个enum和这样的struct定义:
typedef enum
{
MONDAY = 1,
TUESDAY,
WEDNESDAY
} ThreeDays;
typedef struct
{
int hello;
ThreeDays day;
} Weekday;
static Weekday weekday = { 1, 2};
Run Code Online (Sandbox Code Playgroud)
然后我在lint中得到以下错误:
Error 64: Type mismatch (initialization) (int/enum)
Run Code Online (Sandbox Code Playgroud)
这个错误的原因是什么?我该如何纠正?
我正在使用python尝试使用spark计算单词计数问题.但是当我尝试使用.saveAsTextFile命令将输出RDD保存在文本文件中时,我遇到了问题.这是我的代码.请帮我.我被卡住了.感谢您的时间.
import re
from pyspark import SparkConf , SparkContext
def normalizewords(text):
return re.compile(r'\W+',re.UNICODE).split(text.lower())
conf=SparkConf().setMaster("local[2]").setAppName("sorted result")
sc=SparkContext(conf=conf)
input=sc.textFile("file:///home/cloudera/PythonTask/sample.txt")
words=input.flatMap(normalizewords)
wordsCount=words.map(lambda x: (x,1)).reduceByKey(lambda x,y: x+y)
sortedwordsCount=wordsCount.map(lambda (x,y):(y,x)).sortByKey()
results=sortedwordsCount.collect()
for result in results:
count=str(result[0])
word=result[1].encode('ascii','ignore')
if(word):
print word +"\t\t"+ count
results.saveAsTextFile("/var/www/myoutput")
Run Code Online (Sandbox Code Playgroud) 我有一个类型DataFrame很多的列str,我想将一个函数应用于所有这些列,而不重命名它们或添加更多列,我尝试使用for-in循环执行withColumn(参见下面的示例),但通常在我运行代码时,它显示了Stack Overflow(它很少有效),这DataFrame根本不大,它只有~15000条记录.
# df is a DataFrame
def lowerCase(string):
return string.strip().lower()
lowerCaseUDF = udf(lowerCase, StringType())
for (columnName, kind) in df.dtypes:
if(kind == "string"):
df = df.withColumn(columnName, lowerCaseUDF(df[columnName]))
df.select("Tipo_unidad").distinct().show()
Run Code Online (Sandbox Code Playgroud)
完整的错误很长,因此我决定只粘贴一些行.但是你可以在这里找到完整的跟踪
Py4JJavaError:调用o516.showString时发生错误.:org.apache.spark.SparkException:作业因阶段失败而中止:阶段2.0中的任务1失败4次,最近失败:阶段2.0中丢失的任务1.3(TID 38,worker2.mcbo.mood.com.ve): java.io.ObjectInputStream中的java.lang.StackOverflowError $ BlockDataInputStream.readByte(ObjectInputStream.java:2774)
我认为这个问题产生的原因是这个代码启动了许多工作(每个类型一个string),你能告诉我另一个选择或我做错了吗?
python user-defined-functions apache-spark apache-spark-sql pyspark
我有这个Ajax代码来提交PHP表单.代码工作,但我希望<div>内容应该更改为刷新而不会刷新整个页面.
div的ID是#container.
这是AJAX代码:
$('.accept_friend').submit(function(){
var data = $(this).serialize();
$.ajax({
url: "../accept_friend.php",
type: "POST",
data: data,
success: function( data )
{
//here is the code I want to refresh the div(#container)
},
error: function(){
alert('ERROR');
}
});
return false;
});
Run Code Online (Sandbox Code Playgroud) 我加载了一个数据集
val data = sc.textFile("/home/kybe/Documents/datasets/img.csv",defp)
Run Code Online (Sandbox Code Playgroud)
我想在这个数据上放一个索引
val nb = data.count.toInt
val tozip = sc.parallelize(1 to nb).repartition(data.getNumPartitions)
val res = tozip.zip(data)
Run Code Online (Sandbox Code Playgroud)
不幸的是我有以下错误
Can only zip RDDs with same number of elements in each partition
Run Code Online (Sandbox Code Playgroud)
如果可能的话,我怎么能按分区修改元素的数量?
我有以下内容DataSet,具有以下结构。
case class Person(age: Int, gender: String, salary: Double)
Run Code Online (Sandbox Code Playgroud)
我想通过和来确定平均工资,因此我将这两个关键字归为一组。我遇到了两个主要问题,一个是两个键混合在一个键中,但我想将它们放在两个不同的列中,另一个是该列的名称很傻,我不知道该怎么做。使用将该文件重命名(显然,将不起作用)。genderageDSaggregatedasaliasDS API
val df = sc.parallelize(List(Person(100000.00, "male", 27),
Person(120000.00, "male", 27),
Person(95000, "male", 26),
Person(89000, "female", 31),
Person(250000, "female", 51),
Person(120000, "female", 51)
)).toDF.as[Person]
df.groupByKey(p => (p.gender, p.age)).agg(typed.avg(_.salary)).show()
+-----------+------------------------------------------------------------------------------------------------+
| key| TypedAverage(line2503618a50834b67a4b132d1b8d2310b12.$read$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC$Person)|
+-----------+------------------------------------------------------------------------------------------------+
|[female,31]| 89000.0...
|[female,51]| 185000.0...
| [male,27]| 110000.0...
| [male,26]| 95000.0...
+-----------+------------------------------------------------------------------------------------------------+
Run Code Online (Sandbox Code Playgroud)