小编Sta*_*ark的帖子

Azure Function:运行/测试模式下出现 500 内部服务器错误

我想使用 Azure Apps 功能运行/测试模式来测试我的 azure 函数,但它抛出“500 内部服务器错误”。我能够在本地环境中调试相同的代码,但是当在天蓝色门户上触发相同的代码时,它会失败,没有任何正确的错误日志。 在此输入图像描述 此 Azure 函数将从事件中心读取 json 格式数据并将其写入 blob 存储。我正在使用 python 进行 azure 函数开发。这是代码 :init.py

from typing import List
import logging
import os
import azure.functions as func
from azure.storage.blob import BlobClient
import datetime
import json

storage_connection_string = os.getenv('storage_connection_string_FromKeyVault')

container_name = os.getenv('storage_container_name_FromKeyVault')

today = datetime.datetime.today()


def main(events: List[func.EventHubEvent]):
    for event in events:
        a = event.get_body().decode('utf-8')
        json.loads(a)
        logging.info('Python EventHub trigger processed an event: %s', a)
        logging.info(f'  SequenceNumber = {event.sequence_number}')
        logging.info(f'  Offset = {event.offset}')

        blob_client =  BlobClient.from_connection_string(storage_connection_string, container_name, …
Run Code Online (Sandbox Code Playgroud)

python azure-eventhub azure-functions

10
推荐指数
1
解决办法
4万
查看次数

Azure Databricks:如何在 Databricks 群集中添加 Spark 配置

我正在使用 Spark Databricks 集群,并且想要添加自定义 Spark 配置。
有一个关于此的 Databricks 文档,但我没有得到任何线索,我应该如何以及进行哪些更改。有人可以分享配置 Databricks 集群的示例吗?
有没有办法查看Databricks集群中Spark的默认配置。

apache-spark databricks azure-databricks

7
推荐指数
1
解决办法
2万
查看次数

Databricks Spark:java.lang.OutOfMemoryError:超出了 GC 开销限制

我正在 Databricks 集群中执行 Spark 作业。我通过 Azure 数据工厂管道触发该作业,它以 15 分钟的间隔执行,因此在它successful execution of three or four times失败并抛出异常之后"java.lang.OutOfMemoryError: GC overhead limit exceeded"。虽然上述问题有很多答案,但在大多数情况下,他们的作业没有运行,但在我的情况下,在成功执行一些先前的作业后,它会失败。我的数据大小仅不到 20 MB。

我的集群配置是: Databricks集群配置

所以我的问题是我应该在服务器配置中进行哪些更改。如果问题出在我的代码上,那么为什么它大多数时候都能成功。请给我建议并提出解决方案。

apache-spark databricks azure-databricks

5
推荐指数
1
解决办法
7262
查看次数

Spark:解析数据帧同一列中不同格式的日期/时间戳(MM-dd-yyyy HH:mm、MM/dd/yy H:mm)

问题是:我有一个数据集,其中一列具有两种或多种日期格式。一般来说,我选择所有值作为字符串类型,然后使用to_date来解析日期。但我不知道如何解析具有两种或多种日期格式的列。

val DF= Seq(("02-04-2020 08:02"),("03-04-2020 10:02"),("04-04-2020 09:00"),("04/13/19 9:12"),("04/14/19 2:13"),("04/15/19 10:14"), ("04/16/19 5:15")).toDF("DOB")

import org.apache.spark.sql.functions.{to_date, to_timestamp}
val DOBDF = DF.withColumn("Date", to_date($"DOB", "MM/dd/yyyy"))

Run Code Online (Sandbox Code Playgroud)

上述命令的输出:

null
null
null
0019-04-13
0019-04-14
0019-04-15
0019-04-16
Run Code Online (Sandbox Code Playgroud)

我编写的上面的代码不适用于该格式MM/dd/yyyy,并且未提供我将其null作为输出提供的格式。

因此寻求帮助来解析具有不同日期格式的文件。如果可能的话,还请分享一些处理日期格式的教程或注释。请注意:我使用 Scala 作为 Spark 框架。

提前致谢。

datetime scala date apache-spark apache-spark-sql

3
推荐指数
1
解决办法
4784
查看次数

如何在 Spark (Scala) 中获取带前导零的整数值

我有 Spark 数据框,并尝试向其中添加年、月和日列。但问题是添加 YTD 列后,它不会保留日期和月份列的前导零。

val cityDF= Seq(("Delhi","India"),("Kolkata","India"),("Mumbai","India"),("Nairobi","Kenya"),("Colombo","Srilanka"),("Tibet","China")).toDF("City","Country")
val dateString = "2020-01-01"
val dateCol = org.apache.spark.sql.functions.to_date(lit(dateString))
val finaldf = cityDF.select($"*", year(dateCol).alias("Year"), month(dateCol).alias("Month"), dayofmonth(dateCol).alias("Day"))
Run Code Online (Sandbox Code Playgroud)

输出截图

我想保留“月”和“日”列中的前导零,但它给我的结果为 1 而不是 01。
因为我使用年月日期列来创建 Spark 分区。所以我想保持前导零完整。所以我的问题是:如何在数据框列中保留前导零。

scala apache-spark apache-spark-sql

2
推荐指数
1
解决办法
3732
查看次数