我想使用 Azure Apps 功能运行/测试模式来测试我的 azure 函数,但它抛出“500 内部服务器错误”。我能够在本地环境中调试相同的代码,但是当在天蓝色门户上触发相同的代码时,它会失败,没有任何正确的错误日志。
此 Azure 函数将从事件中心读取 json 格式数据并将其写入 blob 存储。我正在使用 python 进行 azure 函数开发。这是代码
:init.py
from typing import List
import logging
import os
import azure.functions as func
from azure.storage.blob import BlobClient
import datetime
import json
storage_connection_string = os.getenv('storage_connection_string_FromKeyVault')
container_name = os.getenv('storage_container_name_FromKeyVault')
today = datetime.datetime.today()
def main(events: List[func.EventHubEvent]):
for event in events:
a = event.get_body().decode('utf-8')
json.loads(a)
logging.info('Python EventHub trigger processed an event: %s', a)
logging.info(f' SequenceNumber = {event.sequence_number}')
logging.info(f' Offset = {event.offset}')
blob_client = BlobClient.from_connection_string(storage_connection_string, container_name, …Run Code Online (Sandbox Code Playgroud) 我正在使用 Spark Databricks 集群,并且想要添加自定义 Spark 配置。
有一个关于此的 Databricks 文档,但我没有得到任何线索,我应该如何以及进行哪些更改。有人可以分享配置 Databricks 集群的示例吗?
有没有办法查看Databricks集群中Spark的默认配置。
我正在 Databricks 集群中执行 Spark 作业。我通过 Azure 数据工厂管道触发该作业,它以 15 分钟的间隔执行,因此在它successful execution of three or four times失败并抛出异常之后"java.lang.OutOfMemoryError: GC overhead limit exceeded"。虽然上述问题有很多答案,但在大多数情况下,他们的作业没有运行,但在我的情况下,在成功执行一些先前的作业后,它会失败。我的数据大小仅不到 20 MB。
所以我的问题是我应该在服务器配置中进行哪些更改。如果问题出在我的代码上,那么为什么它大多数时候都能成功。请给我建议并提出解决方案。
问题是:我有一个数据集,其中一列具有两种或多种日期格式。一般来说,我选择所有值作为字符串类型,然后使用to_date来解析日期。但我不知道如何解析具有两种或多种日期格式的列。
val DF= Seq(("02-04-2020 08:02"),("03-04-2020 10:02"),("04-04-2020 09:00"),("04/13/19 9:12"),("04/14/19 2:13"),("04/15/19 10:14"), ("04/16/19 5:15")).toDF("DOB")
import org.apache.spark.sql.functions.{to_date, to_timestamp}
val DOBDF = DF.withColumn("Date", to_date($"DOB", "MM/dd/yyyy"))
Run Code Online (Sandbox Code Playgroud)
上述命令的输出:
null
null
null
0019-04-13
0019-04-14
0019-04-15
0019-04-16
Run Code Online (Sandbox Code Playgroud)
我编写的上面的代码不适用于该格式MM/dd/yyyy,并且未提供我将其null作为输出提供的格式。
因此寻求帮助来解析具有不同日期格式的文件。如果可能的话,还请分享一些处理日期格式的教程或注释。请注意:我使用 Scala 作为 Spark 框架。
提前致谢。
我有 Spark 数据框,并尝试向其中添加年、月和日列。但问题是添加 YTD 列后,它不会保留日期和月份列的前导零。
val cityDF= Seq(("Delhi","India"),("Kolkata","India"),("Mumbai","India"),("Nairobi","Kenya"),("Colombo","Srilanka"),("Tibet","China")).toDF("City","Country")
val dateString = "2020-01-01"
val dateCol = org.apache.spark.sql.functions.to_date(lit(dateString))
val finaldf = cityDF.select($"*", year(dateCol).alias("Year"), month(dateCol).alias("Month"), dayofmonth(dateCol).alias("Day"))
Run Code Online (Sandbox Code Playgroud)
我想保留“月”和“日”列中的前导零,但它给我的结果为 1 而不是 01。
因为我使用年月日期列来创建 Spark 分区。所以我想保持前导零完整。所以我的问题是:如何在数据框列中保留前导零。