读取Amazon Kinesis Firehose流写入s3的数据

Question

读取Amazon Kinesis Firehose流写入s3的数据

lea*_*_21 14 json amazon-s3 amazon-kinesis amazon-kinesis-firehose

我正在写Kinesis Firehose流的记录,最终由Amazon Kinesis Firehose写入S3文件.

我的记录对象看起来像

ItemPurchase {
    String personId,
    String itemId
}

Run Code Online (Sandbox Code Playgroud)

数据写入S3看起来像:

{"personId":"p-111","itemId":"i-111"}{"personId":"p-222","itemId":"i-222"}{"personId":"p-333","itemId":"i-333"}

Run Code Online (Sandbox Code Playgroud)

没有COMMA分离.

像Json阵列一样没有启动支架

Run Code Online (Sandbox Code Playgroud)

没有结束支持,如在Json阵列中

Run Code Online (Sandbox Code Playgroud)

我想读取这些数据获取ItemPurchase对象的列表.

List<ItemPurchase> purchases = getPurchasesFromS3(IOUtils.toString(s3ObjectContent))

Run Code Online (Sandbox Code Playgroud)

读取此数据的正确方法是什么？

Answer 1

Tom*_*pin 8

令我感到困惑的是，Amazon Firehose以这种方式将JSON消息转储到S3，并且不允许您设置分隔符或其他任何内容。

最终，我发现解决该问题的技巧是使用JSON raw_decode方法处理文本文件

这将允许您读取一堆串联的JSON记录，而它们之间没有任何分隔符。

Python代码：

import json

decoder = json.JSONDecoder()

with open('giant_kinesis_s3_text_file_with_concatenated_json_blobs.txt', 'r') as content_file:

    content = content_file.read()

    content_length = len(content)
    decode_index = 0

    while decode_index < content_length:
        try:
            obj, decode_index = decoder.raw_decode(content, decode_index)
            print("File index:", decode_index)
            print(obj)
        except JSONDecodeError as e:
            print("JSONDecodeError:", e)
            # Scan forward and keep trying to decode
            decode_index += 1

Run Code Online (Sandbox Code Playgroud)

Answer 2

Xue*_*ang 5

我也有同样的问题,这是我如何解决的.

将"} {"替换为"} \n {"

由"\n"分割的行.

input_json_rdd.map(lambda x : re.sub("}{", "}\n{", x, flags=re.UNICODE))
              .flatMap(lambda line: line.split("\n"))

Run Code Online (Sandbox Code Playgroud)

嵌套的json对象有几个"}",因此用"}"分割线并不能解决问题.

我考虑过做类似的事情，但是我认为，如果JSON对象中的字符串之一恰好包含} {，那么该技术将会失效。也许，如果您遍历每个字符，如果您打了“”（表示输入或离开字符串），请切换一个布尔值，计算您所在的对象的级别（在字符串外部看到{时增加，在字符串外部看到}时减少字符串），然后将对象的末尾视为水平计数器再次达到0时。 (3认同)
分隔符 `}{` 是有问题的，因为内部字符串可以在其中包含 json，如下所示： `}{\"` （带有转义引号），因此使用 `}{"` 作为分隔符会更好一些，因为内部字符串可以'有引号 (2认同)

Answer 3

psy*_*ama 1

如果有办法改变数据写入方式，请用一行分隔所有记录。这样您就可以简单地逐行读取数据。如果没有，则只需构建一个以“}”作为分隔符的扫描仪对象并使用扫描仪进行读取。这样就可以完成任务了。

归档时间：	9 年，11 月前
查看次数：	6045 次
最近记录：	6 年，7 月前