我读过Spark Structured Streaming不支持将Kafka消息作为JSON读取的模式推断.有没有办法像Spark Streaming那样检索模式:
val dataFrame = spark.read.json(rdd.map(_.value()))
dataFrame.printschema
Run Code Online (Sandbox Code Playgroud) 我正在尝试通过以下方式将 *.gz 文件加载到 Clickhouse:clickhouse-client --max_memory_usage=15323460608 --format_csv_delimiter="|" --query="插入 tmp1.my_test)表格式 CSV"
我收到错误: Code: 210. DB::NetException: Connection Reset by Peer, while写入套接字 (127.0.0.1:9000) 。
clickhouse-server.log 、 clickhouse-server.err.log 或 Zookeeper.log 中没有错误
当我运行插入命令时,我看到内存几乎达到了服务器的限制(32Gb),这就是为什么我尝试通过 max_memory_usage 限制它,同样的错误
有任何想法吗?提前致谢