我在使用Spark的缓存机制时遇到了内存管理问题。我目前正在将Encoders 与 Kryo 结合使用,想知道切换到 beans 是否可以帮助我减少缓存数据集的大小。
基本上,在使用 s 时,使用 beans 相对于 Kryo 序列化有哪些优缺点Encoder?有任何性能改进吗?Dataset除了使用 SER 选项进行缓存之外,还有其他方法可以压缩缓存吗?
作为记录,我发现了一个类似的主题来处理两者之间的比较。然而,它没有详细讨论这个比较。
java memory-management apache-spark apache-spark-dataset apache-spark-encoders