Dus*_*nt 5 apache-spark pyspark pyspark-sql
我在Amazon EMR上以Spark作为集群管理器运行spark。我正在尝试编写一个python应用程序,该应用程序启动并在内存中缓存数据。我如何允许其他python程序访问该缓存的数据,即
我启动一个应用程序Pcache->缓存数据并保持该应用程序运行。另一个用户可以访问运行不同实例的相同缓存数据。
我的理解是,应该可以对已经运行的sparkContext进行处理并访问该数据?那可能吗?还是我需要在该Spark App之上设置API来访问该数据。或者可以使用Livy的Spark Job Server之类的东西。
无法在多个进程之间共享 SparkContext。事实上,您的选择是自己构建 API,用一台服务器保存 SparkContext 及其客户端告诉它如何处理它,或者使用 Spark Job Server(它是相同的通用实现)。
| 归档时间: |
|
| 查看次数: |
831 次 |
| 最近记录: |