我在Amazon EMR上以Spark作为集群管理器运行spark。我正在尝试编写一个python应用程序,该应用程序启动并在内存中缓存数据。我如何允许其他python程序访问该缓存的数据,即
我启动一个应用程序Pcache->缓存数据并保持该应用程序运行。另一个用户可以访问运行不同实例的相同缓存数据。
我的理解是,应该可以对已经运行的sparkContext进行处理并访问该数据?那可能吗?还是我需要在该Spark App之上设置API来访问该数据。或者可以使用Livy的Spark Job Server之类的东西。