我正在用 python 为我的 Spark 代码编写一些单元测试。我的代码取决于spark-csv。在生产中我用来spark-submit --packages com.databricks:spark-csv_2.10:1.0.3提交我的 python 脚本。
我正在使用pytest在 Spark 模式下运行测试local:
conf = SparkConf().setAppName('myapp').setMaster('local[1]')
sc = SparkContext(conf=conf)
Run Code Online (Sandbox Code Playgroud)
我的问题是,由于pytest不使用spark-submit运行我的代码,我如何提供spark-csv对 python 进程的依赖?