use*_*136 0 python for-loop apache-spark rdd pyspark
我是PySpark的新手,我想了解如何在PySpark中编写多个嵌套for循环,下面是粗略的高级示例.任何帮助将不胜感激.
for ( i=0;i<10;i++)
for ( j=0;j<10;j++)
for ( k=0;k<10;k++)
{
print "i"."j"."k"
}
Run Code Online (Sandbox Code Playgroud)
在非分布式设置中,使用foreach组合器重写for循环,但由于Spark性质,map并且flatMap是更好的选择:
from __future__ import print_function
a_loop = lambda x: ((x, y) for y in xrange(10))
print_me = lambda ((x, y), z): print("{0}.{1}.{2}".format(x, y, z)))
(sc.
parallelize(xrange(10)).
flatMap(a_loop).
flatMap(a_loop).
foreach(print_me)
Run Code Online (Sandbox Code Playgroud)
使用itertools.product:
from itertools import product
sc.parallelize(product(xrange(10), repeat=3)).foreach(print)
Run Code Online (Sandbox Code Playgroud)
| 归档时间: |
|
| 查看次数: |
5343 次 |
| 最近记录: |