如何并行运行脚本的 x 个实例?

Chr*_*ris 6 bash parallelism gnu-parallel

我有一个脚本,我总是希望并行运行“x”个实例。

代码看起来像这样:

for A in 
do
  for B in
  do
    (script1.sh $A $B;script2.sh $A $B) &
  done #B
done #A
Run Code Online (Sandbox Code Playgroud)

脚本本身运行数据库查询,因此它将受益于并行运行。问题是

1)“等待”不起作用(因为它完成了所有后台作业并开始了新作业(即使我包含一个线程计数器),这浪费了大量时间。

2)我不知道如何并行做到这一点。我只找到了多次运行相同脚本但没有使用不同参数的示例。

3)替代解决方案是:

for A in 
do
  for B in
  do
    while threadcount>X 
    do
      sleep 60
    done
    (script1.sh $A $B;script2.sh $A $B) &
  done #B
done #A
Run Code Online (Sandbox Code Playgroud)

但我并没有真正弄清楚如何使线程数可靠。

非常欢迎一些指向正确方向的提示。


我很想使用并行,但事情就像文档告诉我的那样不起作用。

我愿意

parallel echo ::: A B C ::: D E F
Run Code Online (Sandbox Code Playgroud)

(来自文档)它告诉我

parallel: Input is read from the terminal. Only experts do this on purpose. Press CTRL-D to exit.
Run Code Online (Sandbox Code Playgroud)

这只是手册页的最简单示例。

Ole*_*nge 9

使用 GNU Parallel 它看起来像这样:

parallel script1.sh {}';' script2.sh {} ::: a b c ::: d e f
Run Code Online (Sandbox Code Playgroud)

它将为每个 CPU 生成一个作业。

GNU Parallel 是一个通用的并行器,可以很容易地在同一台机器或您可以 ssh 访问的多台机器上并行运行作业。它通常可以代替for循环。

如果您有 32 个不同的作业要在 4 个 CPU 上运行,一个直接的并行化方法是在每个 CPU 上运行 8 个作业:

简单的调度

GNU Parallel 会在完成后生成一个新进程 - 保持 CPU 处于活动状态,从而节省时间:

GNU 并行调度

安装

如果没有为您的发行版打包 GNU Parallel,您可以进行个人安装,这不需要 root 访问权限。这样做可以在 10 秒内完成:

(wget -O - pi.dk/3 || curl pi.dk/3/ || fetch -o - http://pi.dk/3) | bash
Run Code Online (Sandbox Code Playgroud)

有关其他安装选项,请参阅http://git.savannah.gnu.org/cgit/parallel.git/tree/README

了解更多

查看更多示例:http : //www.gnu.org/software/parallel/man.html

观看介绍视频:https : //www.youtube.com/playlist? list =PL284C9FF2488BC6D1

演练教程:http : //www.gnu.org/software/parallel/parallel_tutorial.html

注册电子邮件列表以获得支持:https : //lists.gnu.org/mailman/listinfo/parallel