为什么在“__main__”中导入模块不允许 multiprocessig 使用模块?

pas*_*uce 5 python multiprocessing python-2.7 arcpy

我已经通过将导入移到顶部声明来解决我的问题,但它让我想知道:为什么我不能使用'__main__'在作为目标的函数中导入的模块multiprocessing?

例如:

import os
import multiprocessing as mp

def run(in_file, out_dir, out_q):
    arcpy.RaterToPolygon_conversion(in_file, out_dir, "NO_SIMPIFY", "Value")
    status = str("Done with "+os.path.basename(in_file))
    out_q.put(status, block=False)

if __name__ == '__main__':
    raw_input("Program may hang, press Enter to import ArcPy...")
    import arcpy

    q = mp.Queue()
    _file = path/to/file
    _dir = path/to/dir
    # There are actually lots of files in a loop to build
    # processes but I just do one for context here
    p = mp.Process(target=run, args=(_file, _dir, q))
    p.start()

# I do stuff with Queue below to status user
Run Code Online (Sandbox Code Playgroud)

当您在 IDLE 中运行它时,它根本不会出错……只是继续Queue检查(这很好,所以不是问题)。问题是,当您在 CMD 终端(OS 或 Python)中运行它时,它会产生arcpy未定义的错误!

只是一个好奇的话题。

tde*_*ney 7

在类unix系统和Windows中情况有所不同。在 unixy 系统上,multiprocessing用于fork创建共享父内存空间的写时复制视图的子进程。子级可以看到来自父级的导入,包括父级在 下导入的任何内容if __name__ == "__main__":。

在windows上,没有fork,必须执行一个新进程。但简单地重新运行父进程是行不通的——它会再次运行整个程序。相反,multiprocessing运行自己的 python 程序,导入父主脚本,然后 pickles/unpickles 父对象空间的视图,希望这对于子进程来说足够了。

该程序是__main__子进程的程序,__main__父脚本的程序不运行。主脚本就像其他模块一样被导入。原因很简单:运行父程序__main__只会再次运行完整的父程序,这是mp必须避免的。

这是一个测试来显示发生了什么。一个被调用的主模块testmp.py和一个test2.py由第一个模块导入的第二个模块。

测试mp.py

import os
import multiprocessing as mp

print("importing test2")
import test2

def worker():
    print('worker pid: {}, module name: {}, file name: {}'.format(os.getpid(), 
        __name__, __file__))

if __name__ == "__main__":
    print('main pid: {}, module name: {}, file name: {}'.format(os.getpid(), 
        __name__, __file__))
    print("running process")
    proc = mp.Process(target=worker)
    proc.start()
    proc.join()
Run Code Online (Sandbox Code Playgroud)

测试2.py

import os

print('test2 pid: {}, module name: {}, file name: {}'.format(os.getpid(),
        __name__, __file__))
Run Code Online (Sandbox Code Playgroud)

当在Linux上运行时,test2被导入一次,并且worker在主模块中运行。

importing test2
test2 pid: 17840, module name: test2, file name: /media/td/USB20FD/tmp/test2.py
main pid: 17840, module name: __main__, file name: testmp.py
running process
worker pid: 17841, module name: __main__, file name: testmp.py
Run Code Online (Sandbox Code Playgroud)

在 Windows 下,请注意“importing test2”打印了两次 - testmp.py 运行了两次。但“main pid”仅打印一次 - 它__main__没有运行。这是因为在导入期间multiprocessing将模块名称更改为。__mp_main__

E:\tmp>py testmp.py
importing test2
test2 pid: 7536, module name: test2, file name: E:\tmp\test2.py
main pid: 7536, module name: __main__, file name: testmp.py
running process
importing test2
test2 pid: 7544, module name: test2, file name: E:\tmp\test2.py
worker pid: 7544, module name: __mp_main__, file name: E:\tmp\testmp.py
Run Code Online (Sandbox Code Playgroud)