没有返回值的多处理池?

Che*_*eng 2 python multiprocessing python-multithreading python-3.x

我正在尝试使用Pool没有返回值的多处理进行并行计算。如果不需要从子流程返回和检索值,它可能会更快。有没有办法做到这一点?

这是一个简单的例子:

from multiprocessing import Pool

def fun(a):
    # do something.. 
    a["1"]=100

a={
   "1":12
   }
multi = [a] * 10
p = Pool(4)
p.map(fun, multi)
data = [a["1"] for a in multi]
print(data)
>>> [12, 12, 12, 12, 12, 12, 12, 12, 12, 12]

[fun(a) for a in multi]
data = [a["1"] for a in multi]
print(data)
>>> [100, 100, 100, 100, 100, 100, 100, 100, 100, 100]
Run Code Online (Sandbox Code Playgroud)

有人知道为什么吗?有解决方案吗?

mat*_*ata 5

你的职能 fun

def fun(a):
    # do something.. 
    a["1"]=100
Run Code Online (Sandbox Code Playgroud)

更改可变参数a。但是,当您使用列表中的p.map(fun, multi)每个项目调用它时,都会multi被腌制,发送到工作进程并在那里发生变异。这不会对调用过程中列表中的原始项目产生任何影响。

您可以使用管理器创建可以在进程之间共享的数据结构,即所谓的代理对象。您必须创建 10 个共享词典。在您的示例中,您只有一个字典,该列表包含对它的 10 个引用,将始终仅包含相同的值,因为始终是同一个对象。data = [a["1"] for a in multi]a

所以这应该有效:

from multiprocessing import Pool, Manager
import random

def fun(a):
    # to show that the dictionaries are different
    a["1"] = random.random()

if __name__ == '__main__':
    m = Manager()
    p = Pool(4)
    multi = [m.dict() for _ in range(10)]
    p.map(fun, multi)
    data = [a["1"] for a in multi]
    print(data)
Run Code Online (Sandbox Code Playgroud)

请注意,multi = m.list([a] * 10)或类似的将不起作用,因为只有列表访问是同步的,而不是包含元素的更新。但是所有这些都会产生额外的 IPC 开销,并且如果可以的话,可能会比仅使用函数的返回值更糟。