numpy - 将非连续数据转换为适当的连续数据

mgi*_*son 6 python numpy

请考虑以下代码:

import numpy as np
a = np.zeros(50)
a[10:20:2] = 1
b = c = a[10:40:4]
print b.flags  # You'll see that b and c are not C_CONTIGUOUS or F_CONTIGUOUS
Run Code Online (Sandbox Code Playgroud)

我的问题:

有没有办法(只有参考b)来制作bc连续?如果在此操作之后np.may_share_memory(b,a)返回,则完全正常False.

接近但不太合理的事情是: np.ascontiguousarray/ np.asfortranarray因为它们会返回一个阵列.


我的用例是我有一个非常大的3D字段存储在a的子类中numpy.ndarray.为了节省内存,我想将这些字段切换到我实际感兴趣处理的域的部分:

a = a[ix1:ix2,iy1:iy2,iz1:iz2]
Run Code Online (Sandbox Code Playgroud)

对子类进行切片比切片ndarray对象更受限制,但这应该有效,它将"做正确的事" - 子类上附加的各种自定义元数据将按预期进行转换/保留.不幸的是,由于这会返回a view,numpy之后不会释放大数组,所以我实际上并没有在这里保存任何内存.

要完全清楚,我希望完成两件事:

  • 保留我的类实例上的元数据.切片会起作用,但我不确定其他形式的复制.
  • 使它成为原始数组可以自由收集垃圾

unu*_*tbu 6

Alex Martelli表示:

"确保大量但临时使用内存的唯一真正可靠的方法就是在完成后将所有资源返回给系统,就是在子进程中进行这种使用,这会使内存耗尽的工作终止."

但是,以下内容似乎释放了至少一些内存:警告:我测量可用内存的方式是特定于Linux的:

import time
import numpy as np

def free_memory():
    """
    Return free memory available, including buffer and cached memory
    """
    total = 0
    with open('/proc/meminfo', 'r') as f:
        for line in f:
            line = line.strip()
            if any(line.startswith(field) for field in ('MemFree', 'Buffers', 'Cached')):
                field, amount, unit = line.split()
                amount = int(amount)
                if unit != 'kB':
                    raise ValueError(
                        'Unknown unit {u!r} in /proc/meminfo'.format(u=unit))
                total += amount
    return total

def gen_change_in_memory():
    """
    https://stackoverflow.com/a/14446011/190597 (unutbu)
    """
    f = free_memory()
    diff = 0
    while True:
        yield diff
        f2 = free_memory()
        diff = f - f2
        f = f2
change_in_memory = gen_change_in_memory().next
Run Code Online (Sandbox Code Playgroud)

在分配大型数组之前:

print(change_in_memory())
# 0

a = np.zeros(500000)
a[10:20:2] = 1
b = c = a[10:40:4]
Run Code Online (Sandbox Code Playgroud)

分配大数组后:

print(change_in_memory())
# 3844 # KiB

a[:len(b)] = b
b = a[:len(b)]
a.resize(len(b), refcheck=0)
time.sleep(1)
Run Code Online (Sandbox Code Playgroud)

调整大小后可用内存增加:

print(change_in_memory())
# -3708 # KiB
Run Code Online (Sandbox Code Playgroud)

  • 哇噢!这工作:) - 它仍然失败的领域是从其他领域计算抱怨该字段不拥有它自己的数据,等等,等等,等等.但可以成为另一个问题的主题. (2认同)

HYR*_*YRY 3

您可以在 cython 中执行此操作:

In [1]:
%load_ext cythonmagic

In [2]:
%%cython
cimport numpy as np

np.import_array()

def to_c_contiguous(np.ndarray a):
    cdef np.ndarray new
    cdef int dim, i
    new = a.copy()
    dim = np.PyArray_NDIM(new)
    for i in range(dim):
        np.PyArray_STRIDES(a)[i] = np.PyArray_STRIDES(new)[i]
    a.data = new.data
    np.PyArray_UpdateFlags(a, np.NPY_C_CONTIGUOUS)
    np.set_array_base(a, new)

In [8]:
import sys
import numpy as np
a = np.random.rand(10, 10, 10)
b = c = a[::2, 1::3, 2::4]
d = a[::2, 1::3, 2::4]
print sys.getrefcount(a)
to_c_contiguous(b)
print sys.getrefcount(a)
print np.all(b==d)
Run Code Online (Sandbox Code Playgroud)

输出是:

4
3
True
Run Code Online (Sandbox Code Playgroud)

to_c_contiguous(a)将创建 的 c_contigious 副本a,并将其作为 的基础a

调用后to_c_contiguous(b),a的refcount会减少,当a的refcount变为0时,a就会被释放。