添加numpy数组时避免溢出

阴永逸

2023-03-14

问题内容：

我想用datatyp uint8添加numpy数组。我知道这些数组中的值可能足够大，以至于发生溢出。所以我得到类似：

a = np.array([100, 200, 250], dtype=np.uint8)
b = np.array([50, 50, 50], dtype=np.uint8)
a += b

现在，a是[150 250 44]。但是，我希望让uint8太大的值成为uint8允许的最大值，而不是溢出。所以我想要的结果是[150 250 255]。

我可以使用以下代码获得此结果：

a = np.array([100, 200, 250], dtype=np.uint8)
b = np.array([50, 50, 50], dtype=np.uint8)
c = np.zeros((1,3), dtype=np.uint16)
c += a
c += b
c[c>255] = 255
a = np.array(c, dtype=np.uint8)

问题是我的数组很大，因此创建具有更大数据类型的第三个数组可能是内存问题。是否有一种快速且更节省内存的方式来实现上述结果？

问题答案：

您可以通过创建第三个dtype uint8数组和一个bool数组 ~~（这两个数组比一个uint16数组具有更高的内存效率）来实现此目的~~ 。

np.putmask
对于避免临时数组很有用。

a = np.array([100, 200, 250], dtype=np.uint8)
b = np.array([50, 50, 50], dtype=np.uint8)
c = 255 - b  # a temp uint8 array here
np.putmask(a, c < a, c)  # a temp bool array here
a += b

但是，正如@moarningsun正确指出的那样，布尔数组与uint8数组占用的内存量相同，因此不一定有帮助。可以通过 在任何给定时间
避免使用多个临时数组来解决此问题：

a = np.array([100, 200, 250], dtype=np.uint8)
b = np.array([50, 50, 50], dtype=np.uint8)
b = 255 - b  # old b is gone shortly after new array is created
np.putmask(a, b < a, b)  # a temp bool array here, then it's gone
a += 255 - b  # a temp array here, then it's gone

这种方法将内存消耗换成CPU。

另一种方法是 预先计算 所有可能的结果，即O（1）额外的内存（即独立于数组的大小）：

c = np.clip(np.arange(256) + np.arange(256)[..., np.newaxis], 0, 255).astype(np.uint8)
c
=> array([[  0,   1,   2, ..., 253, 254, 255],
          [  1,   2,   3, ..., 254, 255, 255],
          [  2,   3,   4, ..., 255, 255, 255],
          ..., 
          [253, 254, 255, ..., 255, 255, 255],
          [254, 255, 255, ..., 255, 255, 255],
          [255, 255, 255, ..., 255, 255, 255]], dtype=uint8)

c[a,b]
=> array([150, 250, 255], dtype=uint8)

如果您的阵列很大，这种方法是最有效的内存使用方法。同样，这在处理时间上很昂贵，因为它用较慢的2dim数组索引代替了超快速整数加法。

解释工作原理

c上面数组的构造利用了一个numpy广播技巧。将形状的(N,)数组和形状的(1,N)广播数组都添加为(N,N)类似，因此结果是所有可能和的NxN数组。然后，我们剪辑它。我们得到一个满足以下c[i,j]=min(i+j,255)条件的2dim数组：每个i，j。

然后剩下的就是使用花式索引来获取正确的值。使用您提供的输入，我们可以访问：

c[( [100, 200, 250] , [50, 50, 50] )]

第一个索引数组指的是第一个暗点，第二个索引数组指的是第二个暗点。因此，结果是一个与索引数组（(N,)）具有相同形状的数组，由值组成[ c[100,50] , c[200,50] , c[250,50] ]。

添加numpy数组时避免溢出

相关阅读

相关文章

相关问答

相关工具

相关文档