映射pandas数据帧中的值范围

E. *_*mer 5 python dataframe pandas

如果之前有人问过这个问题,我会道歉,但我看起来很广泛而没有结果.

import pandas as pd    
import numpy as np    
df = pd.DataFrame(data = np.random.randint(1,10,10),columns=['a'])    

   a
0  7
1  8
2  8
3  3
4  1
5  1
6  2
7  8
8  6
9  6
Run Code Online (Sandbox Code Playgroud)

我想根据一些规则创建一个新的列b来映射几个值a,比如a = [1,2,3]是1,a = [4,5,6,7]是2,a = [8 ,9,10]是3.一对一的映射对我来说很清楚,但是如果我想通过值列表或范围进行映射呢?

我沿着这些方向努力......

df['b'] = df['a'].map({[1,2,3]:1,range(4,7):2,[8,9,10]:3})
Run Code Online (Sandbox Code Playgroud)

jpp*_*jpp 11

还有一些选择.

熊猫通过pd.cut/ NumPy vianp.digitize

您可以构建边界列表,然后使用专业库函数.这在@ EdChum的解决方案中以及在此答案中都有描述.

NumPy通过 np.select

df = pd.DataFrame(data=np.random.randint(1,10,10), columns=['a'])

criteria = [df['a'].between(1, 3), df['a'].between(4, 7), df['a'].between(8, 10)]
values = [1, 2, 3]

df['b'] = np.select(criteria, values, 0)
Run Code Online (Sandbox Code Playgroud)

元素criteria是布尔系列,因此对于值列表,您可以使用df['a'].isin([1, 3])等.

字典映射通过 range

d = {range(1, 4): 1, range(4, 8): 2, range(8, 11): 3}

df['c'] = df['a'].apply(lambda x: next((v for k, v in d.items() if x in k), 0))

print(df)

   a  b  c
0  1  1  1
1  7  2  2
2  5  2  2
3  1  1  1
4  3  1  1
5  5  2  2
6  4  2  2
7  4  2  2
8  9  3  3
9  3  1  1
Run Code Online (Sandbox Code Playgroud)


EdC*_*ica 7

您可以使用IIUC cut实现此目的:

In[33]:
pd.cut(df['a'], bins=[0,3,7,11], right=True, labels=False)+1

Out[33]: 
0    2
1    3
2    3
3    1
4    1
5    1
6    1
7    3
8    2
9    2
Run Code Online (Sandbox Code Playgroud)

在这里你将截止值传递给cut,并且这将对你的值进行分类,通过传递labels=False它将给它们一个序数值(从零开始)所以你只是+1对它们

在这里你可以看到如何计算削减:

In[34]:
pd.cut(df['a'], bins=[0,3,7,11], right=True)

Out[34]: 
0     (3, 7]
1    (7, 11]
2    (7, 11]
3     (0, 3]
4     (0, 3]
5     (0, 3]
6     (0, 3]
7    (7, 11]
8     (3, 7]
9     (3, 7]
Name: a, dtype: category
Categories (3, interval[int64]): [(0, 3] < (3, 7] < (7, 11]]
Run Code Online (Sandbox Code Playgroud)