Pandas DataFrame:为什么我不能通过行迭代基于另一列的值来更改一列的值?

Vic*_*ang 2 python series pandas

我想根据另一列的值更改一列的值。例如,给定以下DF:

   Freq TOC
1    10  NA
2    20  NA
3    30  NA

for index, row in df.iterrows():
    if row["Freq"] == 20:
        row["TOC"] = True
Run Code Online (Sandbox Code Playgroud)

我期望:

   Freq TOC
1    10  NA
2    20  True
3    30  NA
Run Code Online (Sandbox Code Playgroud)

但是什么都没有改变。怎么了?谢谢。

DYZ*_*DYZ 6

您修改行的“副本”,而不是行本身。

一般来说,不应使用循环来修改数据帧。相反,诉诸向量化操作:

df.loc[df["Freq"]==20, "TOC"] = True
Run Code Online (Sandbox Code Playgroud)

  • 这是一个技术性但很重要的一点,请注意“行的副本”对于数据帧几乎没有意义。数据按列组织。例如,以一行数字和文本类型给出一个 `object` dtype 系列。这是一种低效的转换,而不是一种高效的复制。 (2认同)
  • @jpp 同意。我会引用“复制”这个词。 (2认同)

jpp*_*jpp 6

pd.DataFrame.iterrows在Python级循环中为每行返回一个序列,而不是对数据框的动态链接。更有效的是,您可以使用按列矢量化的方法来代替按行循环(这假定您对满意1 == True):

df['TOC'] = np.where(df['Freq'] == 20, True, np.nan)
Run Code Online (Sandbox Code Playgroud)

更习惯的是分配一个布尔序列,即True/ False值:

df['TOC'] = df['Freq'] == 20
Run Code Online (Sandbox Code Playgroud)

有效的方法是利用循环中的索引,尽管这样做效率不高:

for index, row in df.iterrows():
    if row['Freq'] == 20:
        df.loc[index, 'TOC'] = True
Run Code Online (Sandbox Code Playgroud)

  • `df['TOC'] = df['Freq'] == 20` 将剩余的行重置为 `False`,这似乎不是 OP 的意图。 (2认同)
  • `np.where` 会将 `True` 值强制为 `1.0`,因此您的第一种方法并不能完全满足 OP 的预期。 (2认同)
  • @coldspeed,当然,添加了免责声明。 (2认同)