Pandas:计算数据框中重复条目的平均值

DDR*_*Rpy 10 python pandas

我一直在使用python和pandas中的数据框,其中包含第一列中的重复条目.数据框看起来像这样:

    sample_id    qual    percent
0   sample_1      10        20
1   sample_2      20        30
2   sample_1      50        60
3   sample_2      10        90
4   sample_3      100       20
Run Code Online (Sandbox Code Playgroud)

我想写一些标识第一列中重复条目的东西,并计算后续列的平均值.理想的输出类似于以下内容:

    sample_id    qual    percent
0   sample_1      30        40
1   sample_2      15        60
2   sample_3      100       20
Run Code Online (Sandbox Code Playgroud)

我整个下午一直在努力解决这个问题,并感谢任何帮助.

piR*_*red 22

groupbysample_id列和使用mean

df.groupby('sample_id').mean().reset_index()
要么
df.groupby('sample_id', as_index=False).mean()

我懂了

在此输入图像描述


小智 5

Groupby 会起作用。

data.groupby('sample_id').mean()
Run Code Online (Sandbox Code Playgroud)

然后您可以使用它reset_index()来使外观完全符合您的要求。