如何计算熊猫时间序列中"事件"之间的时间(天数)?例如,如果我有以下时间序列,我想在系列中的每一天知道自上次以来已经过了多少天TRUE
event
2010-01-01 False
2010-01-02 True
2010-01-03 False
2010-01-04 False
2010-01-05 True
2010-01-06 False
Run Code Online (Sandbox Code Playgroud)
我做的方式似乎过于复杂,所以我希望有更优雅的东西.显然,迭代遍历行的for循环可行,但我正在寻找理想的矢量化(可扩展)解决方案.我目前的尝试如下:
date_range = pd.date_range('2010-01-01', '2010-01-06')
df = pd.DataFrame([False, True, False, False, True, False], index=date_range, columns=['event'])
event_dates = df.index[df['event']]
df2 = pd.DataFrame(event_dates, index=event_dates, columns=['max_event_date'])
df = df.join(df2)
df['max_event_date'] = df['max_event_date'].cummax(axis=0, skipna=False)
df['days_since_event'] = df.index - df['max_event_date']
event max_event_date days_since_event
2010-01-01 False NaT NaT
2010-01-02 True 2010-01-02 0 days
2010-01-03 False 2010-01-02 1 days
2010-01-04 False 2010-01-02 2 days
2010-01-05 True 2010-01-05 0 days
2010-01-06 False 2010-01-05 1 days
Run Code Online (Sandbox Code Playgroud)
继续改进这个答案,并希望有人采用'the'pythonic方式.在那之前,我认为最终的更新效果最好.
last = pd.to_datetime(np.nan)
def elapsed(row):
if not row.event:
return row.name - last
else:
global last
last = row.name
return row.name-last
df['elapsed'] = df.apply(elapsed,axis=1)
df
event elapsed
2010-01-01 False NaT
2010-01-02 True 0 days
2010-01-03 False 1 days
2010-01-04 False 2 days
2010-01-05 True 0 days
2010-01-06 False 1 days
Run Code Online (Sandbox Code Playgroud)
:::::::::::::
留下以前的答案,尽管它们不是最佳的
:::::::::
而不是进行多次传递,似乎更容易循环索引
df['elapsed'] = 0
for i in df.index[1:]:
if not df['event'][i]:
df['elapsed'][i] = df['elapsed'][i-1] + 1
Run Code Online (Sandbox Code Playgroud)
::::::::::::
让我们说'特鲁斯'是你感兴趣的事件.
trues = df[df.event==True]
trues.Dates = trues.index #need this because .diff() doesn't work on the index
trues.Elapsed = trues.Dates.diff()
Run Code Online (Sandbox Code Playgroud)
| 归档时间: |
|
| 查看次数: |
2896 次 |
| 最近记录: |