我想从 Pandas 数据帧中的列自动创建一个元组(将传递给 scipy.stats 函数),以便元组的每一行都是数据帧每一列的值。这是我的数据帧的标题:
4_3-a-0 5_3-a-4 7_3-a-3
datetime_pac
2015-09-03 22:00:00 -100.4 -96.857143 -55.000000
2015-09-03 22:01:00 -100.5 -91.700000 -55.600000
2015-09-03 22:02:00 -100.4 -90.875000 -55.900000
2015-09-03 22:03:00 -100.4 -94.000000 -55.555556
2015-09-03 22:04:00 -100.5 -99.500000 -55.545455
Run Code Online (Sandbox Code Playgroud)
我可以像这样手动实现:
from scipy import stats
stats.f_oneway(df.ix[:,0], df.ix[:,1], df.ix[:,2])
Run Code Online (Sandbox Code Playgroud)
但我想在数据框中列数未知的情况下“自动化”它。以下尝试(以及许多变体)将不起作用:
stats.f_oneway(tuple(x) for x in xtmp.values)
stats.f_oneway((xtmp[x]) for x in xtmp.columns)
Run Code Online (Sandbox Code Playgroud)
谢谢你的帮助!
我已经看到了几个解决我的问题的解决方案
但到目前为止他们还没有帮助我成功.
我相信以下解决方案是我需要的,但继续得到一个错误(我没有声誉点评论/问题):链接
(我收到以下错误,但在管理以下命令时我不明白在哪里.copy()或添加" inplace=True" df2=df.groupby('install_site').transform(replace):
SettingWithCopyWarning:尝试在DataFrame的切片副本上设置值.尝试使用.loc[row_indexer,col_indexer] = value替代
请参阅文档中的警告:链接
所以,我试图提出自己的版本,但我一直陷入困境.开始.
我有一个按时间索引的数据框,其中包含站点列(许多不同站点的字符串值)和浮点值.
time_index site val
Run Code Online (Sandbox Code Playgroud)
我想通过按站点分组的'val'列,并用NaN(每组)替换任何异常值(与平均值的+/- 3标准偏差).
当我使用以下函数时,我无法用我的True/Falses向量索引数据框:
def replace_outliers_with_nan(df, stdvs):
dfnew=pd.DataFrame()
for i, col in enumerate(df.sites.unique()):
dftmp = pd.DataFrame(df[df.sites==col])
idx = [np.abs(dftmp-dftmp.mean())<=(stdvs*dftmp.std())] #boolean vector of T/F's
dftmp[idx==False]=np.nan #this is where the problem lies, I believe
dfnew[col] = dftmp
return dfnew
Run Code Online (Sandbox Code Playgroud)
另外,我担心上面的函数需要花费很长时间才能生成700万行,这就是为什么我希望使用groupby函数选项.