我对dplyr包中的sample_n命令(对于 replace=TRUE 情况)的逻辑感到困惑。我正在使用sample_n但我无法弄清楚我的样本是如何复制的,它背后的逻辑是什么?
当我查看采样数据时,变量之间的分数或特定比率不守恒。
dplyr::sample_n调用sample.int,所以我们会研究一下。想象一下,你有一个装有 10 个乒乓球的麻袋,按顺序编号。
sample(..., replace=FALSE)意味着你把手伸进袋子里拿出一个乒乓球,记下号码,然后把它放在一边。您可以放心,您刚刚选择的号码不会再次从麻袋中取出。使用这种方法,您最多可以随机选择 10 个球(最后一个拉出的球应该确定其即将发生的价值)。
sample(..., replace=TRUE)意思是你把手伸进袋子里,拿出一个乒乓球,记录号码,然后把球放回袋子里。你下一次伸入麻袋可能会拉出同一个球是可行的。使用这种方法,您可以从袋子中拉出(许多)超过 10 个球,认识到当拉出 10 个或更少球时您可能会重复,并且当您拉出超过 10 个球时肯定会重复。
| 归档时间: |
|
| 查看次数: |
1071 次 |
| 最近记录: |