我整天被R分位数函数迷惑了.
我有一个关于分位数如何工作的直观概念,以及统计数据中的MS,但男孩哦,男孩,它的文档让我很困惑.
来自文档:
Q [i](p)=(1 - gamma)x [j] + gamma x [j + 1],
我到目前为止还在用它.对于类型i分位数,它是x [j]和x [j + 1]之间的插值,基于一些神秘的常数伽玛
其中1 <= i <= 9,(jm)/ n <= p <(j-m + 1)/ n,x [j]是第j阶统计量,n是样本大小,m是常数确定的通过样本分位数类型.这里γ取决于g = np + mj的小数部分.
那么,如何计算j?M&
对于连续样本分位数类型(4到9),样本分位数可以通过第k阶统计量和p(k)之间的线性插值获得:
p(k)=(k-alpha)/(n-alpha-beta + 1),其中α和β是由类型确定的常数.此外,m =α+ p(1-α-β),γ= g.
现在我真的迷路了.p,之前是一个常数,现在显然是一个函数.
所以对于Type 7分位数,默认...
输入7
p(k)=(k-1)/(n-1).在这种情况下,p(k)=模式[F(x [k])].这是由S.使用的.
有人想帮帮我吗?特别是我对P的是一个功能和常数,究竟发生了什么符号糊涂米是,现在来计算j表示一些特殊的p.
我希望根据这里的答案,我们可以提交一些修改后的文档,更好地解释这里发生了什么.
quantile.R源代码 或类型:quantile.default
你能建议任何简单的Java统计软件包吗?
我不一定需要任何先进的东西.我很惊讶,似乎没有一个函数来计算java.lang.Math包中的平均值...
你们有什么用呢?
编辑
关于:
编写一个计算均值和标准差的简单类有多难?
好吧,不难.手工编码之后我才问过这个问题.但是,当我需要这些功能时,它只会增加我的Java挫折感,而不是让这些最简单的功能可用.我不记得用心计算stdev的公式:)
我经常发现自己的文件每行有一个数字.我最终在excel中导入它来查看中位数,标准差等内容.
在linux中是否有一个命令行实用程序来做同样的事情?我通常需要找到平均值,中位数,最小值,最大值和标准偏差.
我正在尝试使用5星系统按客户评级对一堆产品进行排序.我设置的网站没有很多评级,并继续添加新产品,所以它通常会有一些评级较低的产品.
我尝试使用平均星级评级,但是当评级很少时,该算法会失败.
例如,具有3x5星评级的产品将比具有100x5星评级和2x2星评级的产品更好.
第二个产品是否应该显得更高,因为它在统计上更值得信赖,因为评级数量更多?
我希望这个问题不会成为"问答"问题......这里说:(多)共线性是指回归模型中预测变量之间的极高相关性.如何治愈它们......好吧,有时你不需要"治愈"共线性,因为它不会影响回归模型本身,而是解释个体预测因子的影响.
发现共线性的一种方法是将每个预测变量作为因变量,将其他预测变量作为自变量,确定R 2,如果它大于.9(或.95),我们可以考虑预测变量冗余.这是一种"方法"......其他方法呢?其中一些是耗时的,比如从模型中排除预测变量并观察b系数变化 - 它们应该明显不同.
当然,我们必须始终牢记分析的具体背景/目标......有时候,唯一的补救措施就是重复研究,但是现在,我对以多种共线性(多)共线性筛选冗余预测因子的各种方式感兴趣发生在回归模型中.
我对np.exp()实际上做了什么非常困惑.在文档中它说:"计算输入数组中所有元素的指数." 我很困惑这究竟是什么意思.有人可以给我更多信息,甚至指出我正确的方向来了解更多信息.
如何在Python中的matplotlib中绘制数组数组的经验CDF?我正在寻找pylab的"hist"函数的cdf模拟.
我能想到的一件事是:
from scipy.stats import cumfreq
a = array([...]) # my array of numbers
num_bins = 20
b = cumfreq(a, num_bins)
plt.plot(b)
Run Code Online (Sandbox Code Playgroud)
这是正确的吗?有更简单/更好的方法吗?
谢谢.
我刚想到,如果你对要排序的数据的分布(在统计意义上)有所了解,那么如果考虑到这些信息,排序算法的性能可能会受益.
所以我的问题是,是否有任何排序算法考虑到这种信息?他们有多好?
编辑:一个示例澄清:如果您知道数据的分布是高斯分布,则可以在处理数据时动态估计平均值和平均值.这将为您估算每个数字的最终位置,您可以使用它来将它们放置在最终位置附近.
编辑#2:我很惊讶答案不是一个维基链接到一个讨论这个问题的页面.这不是一个非常常见的情况(例如高斯情况)?
编辑#3:我正在为这个问题增加一笔赏金,因为我正在寻找明确的答案来源,而不是猜测.类似于"在高斯分布式数据的情况下,XYZ算法平均速度最快,正如Smith等人[1]所证实的那样".但欢迎任何其他信息.
注意:我会将赏金奖励给得票最高的答案.明智地投票!
在R predict.lm中,根据线性回归的结果计算预测,并提供计算这些预测的置信区间.根据手册,这些间隔是基于拟合的误差方差,而不是基于系数的误差间隔.
另一方面,基于逻辑和泊松回归计算预测的predict.glm(在其他几个中)没有置信区间的选项.我甚至很难想象如何计算这种置信区间,以便为泊松和逻辑回归提供有意义的见解.
是否存在为此类预测提供置信区间有意义的情况?他们怎么解释?这些案例中的假设是什么?
statistics ×10
math ×3
r ×3
algorithm ×2
numpy ×2
python ×2
sorting ×2
bayesian ×1
command-line ×1
exp ×1
glm ×1
java ×1
linux ×1
matplotlib ×1
packages ×1
performance ×1
probability ×1
random ×1
rating ×1
regression ×1
scipy ×1