相关疑难解决方法(0)

幂律与其他分布的比较

我正在使用 Jeff Alstott 的 Python powerlaw 包来尝试使我的数据符合幂律。Jeff 的软件包基于 Clauset 等人讨论幂律的论文。

首先,我的数据的一些详细信息:

  1. 它是离散的(字数数据);
  2. 它严重向左倾斜(高偏度)
  3. 峰态(超峰度大于 10)

到目前为止我做了什么

df_data 是我的数据框,其中 word_count 是一个包含大约 1000 个单词标记的单词计数数据的系列。

首先我生成了一个合适的对象:

fit = powerlaw.Fit(data=df_data.word_count, discrete=True)
Run Code Online (Sandbox Code Playgroud)

接下来,我使用 fit.distribution_compare(distribution_one, distribution_two) 方法将数据的幂律分布与其他分布进行比较 - 即对数正态、指数、对数正态、拉伸指数和截断幂律。

作为 distribution_compare 方法的结果,我为每个比较获得了以下 (r,p) 元组:

  • fit.distribution_compare('power_law', '对数正态') = (0.35617607052907196, 0.5346696007)
  • fit.distribution_compare('power_law', '指数') = (397.3832646921206, 5.3999952097178692e-06)
  • fit.distribution_compare('power_law', 'lognormal_positive') = (27.82736434863289, 4.2257378698322223e-07)
  • fit.distribution_compare('power_law', 'stretched_exponential') = (1.37624682020371, 0.2974292837452046)
  • fit.distribution_compare('power_law', 'truncated_power_law') =(-0.0038373682383605, 0.83159372694621)

来自幂律文档:

R:浮动

两组似然值的对数似然比。如果为正,则第一组可能性更有可能(因此产生它们的概率分布更适合数据)。如果为负,则相反。

p:浮点数

R 符号的显着性。如果低于临界值(通常为 …

python power-law

3
推荐指数
1
解决办法
2799
查看次数

标签 统计

power-law ×1

python ×1