我正在使用 Jeff Alstott 的 Python powerlaw 包来尝试使我的数据符合幂律。Jeff 的软件包基于 Clauset 等人讨论幂律的论文。
首先,我的数据的一些详细信息:
到目前为止我做了什么
df_data 是我的数据框,其中 word_count 是一个包含大约 1000 个单词标记的单词计数数据的系列。
首先我生成了一个合适的对象:
fit = powerlaw.Fit(data=df_data.word_count, discrete=True)
Run Code Online (Sandbox Code Playgroud)
接下来,我使用 fit.distribution_compare(distribution_one, distribution_two) 方法将数据的幂律分布与其他分布进行比较 - 即对数正态、指数、对数正态、拉伸指数和截断幂律。
作为 distribution_compare 方法的结果,我为每个比较获得了以下 (r,p) 元组:
来自幂律文档:
R:浮动
两组似然值的对数似然比。如果为正,则第一组可能性更有可能(因此产生它们的概率分布更适合数据)。如果为负,则相反。
p:浮点数
R 符号的显着性。如果低于临界值(通常为 …