小编Rob*_*bin的帖子

在 Julia 中从 .csv 文件中提取数据

我对 Julia 很陌生,我有一个 .csv 文件,该文件存储在 gzip 中,我想从中提取一些信息以用于教育目的并更好地了解该语言。

在Python中,Panda有许多有用的函数可以帮助解决这个问题,但我似乎无法直接解决问题......

这是我的代码(我知道,非常弱!!!):

{
import Pkg 
#Pkg.add("CSV")
#Pkg.add("DataFrames")
#Pkg.add("CSVFiles")
#Pkg.add("CodecZlib")
#Pkg.add("GZip")
using CSVFiles
using Pkg
using CSV
using DataFrames
using CodecZlib
using GZip


df = CSV.read("Path//to//file//file.csv.gzip", DataFrame)

print(df)
}
Run Code Online (Sandbox Code Playgroud)

我添加了一个屏幕来显示 .csv 文件内的列的外观。 在此输入图像描述 我想提取日期并制作评论最多的前 10 位用户、线程最多的前 10 天等。

我想指出的是,这不是给我的练习,而是我想自己进行的训练。 4.

我知道熊猫版本是这样的:

df['threadcreateddate'] = pd.to_datetine(df['thread_created_utc']).dt.date
Run Code Online (Sandbox Code Playgroud)

或者

df['commentcreateddate'] = pd.to_datetime(df['comment_created_utc']).dt.date
Run Code Online (Sandbox Code Playgroud)

并对其进行排序:

pf_number_of_threads = df.groupby('threadcreateddate')["thread_id'].nunique()
Run Code Online (Sandbox Code Playgroud)

如果我要绘制它:

df_number_of_threads.plot(kind='line')
plt.show()
Run Code Online (Sandbox Code Playgroud)

打印:

head = df.head()
print(df_number_of_threads.sort_values(ascending=False).head(10))
Run Code Online (Sandbox Code Playgroud)

有人可以帮忙吗?df.select() 函数对我不起作用。

dataframe pandas julia dataframes.jl

4
推荐指数
1
解决办法
484
查看次数

标签 统计

dataframe ×1

dataframes.jl ×1

julia ×1

pandas ×1