我对 Julia 很陌生,我有一个 .csv 文件,该文件存储在 gzip 中,我想从中提取一些信息以用于教育目的并更好地了解该语言。
在Python中,Panda有许多有用的函数可以帮助解决这个问题,但我似乎无法直接解决问题......
这是我的代码(我知道,非常弱!!!):
{
import Pkg
#Pkg.add("CSV")
#Pkg.add("DataFrames")
#Pkg.add("CSVFiles")
#Pkg.add("CodecZlib")
#Pkg.add("GZip")
using CSVFiles
using Pkg
using CSV
using DataFrames
using CodecZlib
using GZip
df = CSV.read("Path//to//file//file.csv.gzip", DataFrame)
print(df)
}
Run Code Online (Sandbox Code Playgroud)
我添加了一个屏幕来显示 .csv 文件内的列的外观。
我想提取日期并制作评论最多的前 10 位用户、线程最多的前 10 天等。
我想指出的是,这不是给我的练习,而是我想自己进行的训练。 4.
我知道熊猫版本是这样的:
df['threadcreateddate'] = pd.to_datetine(df['thread_created_utc']).dt.date
Run Code Online (Sandbox Code Playgroud)
或者
df['commentcreateddate'] = pd.to_datetime(df['comment_created_utc']).dt.date
Run Code Online (Sandbox Code Playgroud)
并对其进行排序:
pf_number_of_threads = df.groupby('threadcreateddate')["thread_id'].nunique()
Run Code Online (Sandbox Code Playgroud)
如果我要绘制它:
df_number_of_threads.plot(kind='line')
plt.show()
Run Code Online (Sandbox Code Playgroud)
打印:
head = df.head()
print(df_number_of_threads.sort_values(ascending=False).head(10))
Run Code Online (Sandbox Code Playgroud)
有人可以帮忙吗?df.select() 函数对我不起作用。