小编msh*_*eeb的帖子

熊猫计算一列中值的出现次数

我有一个只有一列和大约 80 万行的长数据框。我的数据框看起来像这样

54
53
53
53
53
...
0
0
0
Run Code Online (Sandbox Code Playgroud)

所以我需要的是计算每个值的出现次数并将其保存到数据帧中,因此结果将是这样的

54 1
53 1000
52 800
...
0 100000
Run Code Online (Sandbox Code Playgroud)

我试过使用,df.groupby(0)但它只返回一个对象。如何获得两列数据框(或 1 列和显示值的行索引)?

python pandas

3
推荐指数
1
解决办法
7859
查看次数

获取python词典列表中某个键的所有值

我在Python中有一个列表,其中包含一个"嵌套"字典.所以我的列表如下所示:

List = [{'entry' : {'Name' : 'Smith', 'Age' : 25}}, {'entry' : {'Name' : 'Mary', 'Age' : 28}}]
Run Code Online (Sandbox Code Playgroud)

我想在不使用循环的情况下从列表中返回键"Name"的所有值.因此,如果我使用循环它可以工作,因为这适用于列表的单个条目.例如:List[0]['entry']['Name']工作并返回'Smith'.但是,我需要这样的东西List[:]['entry']['Name']应该返回一个List,其中包含条目'Smith'和'Mary'.这可能吗?

python dictionary

2
推荐指数
1
解决办法
1260
查看次数

向 Hive 添加逗号分隔表

我有一个非常基本的问题:如何向 Hive 添加一个非常简单的表。我的表保存在保存在 HDFS 中的文本文件 (.txt) 中。我试图在 Hive 中创建一个外部表,它指出了这个文件,但是当我运行 SQL 查询(select * from table_name)时,我没有得到任何输出。这是一个示例代码:

create external table Data (
    dummy INT,
    account_number INT, 
    balance INT, 
    firstname STRING, 
    lastname STRING, 
    age INT, 
    gender CHAR(1), 
    address STRING, 
    employer STRING, 
    email STRING,
    city STRING, 
    state CHAR(2)
)
LOCATION 'hdfs:///KibTEst/Data.txt';
Run Code Online (Sandbox Code Playgroud)

KibTEst/Data.txt 是 HDFS 中文本文件的路径。

表中的行用回车分隔,列用逗号分隔。

谢谢你的帮助!

hive hdfs

0
推荐指数
1
解决办法
6722
查看次数

标签 统计

python ×2

dictionary ×1

hdfs ×1

hive ×1

pandas ×1