小编cma*_*her的帖子

熊猫按索引分组并计算总和

我有以下数据框:

Node  Type       
0     InData         2944.516970
      InInterests    3703.208935
1     InData         6207.580040
      InInterests    3505.068411
2     InData         8133.002730
      InInterests    3735.028306
3     InData         9426.704710
      InInterests    2665.989291
4     InData         2604.157800
      InInterests    3103.310729
5     InData         6784.829160
      InInterests    3293.815375
6     InData         6823.617400
      InInterests    4121.833980
7     InData         4072.702770
      InInterests    3033.609368
8     InData         4614.608240
      InInterests    2955.216811
9     InData         6986.500750
      InInterests    2986.820394
Name: KilobytesRaw, dtype: float64
Run Code Online (Sandbox Code Playgroud)

我想计算的总和InData和InInterests,但找不到这种情况下,大熊猫的索引页,也没有对谷歌。所以我希望我的数据框看起来像这样

Node         
0     mean         2944.516970
1     mean         6207.580040
...
9     mean         8133.002730
Run Code Online (Sandbox Code Playgroud)

有人可以帮忙吗?

python pandas

4
推荐指数
1
解决办法
3184
查看次数

将大表读入 Pandas,有中间步骤吗?

我有一个正在整理的数据分析脚本。此脚本Select *从表中连接到 Teradata,并将其加载到 Pandas 数据帧中。

import teradata
import pandas as pd

with udaExec.connect(method="xxx", dsn="xxx", username="xxx", password="xxx") as session:

    query = "Select * from TableA"

    # read in records
    df = pd.read_sql(query, session)

    # misc pandas tests below...
Run Code Online (Sandbox Code Playgroud)

这对于具有 100k 或更少记录的表非常有用,但问题是许多表的记录远多于此(数百万条记录),并且它往往会无限期地运行。

我可以采取一些中间步骤吗?我一直在研究,我看到一些关于将 DB 表复制到 .csv 文件或 .txt 文件或其他东西,然后从中加载熊猫数据框(而不是从表本身加载),但我不能理解它。

任何意见,将不胜感激!谢谢。

python pandas

4
推荐指数
1
解决办法
4702
查看次数

Postgres Vacuum无法释放空间

我的数据库中有一个表,该表占用161GB硬盘空间。200Gb硬盘仅剩5 GB可用空间。

  1. 以下命令显示我的表占用了161GB硬盘空间,
    select pg_size_pretty(pg_total_relation_size('Employee'));

  2. 表格中有近527行。现在我删除了250行。我再次检查了Employee的pg_total_relation_size。大小仍为161GB。

  3. 看到上面查询的输出后,我运行了vacuum命令:
    VACUUM VERBOSE ANALYZE Employee;

  4. 我检查了VACUUM是否确实发生了使用,
    SELECT relname, last_vacuum, last_autovacuum FROM pg_stat_user_tables; 我可以看到与运行VACUUM命令的时间相匹配的最后真空时间。

  5. 我还运行以下命令,查看是否有死元组
    SELECT relname, n_dead_tup FROM pg_stat_user_tables;Employee表的n_dead_tup计数为0。

  6. 如果我运行以上所有上述命令,
    select pg_size_pretty(pg_total_relation_size('Employee')); 它仍然显示161GB。

我能知道这背后的原因吗?还请纠正我有关如何释放interface_list的问题。

postgresql vacuum

4
推荐指数
1
解决办法
1989
查看次数

用 Pandas 过滤 CSV

我需要在Impresiones_exchange值超过 10 的列中过滤我的 CSV 。当我这样做时,我收到一个新的 CSV ( ssss.csv),只有一个列和一个 True 或 False 值。df["eCPM_a_pagar_a_medio"]正如我之前所说,我需要过滤大于 10 的值。

def group():
    df = pd.read_csv('Impresiones_VIDEO.csv', sep=',')
    df = df.groupby(["Cliente","Sitio","Country"], as_index=False)['Subastas', 'Impresiones_exchange', 'Importe_a_cobrar', 'Importe_a_pagar_a_medio'].sum()
    df["Fill_rate"] = ((df.Impresiones_exchange / df.Subastas )* 100).round(2)
    df["eCPM_a_cobrar"] = ((df.Importe_a_cobrar / df.Impresiones_exchange )* 1000).round(2)
    df["eCPM_a_pagar_a_medio"] = ((df.Importe_a_pagar_a_medio / df.Impresiones_exchange )* 1000).round(2)
    a = df['Impresiones_exchange'] > 10
    a.to_csv('ssss.csv')
Run Code Online (Sandbox Code Playgroud)

python csv pandas

3
推荐指数
1
解决办法
4609
查看次数

在fmt.Sprintf格式字符串中多次引用相同的参数

我有这个功能:

func getTableCreationCommands(v string) string {
    return `
        CREATE TABLE share_` + v + ` PARTITION OF share FOR VALUES IN (` + v + `);
        CREATE TABLE nearby_` + v + ` PARTITION OF nearby FOR VALUES IN (` + v + `);
    `
}
Run Code Online (Sandbox Code Playgroud)

这有点难以理解......有没有办法使用格式化字符串fmt.Sprintf?

像这样的东西:

func getTableCreationCommands(v string) string {
    return fmt.Sprintf(`
        CREATE TABLE share_%v PARTITION OF share FOR VALUES IN (%v);
        CREATE TABLE nearby_%v PARTITION OF nearby FOR VALUES IN (%v);
    `, v, v, …
Run Code Online (Sandbox Code Playgroud)

string-formatting go

3
推荐指数
1
解决办法
1329
查看次数

如何解决java.lang.string无法使用xml解析器强制转换为java.lang.integer android

我正在尝试解析XML并将其显示到列表视图中,但在运行应用程序后没有任何反应 - 显示列表但不显示XML数据.我不知道我是否遗漏了什么.

MainActivity类

public class MainActivity extends ListActivity {
// All static variables
static final String URL = "http://api.androidhive.info/pizza/?format=xml";
// XML node keys
static final String KEY_ITEM = "item"; // parent node
static final String KEY_ID = "id";
static final String KEY_NAME = "name";
static final String KEY_COST = "cost";
static final String KEY_DESC = "description";

@Override
protected void onCreate(Bundle savedInstanceState) {
    super.onCreate(savedInstanceState);
    setContentView(R.layout.activity_main);

    if (android.os.Build.VERSION.SDK_INT > 9) {
        StrictMode.ThreadPolicy policy = new StrictMode.ThreadPolicy.Builder().permitAll().build();
        StrictMode.setThreadPolicy(policy);
    }
    ListView myList=(ListView)findViewById(android.R.id.list);

    ArrayList<HashMap<String, …
Run Code Online (Sandbox Code Playgroud)

java xml parsing android xml-parsing

2
推荐指数
1
解决办法
4万
查看次数

如何从熊猫数据框中返回几个最大值的索引?

这是文本中名称出现的数据框。名称“Sage”、“Davies”和“Asplund”出现的时间相同。所以我需要一个查询来返回所有三个名字。

Name,Occurrence 
Sage,6
Davies,6
Asplund,6
Goodwin,5
Panula,5
Arnold,4
........
Run Code Online (Sandbox Code Playgroud)

python pandas

2
推荐指数
1
解决办法
1999
查看次数

如何计算 GridSearchCV 将训练多少个模型?

您如何计算 SKLearn 的 GridSearchCV 将训练多少个模型?就我而言,我使用以下参数:

learning_rate_range = [0.01, 0.05, 0.1]
max_depth_range = [3, 4, 5, 6, 7]
min_child_weight_range = [6, 7, 8]
subsample_range = [0.6, 0.7, 0.8, 0.9]
colsample_range = [0.7, 0.8, 0.9]
Run Code Online (Sandbox Code Playgroud)

例如,如果您使用 3 折交叉验证,总共将训练多少个模型,用于解决此问题的一般方法是什么?

python scikit-learn grid-search

2
推荐指数
1
解决办法
1886
查看次数

熊猫导入错误:模块“瓶颈”没有属性“ __version__”

我使用了tensorflow熊猫已有几个月了,但是今天突然间我无法导入它们。当我尝试:

import pandas as pd
Run Code Online (Sandbox Code Playgroud)

它会显示:

File "<input>", line 1, in <module>
File "C:\Program Files\JetBrains\PyCharm Community Edition 2017.2.4\helpers\pydev\_pydev_bundle\pydev_import_hook.py", line 21, in do_import
  module = self._system_import(name, *args, **kwargs)
File "C:\Users\User\AppData\Local\Programs\Python\Python36\lib\site-packages\pandas\__init__.py", line 42, in <module>
  from pandas.core.api import *
File "C:\Program Files\JetBrains\PyCharm Community Edition 2017.2.4\helpers\pydev\_pydev_bundle\pydev_import_hook.py", line 21, in do_import
  module = self._system_import(name, *args, **kwargs)
File "C:\Users\User\AppData\Local\Programs\Python\Python36\lib\site-packages\pandas\core\api.py", line 9, in <module>
  from pandas.core.categorical import Categorical
File "C:\Program Files\JetBrains\PyCharm Community Edition 2017.2.4\helpers\pydev\_pydev_bundle\pydev_import_hook.py", line 21, in do_import
  module = self._system_import(name, *args, **kwargs)
File "C:\Users\User\AppData\Local\Programs\Python\Python36\lib\site-packages\pandas\core\categorical.py", line …
Run Code Online (Sandbox Code Playgroud)

python packages pandas

2
推荐指数
1
解决办法
4498
查看次数

python pandas基于其他列条件的新列分类

使用以下python pandas dataframe df:

df = pd.DataFrame({'transaction_id': ['A123','A123','B345','B345','C567','C567','D678','D678'], 
                   'product_id': [255472, 251235, 253764,257344,221577,209809,223551,290678],
                   'product_category': ['X','X','Y','Y','X','Y','Y','X']})

transaction_id | product_id | product_category
A123              255472             X
A123              251235             X
B345              253764             Y
B345              257344             Y
C567              221577             X
C567              209809             Y
D678              223551             Y
D678              290678             X
Run Code Online (Sandbox Code Playgroud)

我需要添加另一列"transaction_category",它查看transaction_id以及transaction_id中的哪些产品类别.这是我要找的输出:

transaction_id | product_id | product_category | transaction_id
123              255472             X                X only
123              251235             X                X only
345              253764             Y                Y only
345              257344             Y                Y only
567              221577             X                X & Y
567              209809             Y …
Run Code Online (Sandbox Code Playgroud)

python conditional if-statement pandas

2
推荐指数
1
解决办法
262
查看次数