标签: bigdata

从具有开始日期和结束日期的数据框列生成日期范围

我有以下 Pandas 数据框:

店铺 物品 价格 开始日期有效 有效结束日期
店铺1 项目1 100.00 2019-01-01 2019-01-06
店铺1 项目1 120.00 2019-01-07 2019-01-10
店铺1 项目2 80.00 2018-12-31 2019-01-03
店铺1 项目2 150.00 2019-01-04 2019-01-06
商店2 项目1 105.00 2019-01-01 2019-01-06
商店2 项目1 130.00 2019-01-07 2019-01-10
商店2 项目2 85.00 2018-12-31 2019-01-03
商店2 项目2 145.00 2019-01-04 2019-01-06

我需要得到下表作为输出:

店铺 物品 日期 价格
店铺1 项目1 2019-01-01 100.00
店铺1 项目1 2019-01-02 100.00
店铺1 项目1 2019-01-03 100.00
店铺1 项目1 2019-01-04 100.00
店铺1 项目1 2019-01-05 100.00
店铺1 项目1 2019-01-06 100.00
店铺1 项目1 2019-01-07 …

python bigdata dataframe pandas

1
推荐指数
1
解决办法
1305
查看次数

如何在 Kusto 中运行预定功能?

我有一个 Kusto 表,其中包含传入的流数据。但是,我需要将每天的聚合存储在另一个表中。有没有办法在 Kusto 中运行计划函数,例如在午夜运行并将结果提取到聚合表中?如果不是,我怎样才能实现我的目标?是否有一些连接器可以帮助我实现这一目标?

bigdata data-connections kql azure-data-explorer power-automate-custom-connector

1
推荐指数
1
解决办法
2211
查看次数

Apache NiFi:在 UI 上默认删除用户名和密码登录

我目前正在设置 NiFi,我注意到作为版本 1.14.0版本的一部分,默认情况下我们启用了安全功能,需要用户名和密码才能访问 UI。对于我的特定用例,我不想要这个。我在哪里以及如何在启动时禁用此功能,以便它的行为与旧版本的 NiFi 类似?

谢谢你!

bigdata apache-nifi

1
推荐指数
1
解决办法
2186
查看次数

更新 Postgresql 数据库中约 1 亿行的最有效方法?

我有一个只有一张表的数据库。该表需要每隔几周更新一次。我们需要将第三方数据引入其中,它将包含 100-1.2 亿行。所以流程基本上是:

  1. 从源头获取原始数据
  2. 检测插入、更新和删除
  3. 进行更新并摄取到数据库中

检测和执行更新的最佳方法是什么?一些选项是:

  1. 将传入数据与当前数据库一一比较并进行单次更新。这看起来很慢而且不可行。
  2. 将传入数据提取到新表中,然后用新表替换旧表
  3. 在当前表中就地批量更新。不知道该怎么做。

您认为最好的选择是什么,或者是否有其他选择?

sql database postgresql crud bigdata

1
推荐指数
1
解决办法
1万
查看次数

如何从超过1TB的数据打印频率k字?

我的采访中提到了这个问题.我想知道解决方案.

给出一个文本文件,每行包含一个单词,文件大小超过1TB.任务是仅打印文件中频率为k的单词.

我没有完全回答这个问题.但我想,我是以正确的方式开始的.您使用散列技术,代码至少花费O(n)时间(因为它必须通读文件)

任何人都可以回答我这是否可以有效地完成.

algorithm hash bigdata

0
推荐指数
1
解决办法
2034
查看次数

如何为大数据设计RDBMS

这可能听起来是一个普遍的问题,但我有一些想法可以通过在这里分享来进化.

我们的应用程序有几个超过1000万条记录的表格; 查询它们需要大约40秒.我们已经遵循已知的数据库设计实践,例如使用主键,索引等.我们还尝试归档旧行和表拆分等,但它仍然没有那么令人印象深刻.

该应用程序是数据密集型的,但据我所知,尽管像银行这样的许多网站确实拥有大量数据,但它们仍然具有良好的性能 我不是数据库方面的专家; 谁可以在这里指出我错过了什么?

将有一些标准技术,如数据库集群等,一些我的基础设施不允许.

与原始存储相比,是否有可能以更加处理的格式存储数据?数据库设计中是否出现了新的设计实践?我可以轻松迁移到NoSQL吗?NoSQL还有多好?

database bigdata nosql

0
推荐指数
1
解决办法
1109
查看次数

在Hadoop中创建输入流对象以读取文件

我的Hadoop文件系统中有一个文件,我需要创建一个InputStream对象,以便将其作为输入参数传递给as ApiMethod(inputstreamObject)

我正在使用《权威指南》中提到的以下方法来创建输入流对象,但不起作用。

class test {

        static {    
        URL.setURLStreamHandlerFactory(new FsUrlStreamHandlerFactory());  } 

        InputStream in = null; 
        try {  
        in = new URL("hdfs://host/path").openStream();  
        IOUtils.copyBytes(in, System.out, 4096, false);
        Object = new ApiMethod(in);
        } finally {  
        IOUtils.closeStream(in); } 

}
Run Code Online (Sandbox Code Playgroud)

请帮忙。

java hadoop bigdata

0
推荐指数
1
解决办法
5965
查看次数

初始化kadmin接口时,在kerberos数据库中找不到客户端

当我尝试使用addprinc命令在Kerberos(Kadmind服务器)中创建Principal("prabhat/admin ")时.

kadmin -q "addprinc prabhat/admin"
Run Code Online (Sandbox Code Playgroud)

我收到以下错误

使用密码作为主要prabhat/admin进行身份验证.

Kadmin:初始化kadmin接口时,在kerberos数据库中找不到客户端

security authentication hadoop kerberos bigdata

0
推荐指数
1
解决办法
2万
查看次数

Bigquery活跃用户数不准确(Google Analytics(分析))

我已将Google Analytics(分析)集成到Bigquery中,并且我正尝试编写一个查询以获取应与GA Portal上的号码匹配的活动用户。

这是我写的查询;

SELECT 
date(date) as date,
EXACT_COUNT_DISTINCT(fullVisitorId) as daily_active_users,
FROM TABLE_DATE_RANGE([<project_id>:<dataset>.ga_sessions_],
TIMESTAMP('2018-01-01'),
TIMESTAMP(CURRENT_DATE()))
group by date
order by date desc
Run Code Online (Sandbox Code Playgroud)

我得到的回应数字与Google Analytics(分析)显示给我的数字有某种联系,但并不是100%准确。

作为回报,我得到的数字比门户网站上的数字略高,我认为我需要放置一个where子句来过滤GA可能正在门户网站上过滤的属性。

sql database google-analytics bigdata google-bigquery

0
推荐指数
1
解决办法
335
查看次数

在迭代算法中使用Rcpp加速替换列表和向量的元素是否合法?

上下文

我最近一直致力于迭代算法,每次迭代都n依赖于迭代n-1.在每次迭代期间,大部分计算时间是通过子设置和/或替换向量,列表或data.tables(N> 10 ^ 6)的元素来获得的.

我最近遇到了Rcpp并且稍微玩了一下我发现更换k向量或列表的元素可以加速两到三个数量级(下面几个基准测试).

但是,当在for和while循环中使用Rcpp子集代码时,R似乎变得不稳定,并且会话在随机点中止而没有出现什么问题.

我的问题: 这种使用Rcpp是合法的还是会导致我不知道的问题?

下面是我使用的Rcpp代码和一些基准测试.总的来说,算法应该将替换函数调用~55亿次,子集函数调用~500亿次.

注意,使用Rcpp替换列表和双向量的元素更快,而对于整数向量,基本R解是优选的(基准1); 数据表是替换元素的好选项,但如果必须重复子集以访问其元素,则向量方法要快得多(基准2).

功能:

#include <Rcpp.h>
using namespace Rcpp;


// [[Rcpp::export]]

void assign_list(List x, int k, NumericVector new_element){
  x[k-1] = new_element;
}

// [[Rcpp::export]]
void assign_dbl(NumericVector x, int k, double y){
  x[k-1] = y;
}

// [[Rcpp::export]]
void assign_int(IntegerVector x, int k, int y){
  x[k-1] = y;
}
Run Code Online (Sandbox Code Playgroud)

基准:

输入

set.seed(747474)

int <- 1:10^7
dou <- rnorm(10^7, …
Run Code Online (Sandbox Code Playgroud)

c++ r subset bigdata rcpp

0
推荐指数
1
解决办法
156
查看次数