小编use*_*641的帖子

Postgres:选择具有大于1的字段数的所有行

我有表存储产品价格信息,表看起来类似,(不是主键)

no   name    price    date
1    paper   1.99     3-23
2    paper   2.99     5-25
3    paper   1.99     5-29
4    orange  4.56     4-23
5    apple   3.43     3-11
Run Code Online (Sandbox Code Playgroud)

现在我想选择"name"字段在表格中多次出现的所有行.基本上,我希望我的查询返回前三行.

我试过了:

SELECT * FROM product_price_info GROUP BY name HAVING COUNT(*) > 1  
Run Code Online (Sandbox Code Playgroud)

但我得到一个错误说:

列"product_price_info.no​​"必须出现在GROUP BY子句中或用于聚合函数

sql postgresql

17
推荐指数
3
解决办法
2万
查看次数

如何将DataFrame保存为压缩(gzip)CSV?

我使用Spark 1.6.0和Scala.

我想将DataFrame保存为压缩CSV格式.

这是我到目前为止(假设我已经拥有dfscas SparkContext):

//set the conf to the codec I want
sc.getConf.set("spark.hadoop.mapred.output.compress", "true")
sc.getConf.set("spark.hadoop.mapred.output.compression.codec", "true")
sc.getConf.set("spark.hadoop.mapred.output.compression.codec", "org.apache.hadoop.io.compress.GzipCodec")
sc.getConf.set("spark.hadoop.mapred.output.compression.type", "BLOCK")

df.write
  .format("com.databricks.spark.csv")
  .save(my_directory)
Run Code Online (Sandbox Code Playgroud)

输出gz格式不正确.

csv scala apache-spark spark-dataframe

16
推荐指数
3
解决办法
2万
查看次数

Spark"用0替换null"性能比较

Spark 1.6.1,Scala api.

对于数据帧,我需要将某个列的所有空值替换为0.我有两种方法可以做到这一点.1.

myDF.withColumn("pipConfidence", when($"mycol".isNull, 0).otherwise($"mycol"))
Run Code Online (Sandbox Code Playgroud)

2.

myDF.na.fill(0, Seq("mycol"))
Run Code Online (Sandbox Code Playgroud)

它们基本相同还是一种方式首选?

谢谢!

apache-spark spark-dataframe

8
推荐指数
1
解决办法
1万
查看次数

爬行:“查询字符串参数”和“请求负载”之间的区别

我正在尝试使用 Scrapy 抓取 ajax 站点,网址是http://www.target.com/p/bounty-select-a-size-white-paper-towels-12-mega-rolls/-/A- 14920157#prodSlot=medium_1_2&term=赏金

我的目标是获取商店 ID。我通过检查 chrome 开发人员工具中的所有 XHR 请求并找到名称为 ("v1?request_type=availability&key=.....") 的请求来做到这一点,这是我想要的。

我的问题是:

  1. 在开发人员工具中,有“查询字符串参数”,它似乎是?请求 url之后的部分。还有 Request Payload 部分,它是一个 json。那么我应该使用哪一个来发送到服务器呢?如果我需要请求有效负载,我该如何发送 json 文件?

  2. 当我发送整个 url 以获取 json 时:https ://api.target.com/available_to_promise_aggregator/v1 ?request_type= availability & key =q0jGNkIyuqUTYIlzZKoCfK6ugaNGSP8h

我收到“不支持请求方法‘GET’”,所以我应该改用 POST 还是我做错了什么?

json scrapy web-scraping

5
推荐指数
1
解决办法
4288
查看次数

Lucene使用FSDirectory

我写了一个简单的java程序来创建一个lucene索引,但是我的语法错误了.

我的代码:

static final String INDEX_DIRECTORY = "/home/yuqing/Desktop/index";
Directory index = FSDirectory.open(new File(INDEX_DIRECTORY));
Run Code Online (Sandbox Code Playgroud)

我收到以下错误,

open (java.nio.file.path) in FSDirectory cannot be applied to java.io.file
Run Code Online (Sandbox Code Playgroud)

java lucene

5
推荐指数
1
解决办法
4386
查看次数

Hadoop:拆分元数据大小超过10000000

当我运行级联工作时,我收到一个错误:

Split metadata size exceeded 10000000
Run Code Online (Sandbox Code Playgroud)

我尝试通过将以下内容传递给命令行来增加每个作业级别的限制

xxx.jar -D mapreduce.job?.split.metainfo.maxsi??ze=30000000
Run Code Online (Sandbox Code Playgroud)

我也试过了

xxx.jar -D mapreduce.jobtracker?.split.metainfo.maxsi??ze=30000000
Run Code Online (Sandbox Code Playgroud)

但两者都不起作用,我仍然得到相同的错误,所以没有选择参数.我正在使用hadoop 2.5.任何人都可以指出我做错了什么?

hadoop cascading

5
推荐指数
1
解决办法
803
查看次数

Spark:执行程序内存超过物理限制

我的输入数据集大约是 150G。我正在设置

--conf spark.cores.max=100 
--conf spark.executor.instances=20 
--conf spark.executor.memory=8G 
--conf spark.executor.cores=5 
--conf spark.driver.memory=4G
Run Code Online (Sandbox Code Playgroud)

但由于数据在执行者之间分布不均匀,我一直在得到

Container killed by YARN for exceeding memory limits. 9.0 GB of 9 GB physical memory used
Run Code Online (Sandbox Code Playgroud)

这是我的问题:

1. Did I not set up enough memory in the first place? I think 20 * 8G > 150G, but it's hard to make perfect distribution, so some executors will suffer
2. I think about repartition the input dataFrame, so how can I determine how many partition to set? the …
Run Code Online (Sandbox Code Playgroud)

apache-spark spark-dataframe

4
推荐指数
2
解决办法
5225
查看次数

Intellij:如何转换所有文件的缩进

我知道如何为单个文件转换缩进。我去编辑-> 转换缩进-> 空格/制表符。

但我想对目录下的所有文件执行此操作。

我尝试单击一个目录,然后转到编辑 -> 转换缩进,但选项是灰色的。

在此处输入图片说明

intellij-idea intellij-plugin

4
推荐指数
1
解决办法
2231
查看次数

在 Python 正则表达式中指定匹配新行的不同方法

我发现在 python 正则表达式中有不同的方法来匹配新行。例如,下面代码中使用的所有模式都可以匹配一个新行

str = 'abc\n123'
pattern = '\n'   # print outputs new line 
pattern2 = '\\n' # print outputs \n
pattern3 = '\\\n' # print outputs \ and new line
pattern4 = r'\n'  # print outputs \n
s = re.search(pattern, str).group()
print ('a' + s + 'a')
Run Code Online (Sandbox Code Playgroud)

我对此有两个问题:

  1. 模式是一个新行,模式2和模式4是\n。为什么python regex为不同的字符串生成相同的模式?

  2. 不知道为什么 pattern3 也会生成相同的模式。当传递给重新解析器时,pattern3 代表 \ + 新行,为什么重新解析器将其翻译成刚好匹配的新行?

我正在使用 Python 3

python regex python-3.x

3
推荐指数
1
解决办法
2万
查看次数

SAML:即使用户有 IDP 会话,是否也可以强制用户完成登录过程

在 SAML 中,是否可以强制用户每次都执行 idp 登录过程,即使用户有活动的 idp 会话?

在这里举一个具体的例子:让我们将我的应用程序称为“SP”,我使用 SSOCirecle 作为 idp,并使用 POST 和重定向(SP 发起)。

为了进行测试,我将首先登录 SSOCircle 以获取活动的 idp 会话。然后当我尝试访问 SP 时,我应该被重定向到 idp。

通常,由于我已经有一个活动的 idp 会话,idp 会看到“哦,您之前已经通过了身份验证,您可以直接转到 SP!”

但我不希望这样,我希望 idp 强制用​​户每次都输入凭据,也许可以通过其中之一(我猜)

  1. 忽略活动的 IDP 会话
  2. 不要创建 IDP 会话

我想知道这是否可行。

saml single-sign-on saml-2.0 spring-saml

3
推荐指数
1
解决办法
5771
查看次数