我有表存储产品价格信息,表看起来类似,(不是主键)
no name price date
1 paper 1.99 3-23
2 paper 2.99 5-25
3 paper 1.99 5-29
4 orange 4.56 4-23
5 apple 3.43 3-11
Run Code Online (Sandbox Code Playgroud)
现在我想选择"name"字段在表格中多次出现的所有行.基本上,我希望我的查询返回前三行.
我试过了:
SELECT * FROM product_price_info GROUP BY name HAVING COUNT(*) > 1
Run Code Online (Sandbox Code Playgroud)
但我得到一个错误说:
列"product_price_info.no"必须出现在GROUP BY子句中或用于聚合函数
我使用Spark 1.6.0和Scala.
我想将DataFrame保存为压缩CSV格式.
这是我到目前为止(假设我已经拥有df和scas SparkContext):
//set the conf to the codec I want
sc.getConf.set("spark.hadoop.mapred.output.compress", "true")
sc.getConf.set("spark.hadoop.mapred.output.compression.codec", "true")
sc.getConf.set("spark.hadoop.mapred.output.compression.codec", "org.apache.hadoop.io.compress.GzipCodec")
sc.getConf.set("spark.hadoop.mapred.output.compression.type", "BLOCK")
df.write
.format("com.databricks.spark.csv")
.save(my_directory)
Run Code Online (Sandbox Code Playgroud)
输出gz格式不正确.
Spark 1.6.1,Scala api.
对于数据帧,我需要将某个列的所有空值替换为0.我有两种方法可以做到这一点.1.
myDF.withColumn("pipConfidence", when($"mycol".isNull, 0).otherwise($"mycol"))
Run Code Online (Sandbox Code Playgroud)
2.
myDF.na.fill(0, Seq("mycol"))
Run Code Online (Sandbox Code Playgroud)
它们基本相同还是一种方式首选?
谢谢!
我正在尝试使用 Scrapy 抓取 ajax 站点,网址是http://www.target.com/p/bounty-select-a-size-white-paper-towels-12-mega-rolls/-/A- 14920157#prodSlot=medium_1_2&term=赏金
我的目标是获取商店 ID。我通过检查 chrome 开发人员工具中的所有 XHR 请求并找到名称为 ("v1?request_type=availability&key=.....") 的请求来做到这一点,这是我想要的。
我的问题是:
在开发人员工具中,有“查询字符串参数”,它似乎是?请求 url之后的部分。还有 Request Payload 部分,它是一个 json。那么我应该使用哪一个来发送到服务器呢?如果我需要请求有效负载,我该如何发送 json 文件?
当我发送整个 url 以获取 json 时:https ://api.target.com/available_to_promise_aggregator/v1 ?request_type= availability & key =q0jGNkIyuqUTYIlzZKoCfK6ugaNGSP8h
我收到“不支持请求方法‘GET’”,所以我应该改用 POST 还是我做错了什么?
我写了一个简单的java程序来创建一个lucene索引,但是我的语法错误了.
我的代码:
static final String INDEX_DIRECTORY = "/home/yuqing/Desktop/index";
Directory index = FSDirectory.open(new File(INDEX_DIRECTORY));
Run Code Online (Sandbox Code Playgroud)
我收到以下错误,
open (java.nio.file.path) in FSDirectory cannot be applied to java.io.file
Run Code Online (Sandbox Code Playgroud) 当我运行级联工作时,我收到一个错误:
Split metadata size exceeded 10000000
Run Code Online (Sandbox Code Playgroud)
我尝试通过将以下内容传递给命令行来增加每个作业级别的限制
xxx.jar -D mapreduce.job?.split.metainfo.maxsi??ze=30000000
Run Code Online (Sandbox Code Playgroud)
我也试过了
xxx.jar -D mapreduce.jobtracker?.split.metainfo.maxsi??ze=30000000
Run Code Online (Sandbox Code Playgroud)
但两者都不起作用,我仍然得到相同的错误,所以没有选择参数.我正在使用hadoop 2.5.任何人都可以指出我做错了什么?
我的输入数据集大约是 150G。我正在设置
--conf spark.cores.max=100
--conf spark.executor.instances=20
--conf spark.executor.memory=8G
--conf spark.executor.cores=5
--conf spark.driver.memory=4G
Run Code Online (Sandbox Code Playgroud)
但由于数据在执行者之间分布不均匀,我一直在得到
Container killed by YARN for exceeding memory limits. 9.0 GB of 9 GB physical memory used
Run Code Online (Sandbox Code Playgroud)
这是我的问题:
1. Did I not set up enough memory in the first place? I think 20 * 8G > 150G, but it's hard to make perfect distribution, so some executors will suffer
2. I think about repartition the input dataFrame, so how can I determine how many partition to set? the …Run Code Online (Sandbox Code Playgroud) 我发现在 python 正则表达式中有不同的方法来匹配新行。例如,下面代码中使用的所有模式都可以匹配一个新行
str = 'abc\n123'
pattern = '\n' # print outputs new line
pattern2 = '\\n' # print outputs \n
pattern3 = '\\\n' # print outputs \ and new line
pattern4 = r'\n' # print outputs \n
s = re.search(pattern, str).group()
print ('a' + s + 'a')
Run Code Online (Sandbox Code Playgroud)
我对此有两个问题:
模式是一个新行,模式2和模式4是\n。为什么python regex为不同的字符串生成相同的模式?
不知道为什么 pattern3 也会生成相同的模式。当传递给重新解析器时,pattern3 代表 \ + 新行,为什么重新解析器将其翻译成刚好匹配的新行?
我正在使用 Python 3
在 SAML 中,是否可以强制用户每次都执行 idp 登录过程,即使用户有活动的 idp 会话?
在这里举一个具体的例子:让我们将我的应用程序称为“SP”,我使用 SSOCirecle 作为 idp,并使用 POST 和重定向(SP 发起)。
为了进行测试,我将首先登录 SSOCircle 以获取活动的 idp 会话。然后当我尝试访问 SP 时,我应该被重定向到 idp。
通常,由于我已经有一个活动的 idp 会话,idp 会看到“哦,您之前已经通过了身份验证,您可以直接转到 SP!”
但我不希望这样,我希望 idp 强制用户每次都输入凭据,也许可以通过其中之一(我猜)
我想知道这是否可行。
apache-spark ×3
cascading ×1
csv ×1
hadoop ×1
java ×1
json ×1
lucene ×1
postgresql ×1
python ×1
python-3.x ×1
regex ×1
saml ×1
saml-2.0 ×1
scala ×1
scrapy ×1
spring-saml ×1
sql ×1
web-scraping ×1