我对Apache Spark和Spark-SQL有一些了解.最近我发现了Apache Drill项目.你能描述一下他们之间最显着的优势/差异吗?我已经阅读过 Fast Hadoop Analytics(Cloudera Impala vs Spark/Shark vs Apache Drill), 但这个话题对我来说还不清楚.
我有两个版本的scala(2.11.4和2.10.4).目前我在基于scala 2.10的项目上工作.我已经更改了项目属性中的版本,但仍然抱怨它:
在构建路径(2.10.4.)中找到的scala库版本与scala IDE(2.11.4.)提供的版本不同.确保你知道自己在做什么.
我在用
Eclipse SDK构建标识的Scala IDE构建:4.0.0-vfinal-20141216-1226-Typesafe
项目配置:

知道如何解决这个问题吗?
我有两个实体:
@Entity
class X {
@Id
int id;
}
@Entity
class Y {
@Id
int id;
@ManyToOne
@JoinColumn(name = "x_id")
X x;
}
Run Code Online (Sandbox Code Playgroud)
我想在y表中计算x_id的不同值.我试过了:
select count(distinct Y.x) from Y;
Run Code Online (Sandbox Code Playgroud)
它的工作原理,但在sql我加入x表是不合格的:
select count(distinct x.id) from y, x where y.x_id = x.id;
Run Code Online (Sandbox Code Playgroud)
这种加入对我来说是不必要的,也是非常昂贵 没有原生查询有没有办法避免它?
apache-drill ×1
apache-spark ×1
bigdata ×1
eclipse ×1
eclipselink ×1
hadoop ×1
java ×1
jpa ×1
oracle ×1
scala ×1
scala-ide ×1