我们有一个带有 intel AVX 512 CPU 的新集群。我们对该主题进行了研究,但没有结果。我们想知道 Spark 作业是否能够在 AVX 本地运行以处理 DataFrames 对象,或者我们是否必须更改代码以允许 JVM 使用它,或者它是否完全无用。我们的 spark 应用程序是用 scala 编码的。我们的大部分工作是 DataFrames 对象处理和算法。在此先感谢您的帮助
我有一个来自处理部分的数据框,看起来像:
+---------+------+-----------+
|Time |group |value |
+---------+------+-----------+
| 28371| 94| 906|
| 28372| 94| 864|
| 28373| 94| 682|
| 28374| 94| 574|
| 28383| 95| 630|
| 28384| 95| 716|
| 28385| 95| 913|
Run Code Online (Sandbox Code Playgroud)
我想为每个组取(最大时间的值 - 最小时间的值),以获得以下结果:
+------+-----------+
|group | value |
+------+-----------+
| 94| -332|
| 95| 283|
Run Code Online (Sandbox Code Playgroud)
预先感谢您的帮助