小编Dan*_*SFT的帖子

何时比Spark更喜欢Hadoop MapReduce?

非常简单的问题:我应该在哪些情况下更喜欢Hadoop MapReduce而不是Spark?(我希望还没有提出这个问题 - 至少我没有找到它......)

我目前正在对这两个处理框架进行比较,从我到目前为止所阅读的内容来看,每个人似乎都建议使用Spark.这也符合您的经验吗?或者你能说出MapReduce比Spark更好的用例吗?

我是否需要更多的资源(特别是RAM)用于Spark的同一任务,那么我需要MapReduce?

感谢致敬!

java hadoop mapreduce apache-spark

9
推荐指数
1
解决办法
1950
查看次数

Amazon Redshift:使用Java API将数据从S3插入表中

我目前在S3中有一个文件.我想使用Java AWS SDK发出命令,以获取此数据并将其放入RedShift表中.如果表不存在,我还想创建表.我一直无法找到关于如何做到这一点的任何明确的例子,所以我想知道我是否采取了错误的方式?我应该使用标准的postgres java连接器而不是AWS SDK吗?

amazon-s3 amazon-web-services amazon-redshift

8
推荐指数
1
解决办法
7805
查看次数

使用Microsoft Azure机器学习查看rgl图

在Azure-ml工作室中使用"执行R脚本模块",当我绘制到rgl设备时,我在R设备输出的图形部分下面得到一个损坏的图像图标.

有没有办法查看(甚至与之交互)生成的rgl设备?如果没有,有什么方法可以将rgl输出传输到标准R图形设备?

简单的例子:

# put this code inside the execute R script module
library(rgl)
rgl.spheres(0,0,0, radius=1, col="red")
Run Code Online (Sandbox Code Playgroud)

需要明确的是,我知道rgl.snapshotrgl.postscript以及如何保存和/或查看RGL设备在标准的R会话,但一直没能做出这些标准的方法在蔚蓝毫升工作.

r rgl azure-machine-learning-studio cortana-intelligence

8
推荐指数
1
解决办法
453
查看次数

Azure机器学习请求响应延迟

我做了一个Azure机器学习实验,它采用一个小数据集(12x3数组)和一些参数,并使用一些Python模块进行一些计算(线性回归计算等等).一切正常.

我已经部署了实验,现在想从我的应用程序的前端向它抛出数据.API调用会进入并返回正确的结果,但计算简单的线性回归最多需要30秒.有时它是20秒,有时只有1秒.我甚至一次将它降低到100毫秒(这是我想要的),但90%的时间请求完成超过20秒,这是不可接受的.

我想这与它仍然是一个实验有关,或者它仍然在开发槽中,但是我找不到让它在更快的机器上运行的设置.

有没有办法加快我的执行速度?

编辑:澄清:使用相同的测试数据获得不同的时序,只需多次发送相同的请求即可.这让我得出结论,它必须与我的请求被放入队列有关,有一些启动延迟或我以其他方式受到限制.

python azure azure-machine-learning-studio

8
推荐指数
1
解决办法
687
查看次数

Azure Spark SQL与U-SQL

我有很多数据文件,最终会定期推送并存储在Azure Storage/Data Lake上.我想提供对此数据进行分析的能力,但后来我发现在Azure上有两种方法:

  1. U-SQL/Azure Data Lake查询(Visualization ???)
  2. 在Azure和Zeppelin上使用Spark的Spark SQL

可以有人建议我何时使用这种方法中的哪一种?在我看来,两者都可以做类似的工作.

azure apache-spark-sql azure-data-lake u-sql cortana-intelligence

8
推荐指数
1
解决办法
3717
查看次数

机器学习建议

我有很多学生根据他们的分数被一些大学选中的数据.我刚接触机器学习.我是否可以提供一些建议如何添加Azure机器学习以根据他们的分数预测他们可以获得的大学

azure-machine-learning-studio

7
推荐指数
1
解决办法
734
查看次数

将压缩文件插入RedShift

我在s3中有一个压缩文件.我想将其插入RedShift数据库.我的研究发现这样做的唯一方法是启动ec2实例.将文件移动到那里,解压缩并将其发送回S3.然后将其插入我的RedShift表.但我试图从外部机器上从JavaSDK完成这一切,并且不想使用Ec2实例.有没有办法让EMR作业解压缩文件?或者将压缩文件直接插入RedShift?

文件是.zip而不是.gzip

amazon-redshift

6
推荐指数
1
解决办法
5334
查看次数

在Python中绘制分段函数

我想使用Matplotlib在Python中从0到5绘制以下分段函数。

f(x) = 1, x != 2; f(x) = 0, x = 2

在Python中...

def f(x):
 if(x == 2): return 0
 else: return 1
Run Code Online (Sandbox Code Playgroud)

使用NumPy我创建一个数组

x = np.arange(0., 5., 0.2)

    array([ 0. ,  0.2,  0.4,  0.6,  0.8,  1. ,  1.2,  1.4,  1.6,  1.8,  2. ,
        2.2,  2.4,  2.6,  2.8,  3. ,  3.2,  3.4,  3.6,  3.8,  4. ,  4.2,
        4.4,  4.6,  4.8])
Run Code Online (Sandbox Code Playgroud)

我尝试过类似...

import matplotlib.pyplot as plt
plt.plot(x,f(x))
Run Code Online (Sandbox Code Playgroud)

要么...

vecfunc = np.vectorize(f)
result = vecfunc(t)
Run Code Online (Sandbox Code Playgroud)

要么...

def piecewise(x):
 if x == …
Run Code Online (Sandbox Code Playgroud)

python numpy matplotlib python-3.x

6
推荐指数
2
解决办法
1万
查看次数

从Azure ML中的pyodbc连接到Azure SQL数据库的驱动程序的名称是什么?

我正在尝试使用Azure ML中的"执行python脚本"模块创建一个" 读取器 "替代方法来从Azure SQL数据库中读取数据.在这样做时,我正在尝试使用pyodbc库连接到Azure Sql.这是我的代码:

def azureml_main(dataframe1 = None, dataframe2 = None):
    import pyodbc   
    import pandas as pd

    conn = pyodbc.connect('DRIVER={SQL Server}; SERVER=server.database.windows.net; DATABASE=db_name; UID=user; PWD=Password')
    SQLCommand = ('''select * from table1 ''')
    data_frame = pd.read_sql(SQLCommand, conn)
    return data_frame,
Run Code Online (Sandbox Code Playgroud)

还试图使用不同的驱动程序名称:{SQL Server Native Client 11.0}

这是我得到的错误:

Error: ('IM002', '[IM002] [Microsoft][ODBC Driver Manager] Data source name not found and no default driver specified (0) (SQLDriverConnect)')
Run Code Online (Sandbox Code Playgroud)

有谁知道我应该使用哪个驱动程序?

只是为了确保,我尝试了"{SQL Server}","{SQL Server Native Client 11.0}"和"{SQL Server Native Client 10.0}"并得到了同样的错误

我也尝试了不同的格式:

conn = …
Run Code Online (Sandbox Code Playgroud)

python pyodbc azure-machine-learning-studio azure-sql-database cortana-intelligence

6
推荐指数
1
解决办法
1718
查看次数

如何选择使用Maven执行哪些JUnit5标签

我刚刚升级了我的解决方案以使用JUnit5.现在尝试为我的测试创建具有两个标签的标签:@Fast@Slow.首先,我使用下面的maven条目来配置使用我的默认构建运行的测试.这意味着当我执行时,mvn test我的快速测试将执行.我假设我可以使用命令行覆盖它.但我无法弄清楚我要进入慢速测试的内容......

我假设像...... mvn test -Dmaven.IncludeTags=fast,slow这样的东西不起作用

<plugin>
    <artifactId>maven-surefire-plugin</artifactId>
    <version>2.19.1</version>
    <configuration>
        <properties>
            <includeTags>fast</includeTags>
            <excludeTags>slow</excludeTags>
        </properties>
    </configuration>
    <dependencies>
        <dependency>
            <groupId>org.junit.jupiter</groupId>
            <artifactId>junit-jupiter-engine</artifactId>
            <version>5.0.0-M3</version>
        </dependency>
        <dependency>
            <groupId>org.junit.platform</groupId>
            <artifactId>junit-platform-surefire-provider</artifactId>
            <version>1.0.0-M3</version>
        </dependency>
    </dependencies>
</plugin>
Run Code Online (Sandbox Code Playgroud)

java junit maven junit5

6
推荐指数
3
解决办法
6049
查看次数