非常简单的问题:我应该在哪些情况下更喜欢Hadoop MapReduce而不是Spark?(我希望还没有提出这个问题 - 至少我没有找到它......)
我目前正在对这两个处理框架进行比较,从我到目前为止所阅读的内容来看,每个人似乎都建议使用Spark.这也符合您的经验吗?或者你能说出MapReduce比Spark更好的用例吗?
我是否需要更多的资源(特别是RAM)用于Spark的同一任务,那么我需要MapReduce?
感谢致敬!
我目前在S3中有一个文件.我想使用Java AWS SDK发出命令,以获取此数据并将其放入RedShift表中.如果表不存在,我还想创建表.我一直无法找到关于如何做到这一点的任何明确的例子,所以我想知道我是否采取了错误的方式?我应该使用标准的postgres java连接器而不是AWS SDK吗?
在Azure-ml工作室中使用"执行R脚本模块",当我绘制到rgl设备时,我在R设备输出的图形部分下面得到一个损坏的图像图标.
有没有办法查看(甚至与之交互)生成的rgl设备?如果没有,有什么方法可以将rgl输出传输到标准R图形设备?
简单的例子:
# put this code inside the execute R script module
library(rgl)
rgl.spheres(0,0,0, radius=1, col="red")
Run Code Online (Sandbox Code Playgroud)
需要明确的是,我知道rgl.snapshot和rgl.postscript以及如何保存和/或查看RGL设备在标准的R会话,但一直没能做出这些标准的方法在蔚蓝毫升工作.
我做了一个Azure机器学习实验,它采用一个小数据集(12x3数组)和一些参数,并使用一些Python模块进行一些计算(线性回归计算等等).一切正常.
我已经部署了实验,现在想从我的应用程序的前端向它抛出数据.API调用会进入并返回正确的结果,但计算简单的线性回归最多需要30秒.有时它是20秒,有时只有1秒.我甚至一次将它降低到100毫秒(这是我想要的),但90%的时间请求完成超过20秒,这是不可接受的.
我想这与它仍然是一个实验有关,或者它仍然在开发槽中,但是我找不到让它在更快的机器上运行的设置.
有没有办法加快我的执行速度?
编辑:澄清:使用相同的测试数据获得不同的时序,只需多次发送相同的请求即可.这让我得出结论,它必须与我的请求被放入队列有关,有一些启动延迟或我以其他方式受到限制.
我有很多数据文件,最终会定期推送并存储在Azure Storage/Data Lake上.我想提供对此数据进行分析的能力,但后来我发现在Azure上有两种方法:
可以有人建议我何时使用这种方法中的哪一种?在我看来,两者都可以做类似的工作.
azure apache-spark-sql azure-data-lake u-sql cortana-intelligence
我有很多学生根据他们的分数被一些大学选中的数据.我刚接触机器学习.我是否可以提供一些建议如何添加Azure机器学习以根据他们的分数预测他们可以获得的大学
我在s3中有一个压缩文件.我想将其插入RedShift数据库.我的研究发现这样做的唯一方法是启动ec2实例.将文件移动到那里,解压缩并将其发送回S3.然后将其插入我的RedShift表.但我试图从外部机器上从JavaSDK完成这一切,并且不想使用Ec2实例.有没有办法让EMR作业解压缩文件?或者将压缩文件直接插入RedShift?
文件是.zip而不是.gzip
我想使用Matplotlib在Python中从0到5绘制以下分段函数。
f(x) = 1, x != 2; f(x) = 0, x = 2
在Python中...
def f(x):
if(x == 2): return 0
else: return 1
Run Code Online (Sandbox Code Playgroud)
使用NumPy我创建一个数组
x = np.arange(0., 5., 0.2)
array([ 0. , 0.2, 0.4, 0.6, 0.8, 1. , 1.2, 1.4, 1.6, 1.8, 2. ,
2.2, 2.4, 2.6, 2.8, 3. , 3.2, 3.4, 3.6, 3.8, 4. , 4.2,
4.4, 4.6, 4.8])
Run Code Online (Sandbox Code Playgroud)
我尝试过类似...
import matplotlib.pyplot as plt
plt.plot(x,f(x))
Run Code Online (Sandbox Code Playgroud)
要么...
vecfunc = np.vectorize(f)
result = vecfunc(t)
Run Code Online (Sandbox Code Playgroud)
要么...
def piecewise(x):
if x == …Run Code Online (Sandbox Code Playgroud) 我正在尝试使用Azure ML中的"执行python脚本"模块创建一个" 读取器 "替代方法来从Azure SQL数据库中读取数据.在这样做时,我正在尝试使用pyodbc库连接到Azure Sql.这是我的代码:
def azureml_main(dataframe1 = None, dataframe2 = None):
import pyodbc
import pandas as pd
conn = pyodbc.connect('DRIVER={SQL Server}; SERVER=server.database.windows.net; DATABASE=db_name; UID=user; PWD=Password')
SQLCommand = ('''select * from table1 ''')
data_frame = pd.read_sql(SQLCommand, conn)
return data_frame,
Run Code Online (Sandbox Code Playgroud)
还试图使用不同的驱动程序名称:{SQL Server Native Client 11.0}
这是我得到的错误:
Error: ('IM002', '[IM002] [Microsoft][ODBC Driver Manager] Data source name not found and no default driver specified (0) (SQLDriverConnect)')
Run Code Online (Sandbox Code Playgroud)
有谁知道我应该使用哪个驱动程序?
只是为了确保,我尝试了"{SQL Server}","{SQL Server Native Client 11.0}"和"{SQL Server Native Client 10.0}"并得到了同样的错误
我也尝试了不同的格式:
conn = …Run Code Online (Sandbox Code Playgroud) python pyodbc azure-machine-learning-studio azure-sql-database cortana-intelligence
我刚刚升级了我的解决方案以使用JUnit5.现在尝试为我的测试创建具有两个标签的标签:@Fast和@Slow.首先,我使用下面的maven条目来配置使用我的默认构建运行的测试.这意味着当我执行时,mvn test我的快速测试将执行.我假设我可以使用命令行覆盖它.但我无法弄清楚我要进入慢速测试的内容......
我假设像...... mvn test -Dmaven.IncludeTags=fast,slow这样的东西不起作用
<plugin>
<artifactId>maven-surefire-plugin</artifactId>
<version>2.19.1</version>
<configuration>
<properties>
<includeTags>fast</includeTags>
<excludeTags>slow</excludeTags>
</properties>
</configuration>
<dependencies>
<dependency>
<groupId>org.junit.jupiter</groupId>
<artifactId>junit-jupiter-engine</artifactId>
<version>5.0.0-M3</version>
</dependency>
<dependency>
<groupId>org.junit.platform</groupId>
<artifactId>junit-platform-surefire-provider</artifactId>
<version>1.0.0-M3</version>
</dependency>
</dependencies>
</plugin>
Run Code Online (Sandbox Code Playgroud) azure-machine-learning-studio ×4
python ×3
azure ×2
java ×2
amazon-s3 ×1
apache-spark ×1
hadoop ×1
junit ×1
junit5 ×1
mapreduce ×1
matplotlib ×1
maven ×1
numpy ×1
pyodbc ×1
python-3.x ×1
r ×1
rgl ×1
u-sql ×1