Job*_*obi 7 azure azure-data-lake u-sql databricks
目前,我所有的数据文件都存储在Azure Data Lake Store中。我需要处理这些大多数为csv格式的文件。该处理将在这些文件上运行作业,以提取与特定场景有关的日期或特定事件的特定数据(例如Data)的各种信息,或从多个表/文件添加数据。这些作业每天通过数据工厂(v1或v2)中的u-sql作业运行,然后发送到powerBI进行可视化。
使用ADLA进行所有这些处理,我觉得处理需要很多时间,而且看起来非常昂贵。我建议我将Azure Databricks用于上述过程。有人可以帮助我朝着两者之间的方向发展吗?我可以将所有U-sql作业修改为Databricks笔记本格式吗?
免责声明:我为Databricks工作。
在不知道您要使用多少数据,数据类型或处理时间长的情况下,很难给出优缺点或建议。如果要将Azure的Data Lake Analytics成本与Databricks进行比较,则只能通过与销售团队成员交谈才能准确地完成。
请记住,ADLA基于YARN群集管理器(来自Hadoop),并且仅运行U-SQL批处理工作负载。蓝色花岗岩的描述:
ADLA is focused on batch processing, which is great for many Big Data workloads.
Some example uses for ADLA include, but are not limited to:
- Prepping large amounts of data for insertion into a Data Warehouse
- Processing scraped web data for science and analysis
- Churning through text, and quickly tokenizing to enable context and sentiment analysis
- Using image processing intelligence to quickly process unstructured image data
- Replacing long-running monthly batch processing with shorter running distributed processes
Run Code Online (Sandbox Code Playgroud)
Databricks涵盖批处理和流处理,并处理ETL(数据工程师)和数据科学(机器学习,深度学习)工作负载。通常,这就是公司使用Databricks的原因。
除了这些原因之外,还有更多原因,但其中一些是最常见的原因。如果您认为这可能对您的情况有所帮助,则应在网站上进行试用。
| 归档时间: |
|
| 查看次数: |
1970 次 |
| 最近记录: |