2017年十大大数据趋势(英文版)_11页_1mb
报告摘要
2017 Big Data Trends Summary
核心内容
2017年,大数据领域经历了显著的变化,技术成熟度提升,应用场景更加广泛。企业对大数据的需求从单纯的存储和处理转向了更深层次的分析和应用,同时对工具的易用性和灵活性提出了更高的要求。
主要观点
- 大数据处理加速:企业对Hadoop平台上的交互式SQL性能需求增加,推动了更快的数据库和查询加速技术的发展。
- Hadoop不再单一:Hadoop不再是仅用于批处理的平台,而是演变为多功能引擎,用于实时分析和操作报告。
- 数据湖成为主流:数据湖被广泛用于存储和处理来自不同来源的数据,企业开始重视其商业价值,并推动其重复使用和敏捷应用。
- 数据多样性驱动投资:数据的多样性(Variety)成为企业投资大数据的主要驱动力,而非单纯的体积(Volume)或速度(Velocity)。
- Spark引领机器学习革命:Apache Spark因其实时处理和机器学习能力成为企业首选平台,推动了更多AI和数据科学应用的开发。
- IoT、云和大数据融合:物联网数据在云平台上快速增长,企业需要更高效的分析工具来整合和理解这些数据。
- 自助式数据准备成为趋势:企业用户开始使用自助式数据准备工具来简化数据处理流程,提高分析效率。
- Hadoop融入企业标准:Hadoop逐渐成为企业IT架构的核心部分,安全和治理能力成为企业级平台的重要考量。
- 元数据目录提升数据发现效率:元数据目录帮助企业用户发现和理解有价值的数据,降低数据使用的门槛。
关键信息
1. Big data becomes fast and approachable: Options expand to speed up Hadoop
- 需求:企业用户希望使用Hadoop数据进行快速分析,尤其是KPI仪表板和探索性分析。
- 解决方案:采用更快的数据库和查询加速技术,如Exasol、MemSQL、Kudu等。
- 工具:SQL-on-Hadoop引擎(Impala、Hive LLAP、Presto、Phoenix、Drill)和OLAP-on-Hadoop技术(AtScale、Jethro Data、Kyvos Insights)。
2. Big data no longer just Hadoop: Purpose-built tools for Hadoop become obsolete
- 趋势:企业不再局限于单一数据源(如Hadoop),而是需要整合多源数据进行分析。
- 结果:数据源多样化的趋势促使企业选择数据和源无关的平台,而专为Hadoop设计的工具逐渐被淘汰。
- 案例:Platfora的退出是这一趋势的早期迹象。
3. Organizations leverage data lakes from the get-go to drive value
- 数据湖定义:数据湖是存储各种结构化和非结构化数据的中心仓库。
- 转变:企业不再仅关注数据湖的构建,而是更注重其实际应用价值。
- 业务影响:数据湖的使用促进了业务与IT的协作,自助式平台被广泛认可。
4. Architectures mature to reject one-size-fits all frameworks
- 架构发展:企业开始根据具体用例设计数据架构,而非采用通用框架。
- 考虑因素:包括用户角色、数据类型、访问频率、数据速度和聚合层级等。
- 灵活性:现代架构结合了自服务数据准备工具、Hadoop核心和分析平台,能够灵活调整。
5. Variety, not volume or velocity, drives big-data investments
- 定义:大数据的三大特征是Volume、Velocity、Variety。
- 趋势:Variety成为主要驱动力,企业整合更多数据源,关注“长尾”数据。
- 数据格式:JSON、嵌套类型、Avro、Parquet等格式的增多,使连接器的重要性上升。
6. Spark and machine learning light up big data
- Spark崛起:Spark因其高效处理和实时能力成为企业首选。
- 调查结果:70%的数据架构师、IT经理和BI分析师偏好Spark而非MapReduce。
- 机器学习:Spark推动了机器学习、AI和图算法平台的发展,如Microsoft Azure ML。
7. The convergence of IoT, cloud, and big data create new opportunities for self-service analytics
- IoT数据增长:物联网设备产生大量结构化和非结构化数据,这些数据常部署在云平台上。
- 挑战:数据的异构性和分散性使数据访问和理解变得困难。
- 需求:企业需要能够无缝连接和整合多种云数据源的分析工具。
8. Self-service data prep becomes mainstream as end users begin to shape big data
- 自助式数据准备:企业用户开始使用自助式工具来简化数据处理流程。
- 工具示例:Alteryx、Trifacta、Paxata等公司推出创新工具,提升数据处理效率。
- 影响:降低了Hadoop采用门槛,推动了自助式分析的发展。
9. Big data grows up: Hadoop adds to enterprise standards
- Hadoop成熟:Hadoop成为企业IT架构的核心部分,企业开始重视其安全和治理能力。
- 技术组件:Apache Sentry、Apache Atlas、Apache Ranger等工具增强了Hadoop的安全性和治理能力。
- 期望:企业开始要求其关系型数据库管理系统(RDBMS)具备类似功能。
10. Rise of metadata catalogs helps people find analysis-worthy big data
- 元数据目录:帮助企业用户发现和理解有价值的数据。
- 功能:自动标签化、发现数据关系、提供查询建议。
- 公司示例:Alation和Waterline利用机器学习技术提升数据发现效率。
- 趋势:自助式发现成为自助式分析的自然延伸,需求和意识在2017年持续增长。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载