starrocks(张友东)_Data+Lakehouse_你的下一个数据仓库_20页_9mb
报告摘要
数据技术嘉年华总结
核心内容
数据技术嘉年华(DTC 2024)聚焦于智能、云原生、一体化的发展趋势,强调了数据库与AI协同创新以及模型与架构融合的重要性。会议重点介绍了Data Lakehouse架构,作为下一代数据平台,它结合了数据湖与数据仓库的优势,解决了传统架构中的数据孤岛、成本高、扩展性差、高级分析能力不足等问题。
数据湖与数据仓库的对比
数据湖
- 定义:如天然的水体,存储原始、结构化、半结构化和非结构化数据。
- 特点:
- 数据统一入湖管理
- 支持多种数据格式(Hive, Iceberg, Hudi等)
- 可以灵活支持AI与BI分析场景
数据仓库
- 定义:如装瓶的水,结构化、易于消费。
- 特点:
- 数据质量高,经过ETL处理
- 支持事务处理
- 查询性能优化,面向主题
湖仓分层架构的优势
核心优势
- 统一:
- 单一数据源(Single source of truth)
- 低成本、可扩展
- 开放:
- 不同应用灵活访问
- 支持开放格式和灵活schema
问题与挑战
- 数据可靠性:数据湖与数据仓库的数据口径不一致
- 数据时效性:数据先入湖,再同步到数据仓库
- 高级数据分析:数据仓库私有化格式限制分析能力
- 总体成本:复杂的ETL和冗余存储
StarRocks 3.0 的湖仓演进
存算分离架构升级
- 架构:FE负责元数据管理与查询计划构建,BE负责数据存储与查询执行
- 优势:
- 降低存储成本约80%
- 云对象存储可靠性达11个9
- 秒级增加、删除计算节点
多仓库架构
- 特点:
- 多仓库共享同一份数据
- 仓库间Workload物理隔离
- 仓库内部独立按需弹性扩展
Data Lakehouse 实践案例
腾讯微信
- 数据统一存储在Iceberg
- 基于StarRocks实现准实时分析
- 数据新鲜度从小时/天级提升至分钟级
- 查询性能提升3-6倍
携程旅行
- 数据统一存储在Hive
- StarRocks直接服务BI报表和交互式分析
- 重点业务场景按需创建物化视图加速查询
- 查询性能提升10+倍
Data Lakehouse 构建方法
1. 构建开放湖
- 实现单一数据源(Single source of truth)
- 支持开放的数据存储格式
2. 数据湖分析
- 提供极速数据湖查询性能
- 统一支持多样化分析场景(BI、Ad-hoc、Realtime等)
3. 按需加速
- 支持物化视图按需建模
- 查询透明加速(Aggregate、Join等)
查询加速技术
- CBO(Cost-Based Optimization):基于成本的查询优化
- 向量化执行引擎:提升查询执行效率
- IO合并(IO Coalesce):减少IO开销
- 延迟物化(Late Materialization):优化查询执行路径
- 本地缓存(Local data cache):减少远程IO延迟
与Trino的兼容性
- 支持TrinoSQL的关键字、函数转义等
- 兼容度达90%+
- Trino SQL转换为StarRocks AST,复用高性能查询引擎
数据分析架构演进
- 从传统数据仓库到数据湖,再到湖仓一体
- 通过统一目录(Unified catalog)实现数据湖与数据仓库的统一访问与管理
- 简化数据建模,提升查询性能与数据治理效率
总结
数据湖仓架构(Data Lakehouse)正在成为企业数据平台的主流选择,它结合了数据湖的灵活性和数据仓库的高性能,通过统一目录、异步物化视图、查询透明加速等技术手段,实现了数据的统一管理与高效分析。StarRocks 3.0通过存算分离架构和多仓库设计,显著提升了数据处理的弹性与性能,为BI、实时分析和AI等场景提供了强有力的支持。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载