20250115-任子行-科技行业_Apache_Doris在任子行的应用实践_25页_6mb
报告摘要
Apache Doris 在任子行的应用实践总结
核心内容概述
本文档详细介绍了 Apache Doris 在任子行网络技术股份有限公司的应用实践,包括背景介绍、架构演进、企业实践及未来规划等方面。任子行作为国内网络安全行业的领军企业,通过引入 Apache Doris,有效解决了数据孤岛、写入吞吐瓶颈、数据更新困难以及离线分析效率低等问题,实现了降本增效和统一分析平台的目标。
主要观点
- 数据孤岛问题:任子行早期业务系统存在数据分散、无法共享和统一处理的问题。
- 技术选型挑战:Elasticsearch 存在写入瓶颈、高存储成本和聚合计算能力不足;Hadoop 生态架构复杂,缺乏湖生态技术储备。
- Apache Doris 优势:具备高查询并发、低存储成本、高计算能力、易用性好、社区活跃等优势,能够满足多种数据处理需求。
- 架构优化成果:通过调整分区策略和数据模型,显著提升了写入吞吐能力和系统稳定性,同时降低了存储成本。
- 统一分析平台:Apache Doris 支持即席查询、自助 BI 和自助 API,成为统一的数据分析平台。
- 未来规划:计划迁移 HBase 点查业务至 Apache Doris,接入日志分析业务,并引入 VARIANT 类型提升半结构化数据处理效率。
关键信息
1. 背景介绍
- 公司介绍:任子行成立于2000年,2012年上市,是网络安全行业的领军企业。
- 业务范围:涵盖网络安全、公共安全、信息安全、运营商网络资源安全、终端安全、5G数据安全、工业互联网安全等。
- 早期架构问题:
- 数据孤岛:数据分散,无法共享和统一处理。
- 无法二次分析:基于ETL的明细数据,不保留原始数据。
- 离线分析难度大:执行分析任务影响ES集群稳定性。
2. 架构演进
- 技术选型思考:
- Apache Doris:高并发、低存储成本、高计算能力、易用性好、社区活跃。
- ClickHouse:计算能力强,但并发能力较低、维护成本高。
- 数仓架构:
- ODS层:使用 Duplicate Key 模型存储原始数据。
- DWS层:根据数据特性选择 AggregatedKey 或 UniqueKey 模型。
- ADS层:用于对外输出,采用 Duplicate Key 和 UniqueKey 模型。
- 存储规模:
- 总数据规模:245TB
- 单日新增数据峰值:1.5亿条
- 总数据量:200+亿条
3. 企业实践
- 数据建模优化:
- ODS层:采用 Duplicate Key 模型存储原始数据。
- DWS层:根据数据更新和去重需求选择合适的模型。
- ADS层:统一使用 Duplicate Key 和 UniqueKey 模型。
- 写入吞吐提升:
- 调整分区策略为按“处理时间”进行按月分区,写入吞吐显著提升,compaction core 保持在 100+,CPU 负载回落至正常。
- 数据更新挑战:
- 社交用户数据因渠道不同,字段稳定性差,导致去重与合并复杂。
- 离线迁移实践:
- HBase to Doris:15亿账号数据迁移耗时6小时。
- Elasticsearch to Doris:需手动刷新元数据,优化数据结构以适应 Doris。
4. 总结规划
- 降本增效:
- 社交帖文数据存储成本降低 76.7%。
- 社交用户数据存储成本降低 71.5%。
- 社交关系数据存储成本降低 61.3%。
- 高效导数:
- 原有平台导数流程耗时1天,基于 Apache Doris 改造后耗时缩短至0.5天。
- 统一分析平台:
- 支持即席查询、自助 BI 和自助 API,提升数据使用效率。
- 高效计算:
- 社交关系计算时间从2小时缩短至10分钟。
- 未来规划:
- 迁移 HBase 点查业务至 Apache Doris。
- 接入日志分析业务,提升存储效率和分析准确性。
- 引入 VARIANT 类型,优化半结构化数据的存储和查询性能。
总结
Apache Doris 在任子行的应用实践表明,其在数据存储、计算、查询和管理方面具有显著优势。通过优化数据模型和分区策略,任子行有效解决了数据孤岛、写入瓶颈和更新困难等问题,实现了降本增效和统一分析平台的目标。未来,Apache Doris 将进一步支撑高并发点查、日志分析等业务场景,提升整体数据处理能力。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载