2025-01-15-DORIS_SUMMIT-科技行业_Apache_Doris在任子行的应用实践_25页_6mb
报告摘要
Apache Doris 在任子行的应用实践总结
核心内容
任子行网络技术股份有限公司作为国内网络安全行业领军企业,自2000年成立以来,业务涵盖多个领域,包括网络安全、公共安全、信息安全等。随着业务的发展,数据量迅速增长,原有的数据架构面临诸多挑战,如数据孤岛、无法二次分析、离线分析难度大等问题。为此,任子行引入 Apache Doris 作为统一的数据处理平台,以解决这些问题并实现降本增效的目标。
主要观点
技术选型思考
在对比 Elasticsearch 和 Hadoop 生态后,Apache Doris 被认为在多个方面具备优势:
- 查询并发:支持高并发查询;
- 存储成本:存储成本较低;
- 计算能力:具备强大的计算能力,支持低延迟聚合查询;
- 维护成本:维护成本低;
- 社区活跃:社区活跃度高,文档详尽;
- 易用性:支持标准 SQL 协议,使用成本低,架构简单,仅需 FE 和 BE 两个进程。
数仓架构演进
任子行采用 ODS(贴源层)、DWS(汇总层)、ADS(应用层) 三层架构进行数据管理:
- ODS 层:使用 Duplicate Key 模型存储原始数据;
- DWS 层:根据数据特性选择 AggregatedKey 或 UniqueKey 模型,分别用于指标语句和去重合并;
- ADS 层:主要使用 DuplicateKey 和 UniqueKey 模型,支持点查和实时更新。
存储规模
- 总数据规模:245TB;
- 单日新增数据峰值:1.5亿条;
- 总数据量:200+亿条。
关键信息
数据写入优化
通过调整分区策略,将分区字段由“发布日期”改为“处理时间”,显著提升了写入吞吐量,减少了 compaction core 的负载,并解决了版本堆积导致的写入失败问题。
数据更新挑战
在社交用户数据场景中,由于不同数据渠道的字段内容不一致,导致数据去重与合并成为一大挑战。Apache Doris 的 UniqueKey 模型有效支持了这一需求。
离线迁移实践
- HBase to Doris:15亿账号数据通过 DataX 串行化迁移,耗时6小时;
- Elasticsearch to Doris:需在 Elasticsearch 索引映射的 _meta 部分添加特定注释,并通过 REFRESH 命令刷新元数据。
降本增效成果
在多种数据类型的对比中,Apache Doris 的存储成本比 Elasticsearch 降低了 61% - 76%,尤其在社交帖文数据场景下,存储空间从5.98TB降至1.393TB,显著节省了资源。
高效导数流程
原有平台导数流程需要1天,而基于 Apache Doris 的架构改造后,导数流程缩短至 0.5天,大幅提升了数据处理效率。
统一分析平台优势
- 即席查询:支持在数十亿级表中实时查看数据明细,通过关键词、时间、实体等纬度筛选;
- 自助 BI:基于 SQL 轻松完成 BI 报表与数据大屏开发;
- 自助 API:通过 SQL 定义输入输出,即可生成 API。
高效计算能力
- 原有流程:社交关系计算耗时2小时;
- Apache Doris 改造后:计算时间缩短至 10分钟,显著提升了计算效率。
未来规划
- 高并发点查:将 HBase 的点查业务迁移至 Apache Doris,统一支撑高并发查询场景。
- 接入日志分析业务:通过 Apache Doris 节省日志数据存储空间,支持更长的数据保存周期,缓解写入瓶颈,提升分析准确性。
- 引入 VARIANT 类型:解决 TEXT 和 JSON 类型在压缩方面的不足,提升半结构列的查询性能。
总结
Apache Doris 在任子行的应用实践中,成功解决了数据孤岛、写入瓶颈、存储成本高、分析效率低等问题,显著提升了数据处理能力与平台的易用性。未来,任子行将继续深化 Apache Doris 在数据处理与分析中的应用,进一步优化架构,实现更高效、更低成本的数据治理目标。
试读结束,高清完整版pdf/doc/ppt,请点下载