Talkingdata--T112019-数据智能技术峰会-物联网大数据的高效处理_44页_14mb
报告摘要
物联网时序大数据的高效处理总结
核心内容
物联网时序大数据的高效处理是当前工业大数据应用中的关键问题。随着物联网设备数量的激增和数据采集频率的提高,传统的实时数据库和通用大数据方案都面临性能、成本和复杂度的挑战。TDengine 作为一款专为物联网时序数据设计的数据库,提供了高效、低成本、易用的解决方案,满足了大数据时代对时序数据处理的需求。
主要观点
-
物联网数据特征:
- 数据量巨大,一天的数据量可能超过100亿条。
- 数据是结构化的、时序的,且每个采集点的数据源唯一。
- 数据以写操作为主,读操作为辅,且很少有更新或删除操作。
- 数据按时间进行删除,支持按时间段和区域查询。
-
传统实时数据库的挑战:
- 缺乏水平扩展能力,数据量增加只能依靠硬件scale up。
- 技术架构陈旧,使用磁盘阵列,运行在Windows环境下。
- 数据分析能力弱,不支持大数据分析接口。
- 无法支持云端部署,不支持PaaS。
-
通用大数据方案的挑战:
- 需要集成多种系统,开发复杂,运维成本高。
- 系统资源消耗大,性能低下,且数据一致性难以保证。
关键信息
TDengine 提供的功能
- 消息队列:自带消息队列功能,支持数据实时采集和传输。
- 缓存:支持设备最新数据实时返回,无需额外集成缓存软件。
- 数据库:支持实时数据库和历史数据库操作,对应用透明。
- 流式计算:支持对一个或多个数据流进行实时聚合计算。
- 数据订阅:支持应用订阅数据流,实现数据实时推送。
TDengine 的产品竞争力
- 性能提升:通过创新的时序数据存储结构和无锁设计,性能比通用数据库高10倍以上。
- 存储优化:列式存储和先进压缩算法,存储空间仅为通用数据库的1/10。
- 总拥有成本下降:系统架构简化,无需集成多个软件,运维成本大幅降低。
- 零学习成本:API与MySQL高度相似,支持标准SQL语法,便于快速上手。
- 完全无中心化设计:支持集群部署,单个节点故障不影响系统运行,具备自动负载均衡能力。
- 支持异构环境:可与多种大数据处理工具(如Spark、Hadoop)无缝对接,兼容性好。
TDengine 的系统结构
- 物理节点:支持虚拟节点配置,可灵活扩展。
- 虚拟数据节点:存储时序数据,支持数据实时同步,保证高可靠性。
- 虚拟管理节点:负责集群管理、负载均衡和元数据管理,自动创建三个虚拟管理节点以提高系统稳定性。
TDengine 的存储结构
- 每个采集点数据独立存储为一张表,数据在介质上连续存放,提升读取和查询效率。
- 数据写入采用日志方式,支持按时间分级存储,降低存储成本。
- 支持列式存储和多种压缩算法,提升存储效率。
TDengine 的数据写入与查询
- 使用标准SQL语法进行数据插入和查询。
- 支持超级表(STable)概念,方便多个采集点数据聚合。
- 支持时间轴上的数据聚合操作,如downsampling和滑动窗口计算。
TDengine 的水平扩展能力
- 支持完全线性的水平扩展,数据插入和查询吞吐量与延时随节点数线性增长。
TDengine 的运维管理
- 零管理:无需分库分表,支持动态调整副本数和IDC迁移。
- 运维工具:支持数据导入、导出,以及Web管理界面,提供系统监控和日志查询功能。
- 异地容灾:支持自动切换Master节点,实现无缝IDC迁移和数据备份。
结论
TDengine 是一款专为物联网时序数据设计的数据库,通过充分利用时序数据的特征,提供了高性能、低成本、易用的解决方案。其无中心化设计、列式存储、压缩算法和水平扩展能力,使其在处理海量时序数据时具有显著优势。此外,其与多种大数据工具的兼容性和简单易用的API,进一步增强了其在物联网和工业4.0场景中的应用价值。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载