T112019-数据智能技术峰会-物联网大数据的高效处理-2019.11.25-44页_13mb
报告摘要
物联网时序大数据的高效处理总结
核心内容
物联网数据具有时序性和结构化特征,且数据量巨大,传统数据库和大数据方案在处理时面临诸多挑战,如性能不足、成本高昂、开发运维复杂等。为应对这些问题,涛思数据推出了TDengine,一款专为物联网时序数据设计的数据库,具备高效处理、低总拥有成本、零学习成本和完全无中心化设计等优势。
主要观点
- 物联网数据特征:数据是时序的、结构化的,且以写操作为主,读操作为辅,数据量巨大,每天可超过100亿条记录。
- 传统实时数据库问题:如OSIsoft PI等传统数据库虽然性能较好,但在大数据时代缺乏水平扩展能力,技术架构陈旧,且数据分析能力有限。
- 通用大数据方案的不足:集成多个开源工具(如Kafka、Redis、Hadoop等)导致开发运维复杂,系统资源消耗大,成本高。
- TDengine的优势:
- 提供高效可靠的时序数据采集、插入、查询和计算功能。
- 支持多种语言接口(C/C++、Java、Python等),与MySQL语法兼容,学习成本低。
- 完全无中心化设计,支持自动负载均衡和高可靠性。
- 提供水平扩展能力,性能线性增长,支持大规模数据处理。
- 支持数据压缩,存储空间仅为通用数据库的1/10,且压缩率高。
- 支持数据订阅,实时推送数据到应用系统。
- 支持异构环境,可与Oracle、MySQL、Cassandra、MongoDB等系统并存。
- 零管理,简化系统架构,降低运维成本。
关键信息
数据处理能力
- 性能提升:TDengine的插入和读取速度比通用数据库快10倍以上。
- 数据压缩:采用列式存储和多种压缩算法(如delta-delta编码、LZ4等),存储空间节省显著。
- 数据写入:数据写入采用日志方式,按时间分级存储,提高数据落盘、同步、恢复、删除效率。
- 数据聚合:支持时间轴聚合(如每五分钟的平均值)和标签过滤聚合(如按地理位置查询)。
系统架构
- 虚拟节点与物理节点:每个物理节点可配置多个虚拟节点,虚拟节点组内的数据实时同步。
- 虚拟管理节点:系统自动创建三个虚拟管理节点,确保高可靠和负载均衡。
- 水平扩展:支持完全线性扩展,数据插入和查询吞吐量随节点数线性增长。
应用场景
- 工业监测:如CNC计算机数控、车辆/设备实时监测、电力IDC运维监测。
- 智慧城市:如智能电表、水表、气表监测,天气、空气、水文地质环境监测。
- IT运维:如服务器/应用监测、用户访问日志、广告点击日志等。
技术特点
- 一表一采集点:每个采集点对应一张表,数据在介质上连续存放,减少随机读取。
- 超级表(STable):支持多个采集点数据聚合,标签用于区分采集点静态属性。
- 实时流式计算:支持多种聚合操作(如平均值、最大值、最小值等),并可将结果写入新表。
- 数据订阅:支持类似Kafka的数据订阅机制,应用可实时获取数据更新。
- 异地容灾与备份:支持无服务中断的IDC迁移,数据自动实时备份,无需第三方工具。
TDengine 生态与工具
- 接口支持:提供REST API,支持与多种大数据工具(如Spark、Hadoop)无缝对接。
- 运维工具:
- 支持数据导入、导出(SQL脚本、数据文件、CSV等)。
- 提供Web管理工具,操作可视化,便于监控和日志查询。
- 支持与运维监测平台对接,使用标准SQL获取数据。
总结
TDengine 作为一款专为物联网时序数据设计的数据库,解决了传统数据库和通用大数据方案在性能、成本、开发运维等方面的瓶颈。其独特的架构设计、高效的数据处理能力、灵活的接口支持和简化运维流程,使其成为物联网、工业4.0等场景下的理想选择。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载