2018年-Talkingdata_【智能数据技术峰会】数据科学的挑战_31页_3mb
报告摘要
数据科学的挑战与TalkingData的解决方案
核心内容
数据科学在大数据时代面临诸多挑战,其中计算瓶颈是主要问题之一。随着数据量的增长,传统算法和计算框架在处理大规模数据时存在效率低下、资源限制等问题。TalkingData作为一家专注于数据科学的企业,提出了多种解决方案,包括并行化技术、大规模机器学习平台和智能训练方法,以克服这些挑战。
主要观点
- 计算瓶颈:随着数据量的增长,计算需求呈指数级上升,传统的单机计算模式无法满足大数据处理的需求。
- 并行化技术:为了提高计算效率,TalkingData开发了多种并行化技术,如AllReduce、Graph-Base、Parameter Server等。
- 大规模机器学习平台:TalkingData构建了大规模机器学习平台,支持高效的模型训练和优化。
- 随机决策树和随机决策哈希算法:TalkingData提出了RDT和RDH算法,这些算法在精度和训练时间上优于传统方法。
- SGD方法的优化:通过动态调节学习率和模型稀疏度,SGD方法在大规模数据处理中表现出色。
- Fregata - TalkingData的大规模机器学习算法库:Fregata基于Spark开发,具有超大规模处理能力、成熟稳定、智能训练和超高速度等优势。
关键信息
计算瓶颈
- 数据增长:数据量的快速增长导致计算需求倍增。
- 资源限制:单机计算模式在处理大规模数据时效率低下,无法满足实际需求。
- 并行化需求:需要高效的并行计算框架来处理大数据。
并行化技术
- AllReduce:支持多种并行模式,但同步代价大,网络瓶颈较大。
- MPI:不是为大数据设计,开发不友好,容错性差。
- MapReduce:模型规模有限制,同步代价大,网络瓶颈大。
- Graph-Base:支持大模型,稀疏数据效率高,但学习曲线较高。
- Parameter Server:适用于稠密数据,但通信代价高。
随机决策树和随机决策哈希算法
-
RDT和RDH:在多个数据集上表现出更高的精度和更快的训练速度。
-
精度对比:
- a1a: RDH 0.881, RDT 0.879, J48 0.712, SMO 0.760, LR 0.751
- a9a: RDH 0.886, RDT 0.890, J48 0.755, SMO 0.761, LR 0.763
- mushrooms: RDH 1.000, RDT 1.000, J48 1.000, SMO 1.000, LR 1.000
- w1a: RDH 0.909, RDT 0.953, J48 0.613, SMO 0.748, LR 0.732
- w8a: RDH 0.894, RDT 0.997, SMO 0.797, LR 0.822
- splice: RDH 0.966, RDT 0.909, J48 0.935, SMO 0.843, LR 0.853
- cod-rna: RDH 0.971, RDT 0.969, J48 0.944, SMO 0.944, LR 0.937
- covtype: RDH 0.761, RDT 0.768, LR 0.705
- gisette: RDT 0.934
-
训练时间对比:
- a1a: RDH 0.194, RDT 0.569, J48 1.861, SMO 1.574, LR 1.010
- a9a: RDH 1.709, RDT 24.171, J48 647.013, SMO 1637.011, LR 35.901
- mushrooms: RDH 0.481, RDT 3.608, J48 13.651, SMO 1.665, LR 3.993
- w1a: RDH 0.383, RDT 0.934, J48 23.022, SMO 0.759, LR 6.561
- w8a: RDH 18.838, RDT 33.759, SMO 487.39, LR 371.836
- splice: RDH 0.499, RDT 0.387, J48 0.770, SMO 1.742, LR 0.819
- cod-rna: RDH 10.933, RDT 7.799, SMO 62.705, LR 4.271
- covtype: RDH 68.545, RDT 240.392, LR 299.667
- gisette: RDT 82.513
SGD方法的优化
- 无参数一次迭代收敛:通过动态调节学习率,实现快速收敛。
- 无参数稀疏正则化:根据各系数的重要程度和内存容量动态确定模型稀疏度。
- 并行化技术:TalkingData提出了模型平均方法,比传统的梯度平均方法更快。
Fregata - TalkingData大规模机器学习算法库
- 超大规模:支持10亿样本和10亿维度的数据处理。
- 成熟稳定:基于Spark原生版本开发,无缝接入数据处理流程,经过数千次不同任务测试,简单易用。
- 智能训练:无需调参,一次训练即可取得最高精度。
- 超高速度:内存加速下训练时间可达10秒级,无内存加速下也可达到分钟级,比MLLib快1000倍。
数据处理与开放平台
- TalkingData数据开放沙箱:
- 数据处理层:使用Spark和Hadoop HDFS进行数据处理,安全性控制严格。
- Web API层:提供Web API接口,支持上传任务、查看任务进度、下载任务日志等功能。
- 数据存储层:远端机器监控状态,关闭下载端口以提高安全性。
- 成功案例:
- Thasos:通过沙箱服务访问了TalkingData约8TB的数据量。
- 清华大学大数据实践课程:通过沙箱服务访问了TalkingData约100GB的数据量。
未来展望
- 智能数据关系整合:整合数据关系,提高数据处理效率。
- 智能数据项聚合:通过智能方法聚合数据项,提升分析能力。
- 手工打造:强调在大数据处理中,手工打造模型的重要性。
总结
TalkingData在数据科学领域提出了多种创新解决方案,以应对计算瓶颈和大数据处理的挑战。通过并行化技术、大规模机器学习平台和智能训练方法,TalkingData实现了高效的模型训练和优化。Fregata作为TalkingData的大规模机器学习算法库,具有超大规模处理能力、成熟稳定、智能训练和超高速度等优势,为大数据处理提供了强有力的支持。数据开放沙箱平台则为研究人员和开发者提供了安全、便捷的数据访问和处理环境,推动了大数据技术的发展和应用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载