2017年-Talkingdata_【T112017-教育生态与人才培养分会场】OpenDataOpenValue-数据科学合作研究平台的探索与实践_15页_997kb
报告摘要
Open Data Value 总结
核心内容概述
Open Data Value 是一个围绕数据科学合作研究平台展开的探索与实践项目,旨在通过数据整合、算法优化以及协作机制的构建,提升数据科学的研究效率和成果质量。主讲人冯博来自 TalkingData,他在演讲中详细介绍了数据科学研究中面临的问题及解决方案,并探讨了容器化、数据共享、算法优化等关键议题。
数据科学研究的问题与解决方案
主要问题
- 数据获取困难
- 数据隔离与共享问题
- 协作与分享机制不完善
- 成果评判缺乏统一标准
解决方案
- 数据整合隔离层:通过构建隔离层,实现数据的分层管理和安全访问,支持只读、共享等多种模式。
- 容器化:容器化技术成为趋势,但存在平台化和兼容性等问题。
- 协作、分享和评判:通过建立统一的平台和机制,促进数据科学家之间的协作与成果分享,并引入评判标准以提升研究质量。
数据平台架构
数据层
- HDFS:用于大规模数据存储与管理。
- S3:提供云存储解决方案,支持数据的弹性扩展。
- Local:本地存储,适用于小规模数据处理。
- DB:数据库,用于结构化数据的存储与查询。
计算层
- Native Cloud:本地云计算平台,支持高性能计算。
- Public Cloud:公共云平台,提供灵活的计算资源。
AutoModel 原理与实践
AutoModel 概述
AutoModel 是一个自动化模型构建工具,支持多种算法和模型优化。其核心理念是通过算法内部的最优选择,实现模型的横向比较和最佳模型的选取。
主要特点
- 多种算法支持:包括 sklearn、Weka、MLlib 等主流算法库。
- 横向比较:对不同算法进行性能对比,以找到最优解。
- 最佳模型:通过算法优化和比较,选出最适合当前任务的模型。
Smart Data Lab 的应用
服务对象
- 5家国内知名高校:提供数据科学研究支持。
- 6家国内大数据公司:支持企业级数据研究与应用。
- 夏令营:面向数据分析师和数据科学家,提供实践与学习机会。
发布情况
- 第一版:于6月31日发布,初步搭建平台架构。
- 第二版:于10月下旬发布,进一步完善功能与性能。
结论
Open Data Value 项目通过构建数据整合隔离层、采用容器化技术、优化算法选择以及推动协作与分享机制,为数据科学研究提供了有力支持。其核心目标是提升数据科学的研究效率与成果质量,推动数据科学在高校与企业间的广泛应用。Smart Data Lab 作为其实践平台,已在多个领域取得初步成果,并持续进行迭代与优化。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载