【T112017-教育生态与人才培养分会场】OpenDataOpenValue-数据科学合作研究平台的探索与实践_15页_913kb
报告摘要
Open Data Value 总结
核心内容
《Open Data Value》是一份关于数据科学合作研究平台的探索与实践的文档,由TalkingData的冯博主讲。文档围绕数据整合、协作机制、算法优化以及平台化建设等方面展开,旨在探讨如何通过开放数据和共享资源推动数据科学研究的发展。
数据整合与共享
数据隔离与共享机制
文档提出了一种数据整合隔离层的概念,用于在不同数据源之间建立安全、可控的共享机制。该层支持以下几种模式:
- 只读:数据仅允许读取,不进行修改。
- 隔离:数据在不同的环境中被隔离,确保数据安全。
- 共享:数据在多个研究者或团队之间共享,促进协作。
数据存储与计算层
文档展示了数据存储与计算层的不同实现方式,包括:
- HDFS:分布式文件系统,适合大规模数据存储。
- S3:云存储服务,提供高可用性和可扩展性。
- Local:本地存储,适用于小规模数据或测试环境。
- DB:数据库,用于结构化数据的存储与查询。
此外,文档还提到Cluster和Computer作为计算资源的组成部分,支持分布式计算和高性能计算需求。
协作、分享与评判
文档强调了数据科学协作、分享和评判的重要性,并提出了以下关键问题:
- 协作:如何在不同团队之间有效协作?
- 分享:如何确保数据和成果的安全共享?
- 评判:如何对研究成果进行公正的评估?
为了支持这些问题,文档展示了多个平台和工具,包括:
- 教程:提供学习和使用平台的指导。
- 成果:展示研究团队的成果。
- 项目:列出正在进行或已完成的研究项目。
- 代码:提供可复用的代码片段。
- 数据:展示可用于研究的数据集。
- 目标:明确平台的发展目标和方向。
AutoModel 原理
文档还介绍了AutoModel,这是一种自动化模型构建工具,旨在简化机器学习模型的开发过程。AutoModel支持多种算法,并提供以下功能:
- 算法内部最优:在模型训练过程中自动选择最优的算法参数。
- 横向比较:对多个模型进行性能比较,以找到最佳模型。
- 最佳模型:通过比较选择出表现最好的模型。
AutoModel的原理部分展示了其与sklearn、weka和MLlib等传统机器学习工具的对比,强调了其在自动化和效率方面的优势。
服务用户
Smart Data Lab 旨在服务以下用户群体:
- 5家国内知名高校
- 6家国内大数据公司
- 夏令营参与者
- 全部数据分析师和数据科学家
通过提供数据、工具和平台,Smart Data Lab 支持这些用户在数据科学领域的研究和应用。
发布情况
- 第一版:于6月31日发布
- 第二版:于10月下旬发布
结论
文档全面分析了数据科学合作研究平台的构建与应用,提出了数据整合、共享、协作、评判和自动化模型构建等关键问题,并展示了相关的解决方案和技术实现。通过平台化建设,Smart Data Lab 为数据科学家和分析师提供了一个高效、安全、开放的研究环境。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载