2017-【教育生态与人才培养分会场】Open_Data_Open_Value:数据科学合作研究平台的探索与实践_16页-1mb
报告摘要
文档总结
核心内容
本文档围绕数据科学合作研究平台的探索与实践展开,重点介绍了Smart Data Lab及其核心工具AutoModel。文档内容涵盖数据整合、容器化技术、云平台应用、协作与分享机制,以及数据科学算法的优化与评估。
主要观点
- 数据整合与隔离:文档强调了在数据科学研究中,数据整合的重要性,同时提出了数据隔离层的概念,以保障数据安全与隐私。隔离层支持只读、共享和隔离三种模式,适用于不同的数据使用场景。
- 容器化技术:容器化是当前数据科学平台发展的趋势。文档指出容器化带来的优势,如提高资源利用率和简化部署流程,但也存在一些问题,如资源管理复杂、性能瓶颈等。因此,容器平台化成为解决这些问题的方向。
- 云平台应用:数据科学平台可以分为Native Cloud(本地云)和Public Cloud(公共云)。文档展示了不同云平台的架构图,强调了计算层与应用层的分离,以及如何通过云平台实现高效的数据处理和模型训练。
- 协作与分享:数据科学平台支持协作、分享和成果评判。文档列出了多个关键组件,包括教程、成果、项目、代码和数据,表明这些资源是推动团队合作和知识共享的重要工具。
- AutoModel原理:AutoModel是Smart Data Lab推出的核心工具,旨在实现算法内部的最优选择。该工具通过横向比较多种算法,寻找最佳模型,并提供了一套完整的算法评估体系。
关键信息
数据整合隔离层
- 隔离模式:只读、共享、隔离
- 支持技术:HDFS、S3、Local、DB
- 目标:保障数据安全,同时支持灵活的数据使用方式
容器化趋势
- 优势:提高资源利用率、简化部署流程
- 问题:资源管理复杂、性能瓶颈
- 解决方案:容器平台化
云平台架构
- Native Cloud:本地云平台,用于私有化部署
- Public Cloud:公共云平台,提供灵活的计算资源
- 计算层:负责模型训练与推理
- 应用层:面向用户,提供数据科学工具与服务
协作与分享机制
- 支持对象:高校、大数据公司、夏令营、数据分析师和科学家
- 资源类型:
- 教程:提供学习路径与知识分享
- 成果:展示研究成果与模型效果
- 项目:支持团队协作与项目管理
- 代码:提供可复用的数据科学代码
- 数据:提供丰富的数据集用于研究与分析
AutoModel原理
- 功能:自动选择最优算法,构建最佳模型
- 技术基础:基于多种算法的横向比较
- 目标:提高模型性能与研究效率
发布情况
- 第一版发布日期:6月31日
- 第二版发布日期:10月下旬
服务用户
- 高校:5家国内知名高校
- 大数据公司:6家国内大数据公司
- 用户群体:数据分析师、数据科学家、夏令营学员
总结
本文档全面介绍了数据科学合作研究平台的设计理念、技术架构与实际应用。通过数据整合隔离层、容器化、云平台和AutoModel等核心技术,平台旨在实现高效的数据处理、模型训练与知识共享。文档强调了容器化与云平台在数据科学中的重要性,并展示了AutoModel在算法优化方面的强大能力。平台已发布两版,服务对象广泛,涵盖了高校、企业及个人研究者。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载