datafun2024-数据湖-18页_2mb
报告摘要
OPPO数据湖加速大模型训练分享总结
本次分享由OPPO高级大数据平台工程师陈哲嘉在DataFun#2024上呈现,主题是利用数据湖平台加速大模型训练。分享涵盖了OPPO数据湖平台的核心组件、优化技术、大模型任务加速方法及未来规划。
OPPO数据湖平台基于自研引擎Glacier,实现了流批一体架构,支持数据管理和优化。平台包括南天门DAM数据产品接入层和Glacier引擎,计算引擎涉及Spark、Hive、Flink等,存储层使用HDFS、Iceberg等格式。数据入湖可通过CDC入湖、采集服务入湖实现,支持高效、可靠的客户端提交,支持单表并发100+客户端操作。平台实现了秒级数据写入和低延迟流式读取,提升数据分析效率。
元数据管理通过GMS模块定时任务和生命周期管理,加强数据治理和索引优化。针对大模型任务,采用PySpark和Rust进行数据优化。数据入湖时使用7z压缩、内存优化Pickler和长文本切分,提升处理性能。任务优化包括MiniHash、Kmeans算法改进,通过数据精确去重和向量化(Rust实现),将输入字符串转换为向量输出。
资源调度部分支持跨集群任务调度和存储层整合,进一步加速训练。未来技术规划RoadMap包括自研缓存开发、流批一体引擎优化,以及扩展机器学习/大 model场景。
该平台通过平台化管理任务和数据,实现计算效率提升和存储成本降低,整体展示了数据湖在AI训练中的应用价值。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载