2017-【人本数据和智能分会场】让海量移动数据产生价值_20页-9mb
报告摘要
文档内容总结
核心内容
本文档主要围绕海量移动数据的处理与算法设计展开,探讨了如何从大量用户行为数据中提取有价值的信息,并通过降维和稀疏表达等方法提升模型的性能和效率。文档分为两个主要部分:数据处理和算法设计,分别由叶杰生和陈日涵主讲。
主要观点
数据处理(叶杰生)
- 数据来源:文档中提到的数据包括应用数据、行为数据、位置数据、事件数据等,这些数据构成了用户行为的多维视角。
- 传统处理方案:使用传统的数据处理方法,如One Hot Encoding,虽然直观,但存在诸多问题。
- 维数灾难:特征维度爆炸,导致计算复杂度高。
- 信息量少:部分特征可能成为噪声。
- 模型限制:不适用于大规模数据和复杂模型。
- 改进处理方案:
- 采用基于Metropolis Hashing的WarpLda方法,将One Hot Encoding的特征视为Bag-of-Words,训练出主题模型,从而实现特征降维。
- 使用Parameter Server框架,提升训练效率,支持大规模数据处理。
- 结果:
- 通过主题模型,将高维特征转化为低维表示。
- 模型更灵活,便于调参和优化。
算法设计(陈日涵)
- 维数灾难:
- 高维特征导致计算和存储成本高。
- 特征信息稀疏,影响模型效果。
- 样本稀缺,难以有效训练模型。
- 降维措施:
- 目的:增强每维特征的信息量,提升模型表现。
- 方法选择:采用稀疏表达和支持大规模数据处理的框架。
- 方法及框架:
- WarpLda:基于Metropolis Hashing的LDA方法,优化了采样过程,提高了训练效率。
- Parameter Server:支持细粒度通信和异步更新,适用于大规模分布式训练。
- 未来趋势:
- 深度学习:基于频率学派的观点,优化效率高,但稀疏性较差。
- 稀疏表达:成为提升模型性能的重要方向。
- Word2vec:作为深度学习的一个应用,展示了稀疏表达的潜力。
关键信息
数据特征与处理
- 数据包含应用、行为、位置、事件等多个维度。
- One Hot Encoding存在维数灾难和信息量不足的问题。
- 采用WarpLda和Parameter Server进行降维和优化,提升模型表现。
模型与参数
- 模型规模:训练了300万App,划分了1000个主题,涉及30亿参数。
- 主题示例:
- Topic 312:包含多个与视频相关的App,如* * 视频、优*、芒果**等。
- Topic 72:与手机银行相关的App,如* * 手机银行、融e联、中国* * 银行等。
深度学习与稀疏表达
- 深度学习:主流模型基于频率学派,优化效率高,但稀疏性差。
- 稀疏表达:是提升模型性能的重要趋势,尤其在处理高维数据时。
- Word2vec:由Tomas Mikolov(Facebook)提出,是稀疏表达在自然语言处理中的一个应用。
总结
本文档通过分析海量移动数据的处理与算法设计,提出了基于主题模型和稀疏表达的解决方案。叶杰生介绍了如何通过改进数据处理方法(如WarpLda和Parameter Server)来应对高维数据带来的挑战;陈日涵则深入探讨了维数灾难及其应对措施,强调了深度学习和稀疏表达在未来的应用前景。整体内容聚焦于如何从海量数据中提取有价值的信息,并通过算法优化提升模型的效率和表现。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载