2017-【技术驱动未来分会场】Data_Science_in_TalkingData_30页-6mb
报告摘要
文档总结
核心内容
该文档主要介绍了TalkingData在大数据分析和机器学习领域的技术成果与应用,包括其自主研发的Fregata和Myna开源项目,以及Smart Data Lab和AutoModel等数据科学基础设施。
主要观点
- TalkingData 是中国最大的独立移动数据平台之一,成立于2011年,总部位于北京,已完成三轮VC融资。
- 公司专注于大数据分析,拥有超过6.5亿的月活跃设备,支持超过10万款App的SDK集成,每日处理超过3亿次移动广告点击。
- Fregata 是一个基于Spark的轻量级、高速、大规模机器学习库,具有以下特点:
- 参数无关:使用GSA(Greedy Step Averaging)优化方法,无需手动调整学习率。
- 高效性:在训练大规模数据集(如10亿X10亿)时,Fregata的训练速度比MLLib快10-100倍。
- 轻量级:仅使用Spark的标准API,便于集成。
- Myna 是一个基于Android的上下文感知框架,提供应用开发者和数据科学家的API,用于设备行为识别(如静止、步行、跑步、乘车等)。
- Smart Data Lab 是数据科学家的工作平台,支持数据沙箱和AutoModel(自动化机器学习工具),用于提升数据科学效率。
- AutoModel 可实现机器学习训练自动化,简化模型调优和比较流程。
关键信息
Fregata 机器学习库
- 功能:Fregata 是一个基于 Spark 的大规模机器学习库,提供 Scala 的高级 API。
- 优势:
- 更高的准确性:在多个数据集上,Fregata 的表现优于 MLLib。
- 更快的速度:在 Generalized Linear Model 的训练中,Fregata 通常只需一次数据扫描即可收敛。
- 自动平衡精度与效率:通过动态计算剩余内存,自动调整输出稀疏度。
- 性能测试:
- 在 a9a、rcv1、lookalike 等数据集上,Fregata 的压缩模型在准确性和 AUC 上与原始模型接近。
- 模型大小和训练时间在不同数据规模下表现稳定,适用于 Spark 平台。
Myna 上下文感知框架
- 功能:Myna 提供了 Android 设备行为识别的 API,包括静止、步行、跑步、乘车等。
- 应用:支持事件数据管理,通过 NLP 技术进行数据挖掘。
- 优势:适用于分布式环境,便于集成到 Android 应用中。
大数据平台能力
- 数据规模:支持从 2000 万到 1000 亿级别的数据处理。
- 数据存储:提供更高效的存储方法,跟踪设备从出生到死亡的全过程。
- 技术亮点:使用 K-Means 离散化参数值,并通过 Roaring Bitmaps 压缩模型。
算法与优化
- GSA(Greedy Step Averaging):一种参数无关的随机优化方法,通过精确线搜索计算贪心步长,然后取平均值作为学习率。
- 模型平均:在分布式环境下,通过平均各节点的模型参数,可以达到与集中式训练相近的精度。
- 相关研究:论文《On the optimality of averaging in distributed statistical learning》探讨了模型平均在分布式统计学习中的最优性,分析了不同数据规模下的误差表现。
应用场景
- 金融:用于用户行为分析、风险评估等。
- 零售:支持精准营销和用户画像构建。
- 房地产:用于市场趋势预测和用户需求分析。
- 推荐系统:通过用户行为数据优化推荐算法。
- 用户流失预警:基于数据分析预测用户流失。
- 室内定位:结合上下文感知数据实现更精准的定位。
技术合作与开放
- 合作伙伴:包括商业伙伴和学术伙伴。
- 开源项目:
- Fregata:基于 Spark 的机器学习库。
- Myna:Android 上下文感知框架。
- 教育:提供数据科学基础设施支持,推动技术普及与研究。
总结
TalkingData 通过其自主研发的大数据平台和机器学习技术,实现了对海量移动数据的高效处理与价值挖掘。Fregata 和 Myna 作为核心技术,分别在机器学习和上下文感知领域表现出色,为数据科学家和开发者提供了强大的工具支持。此外,公司还通过 Smart Data Lab 和 AutoModel 推动数据科学的自动化和基础设施建设,进一步提升了数据处理的效率与准确性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载