人工智能之数据挖掘_176页_11mb
报告摘要
人工智能之数据挖掘研究报告总结
核心内容
数据挖掘是知识发现(KDD)的重要组成部分,它涉及使用人工智能、机器学习、统计学和数据库技术,在大规模数据中发现隐含模式。数据挖掘的主要目标是将数据转化为结构化信息,用于预测模型优化、决策支持和数据管理等。
主要观点
- 数据挖掘是一个跨学科领域,其价值在于发现数据中的规律,从而提升预测模型。
- 数据挖掘的步骤包括:确定挖掘目的、数据准备、进行数据挖掘、结果分析和知识同化。
- 数据挖掘的分类包括:按数据库类型、按知识类型、按技术类型、按应用领域进行分类。
- 大数据的发展推动了数据挖掘技术的演进,数据挖掘也成为了大数据研究的重要组成部分。
- 数据挖掘在社交网络、推荐系统、时间序列、文本挖掘等领域均有广泛应用。
- 数据挖掘的未来趋势包括隐私保护、可视化、与专业领域结合、多媒体数据挖掘等。
关键信息
数据挖掘的分类
- 按数据库类型:文字型、网络型、Time型、Space型。
- 按知识类型:高抽象层、原始数据层、多个抽象层。
- 按技术类型:模式识别、神经网络、可视化、统计学、面向数据库或仓库技术。
- 按应用领域:生物医学、交通、金融、通信、股市等。
数据挖掘过程
- 确定挖掘目的:明确挖掘目标。
- 数据准备:包括数据选择、预处理和转换。
- 进行数据挖掘:对数据进行分析处理。
- 结果分析:使用可视化等技术解释和评估结果。
- 知识同化:将结果应用于实际场景。
数据挖掘功能
- 概念描述:用于描述对象的特征。
- 关联分析:发现数据间的规律。
- 分类与聚类:根据数据训练模型,进行分类和合并。
- 偏差检测:识别异常数据。
大数据与数据挖掘
- 大数据具有4V特性(Volume, Variety, Velocity, Veracity)。
- 大数据为数据挖掘提供了新的数据源和挑战。
- 大数据的快速发展促进了数据挖掘在多个领域的应用。
数据挖掘知识图谱
- 使用自然语言处理技术提取关键词,并将其归类到相应领域。
- 通过聚类分析统计各领域的研究热度。
- 构建三级图谱结构,分析当前研究热点。
SIGKDD会议概况
- SIGKDD是数据挖掘领域的顶级会议,涵盖基础理论、算法和实际应用。
- 自1995年以来,SIGKDD以大会形式连续举办,论文投稿和录用数量逐年增长。
- 会议内容涉及大数据、图挖掘、深度学习、推荐系统、时间序列分析等。
- 会议设有最佳论文奖、最佳学生论文奖、最佳博士论文奖、时间检测奖等。
国内外工业界研究
- Google:在数据挖掘领域有大量研究,包括矩阵草图、推荐系统等。
- Amazon:研究重点包括推荐系统、数据挖掘在实际业务中的应用。
- Microsoft:关注大数据处理、推荐系统、图挖掘等。
- Facebook:研究社交网络分析、用户行为等。
- 阿里巴巴:在大数据处理、推荐系统、可视化搜索等方面有显著成果。
- 腾讯:在社交网络、推荐系统等领域有研究。
- 百度:在大数据和机器学习方面有较多研究。
KDD CUP竞赛
- KDD CUP是数据挖掘领域的竞赛,涉及预测、分类、推荐系统等。
- 2013年:任务为识别作者与论文的对应关系和名字消歧。
- 2014年:任务为预测在线课程中学生退课情况。
- 2015年:任务为预测研究机构在会议上的论文录用情况。
- 2016年:任务为预测研究机构在会议上的论文录用情况,为名副其实的预测问题。
专家介绍
- 全球学者分布:包括顶尖学者的全球与中国分布、迁徙概况、机构分布、h-index分析。
- 代表学者:基于AMiner数据,选取代表学者与近十年代表学者进行详细介绍。
- 奖项:包括最佳论文奖、最佳学生论文奖、最佳博士论文奖、时间检测奖、创新贡献奖、服务贡献奖等。
应用与趋势
- 数据挖掘在多个领域有广泛应用,包括物流、旅游、零售等。
- 未来趋势包括隐私保护、可视化、与专业领域结合、多媒体数据挖掘等。
图表目录
- 图1:数据挖掘是知识发现的过程之一
- 图2:数据挖掘过程基本步骤
- 图3:Data Mining知识图谱
- 图4:2013-2018KDD研究性论文投稿与接收情况
- 图5:2013-2018KDD工业界论文投稿与接收情况
- 图6:柯洁乌镇大战AlphaGo撼负后的微博热议
- 图7:两个微博名人的微博点赞数据的箱型图
- 图8:组数较大组距较小的频率分布直方图
- 图9:相同均值和方差的不同数据
- 图10:k = 3 的K-means算法迭代过程
- 图11:神经元
- 图12:神经网络
- 图13:Girvan-Newman算法结果
- 图14:基于优化Q值的算法结果
- 图15:Louvain算法步骤
- 图16:Skip-Gram模型架构
- 图17:话题模型的概率图
- 图18:大数据处理平台技术架构图
- 图19:基于开源系统的大数据处理平台架构
- 图20:全球学者分布地图
- 图21:国内学者分布地图
- 图22:数据挖掘领域全球Top1000学者迁徙图
- 图23:数据挖掘全球Top1000学者机构分布
- 图24:数据挖掘全球Top1000学者h-index分布图
- 图25:数据挖掘全球Top1000学者性别比
- 图26:两阶段的交互推荐方法
- 图27:视频推荐(左)和视频搜索(右)
- 图28:方法框架
- 图29:视频推荐的评测结果
- 图30:YouTube-8M数据集上的视频检索
- 图31:抽取系统的架构图
- 图32:数据偏差
- 图33:数据集的实验结果
- 图34:不同submodular的比较结果
- 图35:共享表示层
- 图36:UCI数据集的实验结果
- 图37:Google数据的实验结果
- 图38:PG模型、MPG扩展版本
- 图39:在线系统的A/B测试
- 图40:框架结构
- 图41:实验结果
- 图42:Microsoft Bing的可视化搜索
- 图43:算法展示
- 图44:降维过程
- 图45:RBE模型
- 图46:Rosetta的两阶段抽取架构
- 图47:系统的总体设计
- 图48:DPG-FBE
- 图49:阿里巴巴的可视化搜索
- 图50:可视化搜索系统的离线学习(左)和在线搜索系统的总体架构(右)
- 图51:基于注意力机制网络和RNN的深度架构
- 图52:排序过程
- 图53:电子商务网站中商品的表示学习
- 图54:SI辅助信息
- 图55:多级级联排名模型
- 图56:鲑鹏的总体架构
- 图57:conv-RNN框架
- 图58:局部匹配图
- 图59:关系增强的实体表示
- 图60:生成有意义的医疗关系
- 图61:提供实时停车可用性信息的框架图
- 图62:研究城市中人的活动
- 图63:大规模实际招聘数据系统
- 图64:Data Mining全局热点
- 图65:Data Mining近期热点
- 图66:Data Mining早期热点
- 图67:2007至今DataMining与HealthCare领域交叉分析
- 图68:Data Mining与Health Care未来3年交叉研究趋势预测
表格目录
- 表1:数据挖掘和KDD对比图
- 表2:数据挖掘分类表
- 表3:两个比较受欢迎的微博名人在2018年3月到2018年5月间的一部分微博数据
- 表4:LDA模型中的变量和标记
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载