清华-人工智能之数据挖掘-2019.1-179页_42mb
报告摘要
人工智能之数据挖掘总结
核心内容
数据挖掘是知识发现(KDD)的关键步骤,它通过交叉使用人工智能、机器学习、统计学和数据库技术,从大规模数据中发现隐藏的模式和知识。本文总结了数据挖掘的基本概念、分类、过程、功能,以及其与大数据的关系,并回顾了近年来在顶级会议ACM SIGKDD上的研究成果和趋势。
主要观点
- 数据挖掘是一个跨学科领域,旨在从数据中发现隐含信息和模式,转化为结构化表示。
- 数据挖掘过程包括:确定挖掘目的、数据准备、进行数据挖掘、结果分析和知识同化。
- 数据挖掘功能主要包括:概念描述、关联分析、分类、聚类和偏差检测。
- 大数据为数据挖掘提供了基础架构和数据来源,其发展促进了数据挖掘领域的进步。
- 数据挖掘与人工智能、机器学习、社会网络分析、自然语言处理等技术密切相关,并在多个领域(如零售、旅游、物流、医学等)有广泛应用。
- 数据挖掘的未来趋势包括隐私保护、可视化、与专业领域结合、多媒体数据挖掘等。
- SIGKDD作为数据挖掘领域的顶级会议,其研究内容涵盖基础理论、算法和实际应用,近年来研究性论文和工业界论文投稿量逐年增加,尤其是工业界论文增长显著。
关键信息
数据挖掘分类
- 按数据库类型:文字型、网络型、时间型、空间型。
- 按知识类型:高抽象层、原始数据层、多个抽象层。
- 按技术类型:模式识别、神经网络、可视化、统计学、面向数据库或仓库技术。
- 按应用领域:生物医学、交通、金融、通信、股市等。
数据挖掘过程
- 确定挖掘目的
- 数据准备(包括数据选择、预处理、转换)
- 进行数据挖掘
- 结果分析(包括可视化)
- 知识的同化
大数据与数据挖掘
- 大数据具有4V特性(Volume, Variety, Velocity, Veracity)。
- 大数据为数据挖掘提供了数据来源和计算基础设施,同时带来了新的挑战,如数据的动态性和复杂性。
数据挖掘知识图谱
- 通过自然语言处理技术提取论文关键词,并结合学科领域知识图谱,构建三级图谱结构。
- 研究领域包括社交网络、大数据、情报分析、聚类分析、文本挖掘、用户行为、推荐系统、离群检测、专家系统等。
SIGKDD概况
- SIGKDD是数据挖掘领域最重要的国际会议之一,涵盖基础理论、算法和实际应用。
- 会议自1995年起每年举办,近年来研究性论文和工业界论文投稿量持续增长。
- 会议设有多个奖项,包括最佳研究性论文、最佳学生论文、最佳博士论文、Test of Time奖等。
近年SIGKDD主要成果
-
SIGKDD 2013:
- 研究性论文:125篇,录用率约17.2%。
- 工业界论文:44篇,录用率约22%。
- 最佳论文:Simple and Deterministic Matrix Sketching。
- 最佳学生论文:A space efficient streaming algorithm for triangle counting using the birthday paradox。
- 创新贡献奖:Jon Kleinberg。
- 服务贡献奖:Gabor Melli。
- KDD CUP 2013:由国立台湾大学林智仁教授团队获得冠军。
-
SIGKDD 2014:
- 研究性论文:160篇,录用率约19.5%。
- 应用数据科学论文:68篇,录用率约35.9%。
- 最佳论文:Efficient Algorithms for Public-Private Social Networks。
- 最佳学生论文:Edge-Weighted Personalized PageRank。
- 创新贡献奖:Hans Peter Kriegel。
- 服务贡献奖:Jian Pei。
- KDD CUP 2014:由“the Intercontinental Ensemble”团队获得冠军。
-
SIGKDD 2015:
- 研究性论文:142篇,录用率约18.1%。
- 应用数据科学论文:66篇,录用率约20%。
- 最佳论文:Ranking Relevance in Yahoo Search。
- 最佳学生论文:TRIÈST。
- 创新贡献奖:Philip S. Yu。
- 服务贡献奖:Wei Wang。
- KDD CUP 2015:由“the Intercontinental Ensemble”团队获得冠军。
-
SIGKDD 2016:
- 研究性论文:130篇,录用率约8.6%。
- 应用数据科学论文:86篇,录用率约9.2%。
- 最佳论文:Accelerating Innovation Through Analogy Mining。
- 最佳学生论文:Contextual Intent Tracking for Personal Assistants。
- 创新贡献奖:Philip S. Yu。
- 服务贡献奖:Wei Wang。
- KDD CUP 2016:由“burebistas”团队获得冠军。
-
SIGKDD 2017:
- 研究性论文:748篇,录用130篇,录用率约8.6%。
- 应用数据科学论文:390篇,录用86篇,录用率约9.2%。
- 最佳论文:Accelerating Innovation Through Analogy Mining。
- 最佳应用数据科学论文:HinDroid。
- 创新贡献奖:Tom Hope。
- 服务贡献奖:Wei Wang。
- KDD CUP 2017:未具体提及,但可以看出竞赛主题为预测论文录用情况。
人才与研究热点
- 数据挖掘领域顶尖学者全球和中国分布、迁徙、机构分布、h-index分析等信息,通过AMiner数据进行深入研究。
- 研究热点包括隐私保护、可视化、与专业领域结合、多媒体数据挖掘等。
应用领域
- 零售业:用于商品推荐、销售预测等。
- 旅游业:用于游客行为分析、旅游推荐等。
- 物流业:用于物流路径优化、运输调度等。
- 医学界:用于疾病预测、医疗数据分析等。
总结
数据挖掘是人工智能领域的重要组成部分,其应用广泛,发展迅速。随着大数据技术的进步,数据挖掘在理论和实践上都有了长足发展,特别是在社交网络分析、推荐系统、异常检测等方面。未来,数据挖掘将继续与人工智能、机器学习等技术融合,探索更多跨学科应用,同时关注隐私保护和可视化等方向。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载