北京大学互联网金融情绪指数第一期_25页_1mb
报告摘要
北京大学互联网金融情绪指数总结(2016年9月)
核心内容
北京大学互联网金融情绪指数是一项基于自然语言处理和深度学习技术的量化研究,旨在科学、准确地刻画互联网金融及其子类在2013年1月至2016年9月期间的关注度与公众情绪变化。该指数覆盖12个子类,包括P2P网络借贷、互联网支付等,通过大数据分析,提供对互联网金融舆论环境的系统性描述。
主要观点
- 互联网金融发展迅速,但伴随大量负面新闻,公众情绪波动剧烈。
- 该指数通过大规模新闻数据(约1500万条,500GB)进行构建,利用关键词查找、主题模型(LDA、HDP)和词向量模型(word2vec)进行分析。
- 关注度指数和正负情感指数分别反映互联网金融及子类的热度与公众态度。
- 情绪指数具有较高的学术、政策与商业研究价值,尤其在理解公众风险认知与资产定价之间的关系方面。
关键信息
1. 数据来源与处理
- 数据来源为和讯网,时间跨度为2013年1月至2016年9月。
- 和讯网虽有“互联网金融”分类,但存在较大遗漏,因此团队重新归类新闻至子类。
- 数据准备阶段包括爬虫抓取、分词处理、专业词库补充和情感词库构建。
2. 指数构建流程
- 关注度指数构建:分为三个步骤:新闻筛选、主题归类、指数化处理。
- 主题过滤及筛选:
- 使用朴素过滤器、LDA过滤器、HDP过滤器和LDA归类器进行多层筛选。
- 朴素过滤器用于初步筛选出可能相关的文档。
- LDA过滤器用于识别主题,HDP用于自动调整主题数量。
- 最终通过池化策略将不同主题模型的结果综合,提高分类精度。
- 情感指数构建:
- 基于词向量模型(word2vec)进行情感词库扩展,解决情感词异变问题。
- 情感指数计算方法为:对每个子类文档计算正负情感词的加权影响,结合文档所属子类的概率进行指数化。
3. 指数结果分析
- 关注度指数:
- 2013年6月至2014年3月,关注度逐步上升,与余额宝推出和互联网金融首次写入政府工作报告相关。
- 2015年12月,由于“e租宝”事件的爆发,关注度出现明显波动。
- 正负情感指数:
- 2014年3月,正负情感指数开始上升,反映出政策推动带来的正面情绪。
- 2015年12月,负面情绪显著增加,与“e租宝”事件引发的公众恐慌有关。
4. 技术方法
- 使用LDA(隐含狄利克雷分布)和HDP(层次狄利克雷过程)进行主题识别与过滤。
- 使用CBOW和Skip-gram两种方式训练词向量模型,用于情感词扩展与情绪分析。
- 引入pyLDAvis进行主题可视化,提升模型解释性。
5. 未来扩展
- 未来计划引入动态主题模型(DTM),以反映主题随时间的变化。
- 指数将开源,欢迎研究者使用和改进,同时需遵守合规引用和数据公开原则。
结构说明
1. 指数构建方法
- 数据准备:包括新闻采集、分词、专业词库构建。
- 主题过滤:通过朴素过滤器、LDA过滤器、HDP过滤器和LDA归类器进行多阶段筛选。
- 情感分析:通过词向量模型扩展情感词库,结合文档主题概率计算情感指数。
2. 指数结果
- 关注度指数:反映互联网金融及其子类在不同时间段的热度变化。
- 正负情感指数:衡量公众对互联网金融及其子类的态度变化。
3. 指数意义
- 情绪指数可为学术界、政府与业界提供研究互联网金融舆论变化的重要工具。
- 指数结果揭示了政策、事件对公众情绪的影响,为理解互联网金融发展提供了新的视角。
总结
北京大学互联网金融情绪指数是一项基于大数据和自然语言处理技术的创新研究,通过构建关注度指数和正负情感指数,全面反映互联网金融及其子类在舆论环境中的变化。该指数的构建方法包括多层主题筛选、情感词库扩展与池化策略,确保了结果的准确性和可解释性。指数结果揭示了互联网金融在2013年至2016年间的发展脉络,尤其是政策推动和负面事件对公众情绪的显著影响。未来,该指数将开源,为更多研究者提供分析工具,并有望拓展至其他领域。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载