微软-matrix42_april2017_36页_11mb
报告摘要
Matrix 2017年4月 第42期总结
核心内容
本期刊物主要围绕人工智能技术及其在多个领域的应用展开,包括机器学习系统、自然语言处理、数学解题、文本生成、深度学习挑战等。同时,还介绍了微软亚洲研究院在“一带一路”背景下的文化保护项目,以及相关研究团队的工作成果。
主要观点
-
人工智能技术的广泛应用
人工智能正在深入我们的日常生活和工作,从智能助理、推荐系统到自然语言理解、数学解题等,AI已经具备了改变人们生活方式的潜力。 -
分布式图计算系统 TuX²
- TuX² 是一个面向机器学习的分布式图计算系统,结合了传统图计算的优势与机器学习的需求。
- 它支持小分批(mini-batch)和延时同步并行(SSP)等模式,提出了新的编程模型 MEGA。
- 在大规模数据(640亿条边)上的实验表明,TuX² 比 PowerGraph 和 PowerLyra 有量级的性能优势,并且比现有分布式机器学习系统性能提升 48%。
-
智能助理的发展与挑战
- 当前智能助理大多只能处理简单的任务,如天气、新闻查询等,但真正能完成复杂任务的还很少。
- 提出了打造智能助理的四大“自救法宝”:
- 专注垂直应用,减少理解复杂性。
- 指导用户,缩小语言输入空间。
- 借助知识图谱,提高自然语言理解和推理能力。
- 人机协同,提升智能助理的准确率和效率。
- 微软的EDI系统展示了智能助理在实际应用中的巨大潜力,如自动预定会议、设置提醒等。
-
数学解题的挑战与进展
- 数学解题是人工智能的一个重要研究方向,但涉及自然语言理解、逻辑推理、常识判断等多个层面。
- SigmaDolphin 是微软亚洲研究院的一个数学解题项目,利用 Dolphin Language 构建了精准的解题系统。
- Dolphin18K 数据集的建立,为数学解题研究提供了更丰富的数据支持,但也揭示了当前系统在解题准确率方面的不足。
-
基于结构化数据的文本生成
- 文本生成技术正在快速发展,尤其在深度学习的支持下,如神经网络模型(LSTM、神经机器翻译)。
- 文本生成的两个核心问题:说什么(内容选择)和怎么说(语言表达)。
- 评测方法分为内在评测(如 BLEU)和外在评测(如任务完成度),当前多采用内在评测。
-
深度学习的挑战与前沿
- 深度学习的成功依赖于大数据、大模型、大计算。
- 挑战1:标注数据昂贵,因此从无标注数据中学习成为前沿方向,如对偶学习和生成式对抗网络。
- 挑战2:大模型不适合移动设备,因此模型压缩成为重要研究方向,包括剪枝、权值共享、量化和二值神经网络。
关键信息
1. TuX² 系统
- 目标:面向机器学习的分布式图计算系统。
- 优势:支持 mini-batch 和 SSP 模式,提出 MEGA 编程模型。
- 性能:相比 PowerGraph 和 PowerLyra 有量级提升,比现有系统提升 48%。
- 应用:可用于推荐系统、自然语言处理、深度学习等场景。
2. 智能助理 EDI
- 功能:自动预定会议、设置提醒。
- 效率:从收到请求到完成任务只需不到 10 秒。
- 技术:使用递归神经网络进行上下文建模,结合知识图谱进行实体链接推理。
- 成果:在微软内部,超过一半的会议由 EDI 自动预定。
3. 数学解题系统 SigmaDolphin
- Dolphin Language:一套用于数学解题的抽象表示语言。
- Dolphin18K 数据集:包含 18000 多道数学题,用于评测和训练。
- 挑战:数学题的解题涉及自然语言理解、逻辑推理、常识判断。
4. 文本生成技术
- 应用场景:财经新闻、体育报道、产品描述、天气预报等。
- 技术发展:从规则系统发展到基于统计模型,再到深度学习模型。
- 评测方法:内在评测(如 BLEU)和外在评测(如任务完成度)。
5. 深度学习的挑战与前沿
- 挑战1:标注数据昂贵
- 从无标注数据中学习成为研究热点,如对偶学习、生成式对抗网络。
- 挑战2:模型过大
- 模型压缩技术包括剪枝、权值共享、量化、二值神经网络。
- 目标是让模型在移动设备上运行,降低能耗与存储需求。
结论
微软亚洲研究院在人工智能领域持续投入,推动了多个技术方向的发展。从分布式图计算系统到智能助理,再到数学解题和文本生成,AI 正在逐步走向实际应用。同时,深度学习的挑战也促使研究者探索更高效、更实用的模型与方法,为未来 AI 发展奠定了坚实的基础。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载