百度大脑AI技术成果白皮书_48页_6mb
报告摘要
百度大脑AI技术成果白皮书(2018-2019)总结
核心内容
百度大脑在2018-2019年度实现了从1.0到5.0的进化,成为软硬件一体的AI大生产平台。其核心技术涵盖基础层、感知层、认知层、平台层和AI安全五大模块,支持语音、视觉、增强现实/虚拟现实、自然语言处理、知识图谱等技术能力,并通过AI开放平台实现技术成果的广泛应用。
主要观点
- 百度大脑已成为一个完整的AI技术体系,具备强大的算法、算力和数据基础。
- 技术成果已广泛应用于百度内部业务及多个行业,如智能城市、智能交通、智能零售、医疗等。
- 百度在深度学习、语音识别、计算机视觉、自然语言处理、知识图谱、AI安全等方向取得了多项突破。
- 百度推动了AI技术的开放共享,构建了完整的AI生态系统,包括飞桨深度学习平台、UNIT智能对话平台和开放数据集。
关键信息
一、百度大脑5.0
- 百度大脑5.0实现了AI算法、计算架构与应用场景的创新融合。
- 技术布局包括基础层、感知层、认知层、平台层和AI安全五大模块。
- 作为AI技术中台,百度大脑支持了多个AI应用场景,如智能搜索、智能客服、智能地图等。
二、基础层
2.1 算法
- 流式多层截断注意力模型(SMLTA):提升了语音识别的准确率15%至20%,并支持在线实时语音识别。
- Meitron个性化语音合成技术:通过音色、风格、情感的解耦和组合,实现个性化语音合成,已在百度地图中应用。
- Ubiquitous Reweighting Network(URNet):提升了图像分类的Top5准确率,获Webvision比赛冠军。
- CDSR模型:在图像和视频超分辨率方面取得突破,获NTIRE竞赛冠军和亚军。
- 医学图像分析:提出全新的深度学习病理切片肿瘤检测算法,在Camelyon16大赛中取得0.8096的FROC分数,超过专业病理医生水平。
- Hubble Nearest Neighbor(HNN)算法:提升多语种单词翻译准确率,支持零样本图像识别。
- Logician逻辑家代理:实现开放领域自然语言句子中的事实提取,性能优于现有系统。
- Orator演说家代理:将多个事实叙述为自然语言句子,提升系统性能。
2.2 算力
- 百度昆仑:国内首款云端通用AI处理器,具备260TOPs运算性能,支持多种AI场景。
- 百度鸿鹄:支持六路麦克阵列语音信号处理,实现高精准唤醒和低误报率。
- AI计算平台:由X-Man、Fast-F、KongMing组成,支持大规模分布式训练,将训练时间从周级别缩短到天级别。
- 5G边缘计算:推出OTE平台,实现边缘与云的协同计算,为AI提供低延迟、高可靠和成本最优的算力支持。
- 量子计算:成立量子计算研究所,探索量子架构、量子算法及量子人工智能应用,开发了“量脉”系统,实现量子计算性能的显著提升。
2.3 数据
- 联邦学习解决方案:支持在保护数据隐私的前提下进行多方协作训练,提升模型精度。
- Jarvis数据科学平台:提供统一数据科学环境,支持AutoML、GPU管理、安全联合建模等功能。
- 开源数据集:包括ApolloScape自动驾驶数据集、DuReader阅读理解数据集、SKE信息抽取数据集、BERL实体链指数据集、BSTC机器同传数据集等。
三、感知层
3.1 语音
- 流式多层截断注意力模型(SMLTA):提升了语音识别准确率。
- 中英文一体化建模:支持用户中英文混杂和纯英文自由说。
- 方言大一统模型:实现普通话和方言的统一识别。
- 端到端语音交互方案:支持一次唤醒多次交互,提升用户体验。
- End to End Parallel waveRNN:显著提升语音合成自然度和表现力。
- ClariNet:实现实时语音合成,速度提升数千倍。
- ParaNet:基于前馈神经网络,提升语音合成效率,减少错误。
3.2 视觉
- 目标检测:在Open Images和Objects365竞赛中取得优异成绩。
- 视频理解:在ActivityNet竞赛中连续三年获得冠军,支持视频分类、编辑、分析等。
- 人体视觉理解:通过改进卷积网络,提升人体关键目标区域的检测精度。
- 智能城市视频分析:实现车辆RE-ID技术,应用于城市安防、智能交通等领域。
- 多目标追踪:在MOT16榜单上获得第一名,支持复杂场景的视频分析。
- 多传感器视觉语义化:实现多人购物行为的精准分析,减少网络传输和GPU服务器需求。
3.3 增强现实/虚拟现实
- DuMixAR平台:开放超过40项AR技术,应用于品牌营销、视频娱乐、景区、教育和汽车等行业。
- 虚拟主播:结合多模态技术,实现真人形象虚拟主播,应用于天气预告、新闻播报等场景。
- 自动驾驶仿真系统:利用增强现实技术,实现逼真的自动驾驶训练和测试环境。
四、认知层
4.1 知识图谱
- 知识自学习:通过主动学习、多源数据融合等技术,构建大规模知识图谱。
- 复杂知识图谱:支持事件检测、事件抽取、事件关系分析等,提升信息处理能力。
- 行业知识图谱:构建医疗、金融、司法等领域的知识图谱,支持智能决策和辅助系统。
4.2 自然语言处理
- ERNIE语义理解框架:实现中英文NLP任务的显著提升,如自然语言推断、自动问答、阅读理解等。
- KT-NET模型:结合知识图谱与语言表示,提升机器阅读理解效果。
- V-NET模型:支持多文档阅读理解,解决歧义信息问题,三次获得MSMARCO数据集冠军。
- 智能创作平台:结合自然语言处理和知识图谱,提供自动写作和辅助创作能力,提升内容创作效率和质量。
五、平台层
5.1 飞桨(PaddlePaddle)深度学习平台
- AutoDL自动化建模工具:支持模型设计、迁移学习、模型压缩,提升建模效率。
- PaddleHub迁移学习平台:提供预训练模型和Fine-tune API,支持快速建模。
- PARL强化学习框架:支持主流强化学习算法,提升机器人控制和AI应用。
- PGL图神经网络平台:涵盖GCN、GAT等算法,支持大规模图数据处理。
- VisualDL训练可视化工具:帮助开发者观测训练趋势、数据质量、参数变化等。
5.2 UNIT智能对话训练与服务平台
- UNIT 3.0平台:支持7.4万定制技能,累计交互次数超1380亿次,覆盖智能客服、智能出行、智能办公等场景。
- ERNIESLU语义理解模块:在相同理解精度下,标注量减少37%至72%。
- DataKit数据生产工具:提升数据生产效率8倍。
- 智能对话系统:支持个性化、情感识别、多轮对话等,提升交互体验。
5.3 开放数据集
- ApolloScape自动驾驶数据集:包含多种场景解析、车道线检测、车辆自定位等,是行业领先的三维数据集。
- DuReader阅读理解数据集:包含30万个问题、150万个文档、66万个答案,支持中文阅读理解。
- SKE信息抽取数据集:包含21万中文句子和43万三元组实例,支持信息抽取技术。
- BERL实体链指数据集:支持短文本实体标注,推动知识图谱发展。
- BSTC机器同传数据集:包含50小时演讲数据,支持语音翻译研究。
- iChallenge医学影像数据集:包含青光眼、病理性近视、黄斑变性等数据,推动医学图像分析技术发展。
六、AI安全
- BASSOS AI安全OS栈:为AIoT设备提供安全防护,支持多种操作系统。
- KARMA自适应热修复技术:实现系统漏洞的快速修复,不依赖系统更新流程。
- 可信计算框架MesaTEE:支持数据安全流通和AI模型保护,集成于飞桨等框架,提升数据与模型安全。
- 安全多方计算方案:包括SQL查询引擎和逻辑回归联合建模,支持隐私保护下的数据和模型安全。
- AI模型攻防技术:通过形式化验证技术DeepVerification,提升AI系统的安全性,已在Apollo无人驾驶系统中应用。
总结
百度大脑在2018-2019年度取得了显著的技术成果,涵盖算法、算力、数据、感知、认知和安全等多个领域。其技术成果不仅在学术界获得多项冠军,也在工业界实现广泛应用,推动了AI在多个行业中的落地。百度通过构建开放平台、开源项目和行业解决方案,助力AI技术的普及和应用,为智能时代创造了广泛的社会经济价值。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载