美团-2020美团技术年货——算法篇-2021.1-317页_16mb
报告摘要
2020 美团技术年货 - 算法篇总结
核心内容概述
2020年美团技术年货中,算法篇重点介绍了美团在搜索排序和模型预估方面的技术实践,包括Augur预估框架的建设、Transformer在搜索排序中的应用以及BERT在搜索相关性优化中的探索。这些技术不仅提升了搜索系统的性能,还增强了用户体验和业务指标。
主要观点与关键信息
1. 智能搜索模型预估框架 Augur
背景
- 美团搜索系统经历了从传统检索引擎向AI搜索引擎的升级。
- 美团内部已构建了搜索数据平台、在线检索框架及云搜平台、在线AI服务及实验平台三大体系。
- Augur是搜索AI化的核心组件之一,解决了模型从离线训练到在线服务的系统问题。
Augur 架构特点
- 业务解耦:只负责特征抽取和模型预估,业务逻辑由上层处理。
- 分布式支持:无状态设计,支持数千级别文档的深度模型预估。
- 高效复用:通过OP和Transformer抽象,实现特征和模型的配置化管理。
预估流程
- 特征抽取:分为ContextLevel和DocLevel,分别进行计算。
- 模型预估:通过异步流程和分片并发处理,提升性能。
- 性能提升:迁移至Augur后,上千份文档的深度模型预估性能提升一倍。
服务化与管理平台
- Poker平台:提供模型和特征的配置化管理,支持一键训练、上线、灰度、回滚等操作。
- Augur与Poker结合:形成一个功能完善、易于扩展的在线预估平台。
Model as a Feature
- 支持将一个模型的输出作为另一个模型的特征输入。
- LocalModelFeature:用于同构特征,减少RPC。
- RemoteModelFeature:用于异构特征,调用不同服务。
2. Transformer 在美团搜索排序中的实践
模型结构
- Transformer Layer:用于建模用户行为序列和重排序。
- DIN & DIEN:用于行为序列建模,提升模型对用户兴趣变化的理解。
- BST模型:使用Transformer捕获用户行为序列中的关联特征。
实践效果
- 行为序列建模:三层Transformer编码层效果最好,模型复杂度不宜过高。
- 重排序模型:使用Transformer结构,结合位置编码和特征筛选,提升线上NDCG和QV_CTR指标。
实践经验
- 重排序候选集大小:选择Top10商户进行重排,避免性能问题。
- 位置编码:对排序效果有显著提升,需在模型中保留。
- 特征筛选:通过重要性评估筛选关键特征,提升模型预测性能。
3. BERT 在美团搜索核心排序中的探索和实践
BERT 模型优势
- 强大的语义理解能力,适用于深度语义相关性建模。
- MT-BERT:基于美团业务语料训练,支持多语言场景。
应用方式
- Feature-based:将Query和Doc编码为向量,用于相关性召回。
- Finetune-based:基于用户点击数据,通过Fine-tuning优化Query-DOC相关性。
排序模型优化
- L2模型:使用BERT相关性分数作为特征,提升排序效果。
- 数据增强:通过用户行为数据构造弱监督样本,优化正负样本质量。
- 样本去噪:过滤无意义Query、品牌词干扰、非相关POI等。
- 数据采样方法:包括全局随机采样和Skip-Above采样,提升样本质量。
优化方向
- 领域适配:结合业务特征,改进BERT预训练和Fine-tuning过程。
- 模型压缩:通过知识蒸馏,将12层BERT模型压缩为2层,降低推理成本。
4. 未来展望
- 特征工程:探索BERT在精排模型中的应用,进一步提升语义建模能力。
- 行为序列建模:引入更多用户数据,探索图神经网络等技术。
- 重排序建模:结合强化学习,利用用户实时反馈进行排序优化。
- 多目标排序:探索Partition Model和多目标相关技术,提升搜索系统对多业务场景的适应能力。
技术亮点
- Augur:实现模型与特征的解耦,支持高效、灵活的在线预估。
- Transformer:在行为序列建模和重排序中取得显著效果,提升排序质量。
- BERT:用于语义相关性建模,提升搜索结果的深度语义匹配能力。
招聘信息
- 美团搜索核心排序组长期招聘搜索推荐算法工程师,欢迎有意向的同学投递简历至:tech@meituan.com(邮件标题注明“美团搜索核心排序组”)。
作者简介
- Augur:朱敏、紫顺、乐钦、洪晨、乔宇、武进、孝峰、俊浩等来自美团搜索与NLP部。
- Transformer实践:肖垚等来自美团AI平台搜索与NLP部。
- BERT实践:李勇、佳昊、杨扬、金刚、周翔、朱敏等来自美团搜索与NLP部。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载