小红书:语义模型在小红书社区搜索的应用_23页_1mb
报告摘要
语义模型在小红书搜索中的应用总结
小红书搜索面临的问题
小红书搜索需要处理多模态数据(文本、图像、视频),异构内容(包括图文笔记、长短视频、商品、用户和评论等),并支持个性化推荐。这些挑战要求搜索系统能理解用户查询意图并提供精准结果。
语义模型的应用
语义模型在搜索的召回和排序阶段发挥关键作用。在召回阶段,通过插入式倒排和向量召回聚合不同来源的内容,提升效率。插入式查询先分词、处理查询扩展和纠错,然后使用倒排表快速返回候选笔记;向量召回则基于query特征、笔记特征(通过神经网络计算余弦相似度)在线推理,使用ANN引擎处理实时数据。在排序阶段,融合相关性和多维度因子,包括内容质量、时效性、个性化和多样性,利用LTR模型微调分数。
训练和评估
语义模型基于BERT进行训练。三阶段过程:预训练阶段(MLM,unsupervised),后训练阶段(BCE任务,supervised),以及基于回归的微调阶段。在线推理通过模型蒸馏、摘要归纳、量化(FP16)优化性能,使用Megatron-LM和Tensorflow训练框架,并采用分布式训练和推理工具如TF Serving和FasterTransformer。
该分享展示了语义模型在提升小红书搜索相关性和个性化的效果,结合BERT多模态能力(如图文部分专用训练)优化了整体性能。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载