2024-05-24-厦门大学-2024多说话人分离技术及应用进展报告_21页_3mb
报告摘要
研究背景
多说话人分离技术(说话人日志)旨在从包含多人交替说话的语音中识别每个时间段的说话人。此技术已应用在会议纪要、多说话人转录、智能客服和录音质检等场景。终端设备包括录音笔、智能手机和个人电脑,支持厂商有科大讯飞、华为和声云。主要挑战包括噪声干扰、未知人数和语音重叠,尤其在复杂场景中。
研究趋势
当前研究从简单场景向复杂场景扩展,系统架构包括模块化和端到端两种。模块化系统通过分段处理和聚类算法实现分离,端到-end系统利用深度学习模型自动处理。聚类算法如凝聚层次聚类被应用于实际应用,改进方案包括使用神经网络分割语音、在线版本和针对特定场景优化。
模块化系统
模块化系统采用端到端架构,包括音频分割、说话人表征提取和聚类步骤。具体实现如使用凝聚层次聚类算法(参考文献1-7),改进方案解决了语音重叠问题,通过神经网络分段和阈值调整提高准确性。工业应用示例如自研引擎支持普通话分离,并超过友商处理时间。
端到端系统
端到-end系统以神经网络模型为基础,能预测说话人数并检测目标语音。模型如基于CTC或HMM的训练方法,适用于实时和在线场景,涵盖多麦克风输入和场景适应。已应用于工业产品,提升处理效率,支持长时间离线任务。
聚类算法
主要聚类算法对比包括无监督和有监督方法:
- 无监督聚类(如凝聚层次聚类):基于阈值或初始化调节。
- 有监督聚类(如深度神经网络):支持重叠语音检测和说话人数量输出。
改进方案减少参数依赖,提高聚类效率。
应用与落地
技术已落地于实际产品,如声云语音转写工具,提供角色分离和长时间处理能力。工业版本优化了实时性能,提升了用户投诉率和处理时长。应用涵盖离线和在线场景,支持多种设备,增强场景适应性。
总结
多说话人分离技术不断演进,从传统聚类到端到-end神经网络,解决了语音重叠等挑战。实际应用提升用户体验,赋能录音质检和智能客服等领域。技术仍在噪声干扰和未知场景下优化。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载