厦门大学:2024多说话人分离技术及应用进展报告_21页_3mb
报告摘要
报告总结
一、研究背景
多说话人语音分离(说话人日志)旨在判断给定多人语音中每个时间段的说话人。
应用场景包括会议纪要、多说话人转录、智能客服和录音质检等。
研究趋势从简单场景转向复杂场景,架构从模块化向端到端演进,涉及Kaldi、HMM、神经网络等技术,挑战包括噪声干扰、未知人数和语音重叠。
二、2 工业版本 — 模块化系统
- 功能
- 2.1 分割音频
- 2.2 提取说话人表征(i-vector, x-vector)
- 2.3 聚类(AHC 等算法)
- 流程:VAD → 语音端点检测 → 提取特征 → PCA 与 Cosine 打分 → 聚类
- 问题:语音重叠影响,需用神经网络分段处理(最多处理3人)
三、3 改进方案 — 神经网络分割
- 方法:将音频分段(5秒一段),基于神经网络判断说话人
- 解决重叠问题:合并相同说话人语音,去除重叠
- 加速:用 C 代码替代 Python,实时率 RTF 为 0.03~0.06
- 模型优化:SincNet/LSTM/Fedforward 等模型对比
四、4 落地应用 — 声云语音转写
- 性能:支持 330~350 小时语音转写,无投诉
- 优势:
- 高效(1 小时离线音频耗时 4 分钟,友商多为 5 分钟)
- 稳定(支持超 5 小时离线音频,友商最多 5 小时)
- 专业:支持多角色分离和中文普通话
汇报完毕,敬请指正。
厦门大学智能语音实验室,speechxmueducn
毕设20230388 孙宸泽
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载