李正兴:腾讯游戏知几语音合成大模型推理实践-25页_3mb
报告摘要
李正兴在腾讯游戏知几语音合成大模型推理加速方案演讲中,分享了应用于游戏产品的语音技术改进。背景部分介绍了王者荣耀、和平精英等游戏中的AI语音助手,如小妲己的回答,强调了TTS技术的优化,使用自研知音语音大模型,10秒音频实时率提升至0.0085。
模型结构分析对比了传统方案和基于语言模型的新方案,涉及FastSpeech/Tacotron等模型,指出挑战在于高并发和实时率问题。
推理加速方案借鉴了NLP领域的LLM优化技术,包括KV cache、GQA、BPE和批处理等。KV cache优化了注意力计算,GQA减少注意力头数降低推理耗时20%,BPE通过子词映射减少token生成数量,从500个降至170个,同时采用连续批处理提升吞吐量至1秒2500token,实时率从209优化到0.011。
未来规划提到应用投机采样、改造成流式输出结构,并探索非Transformer的网络架构,重点优化高并发和实时性能。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载