2025大语言模型翻译质量评测报告_10页_611kb
报告摘要
BISU-AiTQA 简版总结
1. 研究背景
- 大语言模型在翻译领域快速发展,已达到接近人类译者水平。
- 现有评测体系存在三大问题:汉语地位边缘化、文本类型单一化、评测视角局限性。
2. 研究内容
2.1 总体设计框架
- 语料维度:覆盖当代文学、党政文献、外事新闻三大类文本
- 语种维度:包括英、日、法、俄、阿五种目标语言
- 模型维度:涵盖 ChatGPT、Claude、Gemini、Grok、DeepSeek、通义千问等六个大模型
2.2 评测指标体系
- 语言特征维度:
- 词汇多样性
- 句法复杂度
- 篇章衔接度
- 神经网络维度:
- 整体翻译质量(使用 CodeLlama 指标)
- 语义忠实度
- 语言可接受度
3. 评测发现与结论
3.1 整体表现分析
- 神经网络维度表现稳健(CodeLlama 得分普遍在 47 左右,语义忠实度平均达 47)
- 语言特征维度表现差异较大,呈现"语义强、语言弱"特点
3.2 领域表现差异
- 党政文献:英文翻译表现最佳,日语翻译也表现优异
- 当代文学:日语翻译整体表现较好,阿语翻译普遍较差
- 外事新闻:英文和日语翻译表现稳定,俄语翻译的 CodeLlama 和 Deepseek-Coder 表现优秀
3.3 语种表现分析
- 英文和日文:表现稳定,整体水平较高
- 法语、俄语:表现处于中等水平
- 阿拉伯语:整体得分偏低,急需改进
3.4 模型综合表现
- DeepSeek-R1(676B):综合能力最强,尤其在党政和外事文本翻译方面表现突出
- Claude、Gemini、DeepSeek-Coder 相对均衡
- DeepSeek-R1:国产模型表现亮眼,在多个语种中表现良好
- Claude、Gemini:在特定语种的翻译中会出现简化问题
3.5 专业译者视角
- 大模型翻译存在事实性错误、措辞简化、文化负载词处理不当等问题
- 当前阶段的大语言模型尚难以全面胜任高质量翻译任务
4. 结语价值
- 技术层面:填补了"以汉语为核心"的多语种翻译质量评测空白
- 教学科研:建立了可用于翻译课程和语言测试的教学资源
- 文化层面:以汉语为核心、中国特色文本为基础,促进中外人文交流
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载