2025年大语言模型翻译质量评测报告
报告摘要
北京第二外国语学院发布的BISU-AiTQA(v1.0)评测报告,首次构建以汉语为核心的多语种大语言模型翻译质量评测体系,在当代文学、党政文献和外事新闻三个领域,对五个目标语言和六个主流大模型(Claude、ChatGPT、Gemini、Grok、DeepSeek、通义千问)进行综合评估。
报告指出,目前大语言模型在翻译任务中虽已在语义理解和表达自然度上达到接近人类译者水平,但在汉语特色领域、复杂句式处理、文化负载词传达等方面仍存在明显短板。
评测提出“双维六项”指标体系,分别从语言特征维度考察词汇多样性、句法复杂度和篇章衔接度;并从神经网络维度使用COMET、语义忠实度与语言可接受度等指标,试图更全面地评估模型表现。
报告发现,在翻译质量与语义还原方面,Claude综合表现最强,尤其在专业文本翻译上表现突出;而中文模型Qwen-Plus在多个语言方向亦表现较为优异。然而,各模型在阿拉伯语等语言领域的表现普遍不佳,语义理解准确性差异显著。
专业译者视角的分析进一步指出,当前大语言模型在处理中国特色话语、政治文本、文学文化负载词时,容易产生术语误译、文化转译偏差或语义简化,尤其是在正式外交语境或政策表述方面,模型表现出在忠实性和风格统一性方面的不足。
本研究不仅填补了以汉语为核心、多语种翻译质量评测的空白,其构建的指标体系和语料库也具备推动智能翻译技术发展、提升翻译教学和语言测试模式的重要应用价值。同时,该评测努力推动汉语在全球层面作为源语的表达力,促进中外人文交流。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载