【极客传媒】大语言模型的幻觉检测_30页_6mb
报告摘要
大语言模型的幻觉检测总结
核心内容
大语言模型(LLM)在创新技术发展的同时,也需要相应的评测技术来确保其输出的准确性和可靠性。幻觉检测作为评测的重要组成部分,旨在识别模型生成内容与事实不符或与上下文不一致的情况。幻觉主要分为事实性幻觉(生成内容与已知事实不符)和忠实性幻觉(生成内容与用户指令或上下文不符)。针对这些问题,北京智源人工智能研究院联合多个机构开发了FlagEval天秤评测平台和HalluDial评测集,以及HalluJudge检测模型,以提升幻觉检测的自动化和准确性。
主要观点
- 幻觉检测的重要性:随着大模型的广泛应用,幻觉问题日益突出,影响模型的可信度和实用性。因此,构建有效的幻觉检测工具和方法是推动大模型技术健康发展的重要环节。
- 评测范围的扩展:评测不仅需要覆盖模型的基本能力,还需深入探索模型在复杂场景下的表现,尤其是对话场景中的幻觉检测。
- 评测方法的多样性:幻觉检测方法包括基于检索、基于模型内部行为、基于分类器、基于问答以及基于提示(Prompting)等多种方式,每种方法都有其适用场景和优势。
- HalluDial评测集:这是首个用于对话级幻觉评估的大型基准数据集,包含146,856个样本,涵盖自发式和诱发式幻觉,支持对模型幻觉的检测、定位和解释。
- HalluJudge模型:作为首个支持幻觉定位与解释的检测模型,HalluJudge在多个模型上的检测精度达到SOTA,人工检验准确率高达93.65%。
关键信息
幻觉检测工具与平台
- FlagEval天秤:在科技部支持下,智源研究院联合多家机构构建的评测平台,包含16大评测任务和近60个数据集,支持对大模型的全面评估。
- HalluDial:一个专注于对话场景的幻觉检测数据集,包含146,856个样本,分为自发式和诱发式两种类型,覆盖多个话题。
- HalluJudge:基于HalluDial训练的幻觉检测语言模型,具备高精度和可解释性,能够自动评估模型的幻觉率,并支持不同任务和领域的泛化能力。
幻觉检测方法
- 事实性幻觉检测:通过检索相关知识并对比生成内容,判断其是否与已知事实冲突。
- 忠实性幻觉检测:检查生成内容是否与用户指令或上下文一致,以及是否在内部逻辑上自洽。
- 检测指标:包括F1 Score、准确率(Acc.)、精确率(P)、召回率(R)等,用于评估模型的幻觉检测能力。
模型表现分析
- 幻觉率普遍较高:所有主流大语言模型均存在幻觉问题,但GPT系列模型的幻觉率相对较低。
- 模型规模与幻觉率无明显相关性:大模型和小模型在幻觉率上无显著差异。
- 不同模型常见幻觉话题不同:部分模型在特定话题上更容易产生幻觉,如科技、历史、法律等。
幻觉检测的挑战
- 缺乏对话场景下的检测:现有工具更多关注句子和段落级别的检测,对话轮次较少。
- 缺乏可解释性:多数检测方法仅能识别是否存在幻觉,难以提供具体原因。
- 依赖人工或裁判模型:复杂场景下,幻觉检测仍需人工参与或依赖如GPT-4等高精度模型。
展望与建议
- 构建评测体系:需进一步完善评测范围,覆盖更多应用场景,推动评测技术的发展。
- 推动国际标准:智源研究院联合多家机构成立了IEEE大模型评测工作组,正在制定《P3419标准》,计划于2026年发布。
- 开源与共建:HalluDial等评测集已开源,鼓励更多研究者参与评测方法的共建与共享。
- 持续优化:HalluJudge等检测模型仍在持续优化中,以提升其在不同任务和数据集上的泛化能力。
评测数据与模型性能
| 模型 | 事实性幻觉检测 | 忠实性幻觉检测 | 幻觉检测 | 幻觉定位 | 幻觉解释 |
|---|---|---|---|---|---|
| Llama-2-13B-chat | 19.99 | 57.69 | 19.39 | 57.59 | - |
| Llama-2-70B-chat | 22.35 | 62.42 | 20.40 | 59.43 | - |
| Qwen1.5-14B-Chat | 7.64 | 26.48 | 8.17 | 29.49 | - |
| GPT-3.5-turbo | 3.40 | 13.65 | 3.21 | 13.14 | - |
| GPT-4 | 1.34 | 5.54 | 1.47 | 6.23 | - |
| HalluJudge | 80.07 | 89.77 | 86.48 | 89.89 | 93.65 |
未来方向
- 推动评测标准化:建立统一的评测标准,促进大模型的公平比较与技术发展。
- 增强评测工具的实用性:开发更高效、更易用的幻觉检测工具,支持更多应用场景。
- 加强国际合作:通过IEEE工作组推动大模型评测的国际协作,提升评测的全球影响力。
评测共建邀请
- 参与方式:欢迎各界人士加入评测共建,共同推动大模型评测体系的发展。
- 联系邮箱:flageval@baai.ac.com
- 工作组成员:包括智源研究院、信通院、浪潮国重实验室、鹏城实验室、移动研究院、联通研究院、山东省计算中心、百度、智谱AI、北航、Sciumo Inc等27家机构。
结语
大语言模型的幻觉检测是评测技术的重要组成部分,通过构建高质量的评测集和模型,有助于提升模型的可信度和实用性。未来,随着评测体系的不断完善和国际标准的建立,大模型的评估将更加全面和科学。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载