> **来源:[研报客](https://pc.yanbaoke.cn)** # 大模型背景下的可信自然语言理解总结 ## 核心内容 大模型在自然语言理解方面展现出强大的语言处理和推理能力,但同时也存在一些关键问题,如幻觉、结果不稳定和偏置。这些问题源于模型对事实的记忆能力较强,但对事理逻辑的理解能力较弱。因此,研究者提出通过知识增强、因果机制引导和基于大模型辩论的方法来提升模型的可信度和稳定性。 ## 主要观点 - **模型规模与智能涌现**:随着模型参数规模增加,模型在某些任务上“涌现”出令人惊讶的智能表现。模型参数规模超过22B时,才有可能“涌现”智能。 - **大模型的局限性**: - 容易产生幻觉:由于模型在训练过程中没有对知识进行验证和更新,导致其在某些情况下会产生错误信息。 - 结果稳定性差:模型可能依赖于与任务标签相关的“表面线索”而非因果信息,导致预测结果不稳定。 - 存在偏置:大模型对某些标签有特殊偏好,这种偏好可能影响其在常识推理任务上的表现。 - **知识增强的可信自然语言理解**: - 利用知识图谱、事理图谱等结构化知识,提升模型对事实的准确性。 - 引入因果机制,使得模型能够区分表面线索与语义信息,从而提升预测的稳定性。 - **基于大模型辩论的去偏自然语言理解**: - 多个大模型进行辩论,通过相互反驳和妥协,提升对任务的理解一致性。 - 辩论有助于消除模型间的偏见,使得模型输出更接近人类共识。 - **认知数据的辅助作用**: - 认知数据(如眼动、脑电图等)可以增强模型的学习表现。 - 认知数据可以用于指导模型设计和解释模型输出,提升模型的可解释性和可信度。 ## 关键信息 ### 抗战阶段划分 抗日战争可以分为以下五个阶段: 1. **局部战争爆发阶段**(1931年9月18日 - 1937年7月7日):从九一八事变开始,至卢沟桥事变结束。 2. **全面抗战初期阶段**(1937年7月7日 - 1938年12月):中国全面抗战开始,国民政府在南京成立中央军委。 3. **中国军队反攻阶段**(1939年 - 1941年):中国军队开始反攻,扩大了解放区。 4. **第二次国共合作阶段**(1940年 - 1945年):国共两党重新合作,建立抗日民族统一战线。 5. **全面反攻阶段**(1945年 - 1949年):中国军队在战场上占据主动,最终完成全国解放。 ### 大模型表现与测试 - **GPT-3测试样例**: - 问题:“烤箱和铅笔哪个更重?” GPT-3错误地回答“铅笔比烤箱重”。 - 问题:“我的脚有几只眼睛?” GPT-3错误地回答“两只眼睛”。 - **大模型在常识推理任务上的表现**: - **ChatGPT & Davinci-003**:在多个任务中表现优于开源模型,如αNLI(79.21%)、CSQA(79.31%)、COPA(97.00%)、e-CARE(81.53%)、PIQA(80.74%)等。 - **LLaMA & Vicuna**:在部分任务中表现较弱,如CSQA(68.58%)、PIQA(53.74%)等。 - **大模型辩论实例**: - 问题:“我今天打扫卫生时发现了我的旧年鉴。哪个事件可能导致这一天快结束了,我什么都没打扫?” - 选项 (A):“我迷失在一个充满美好回忆的世界里。” - 选项 (B):“我一直在寻找更多的东西。” - 通过辩论,模型最终达成一致,认为选项 (A) 更合理,因为沉浸于回忆容易导致忘记清洁工作。 ### 抗战相关知识 - 抗日战争的划分和各个阶段的特点,展示了中国在抗战期间的战略演变和合作过程。 - 抗战的结束标志着中国全面反攻的开始,并最终实现全国解放。 ## 解决方案 - **知识增强**:引入结构化知识库(如知识图谱、事理图谱)来增强模型的可信度。 - **因果机制引导**:通过识别和排除表面线索,使模型基于因果关系进行推理,提升结果的稳定性。 - **大模型辩论**:通过多模型之间的辩论,消除偏见,提升模型在常识推理任务上的表现。 ## 结论 可信的自然语言理解是大模型发展的重要方向。通过知识增强、因果机制引导和辩论等方式,可以有效提升模型的准确性、稳定性和公平性。这些方法在“百模”时代尤为重要,能够帮助模型更好地理解和回应人类需求。