国际清算银行-让人工智能代理完成一般任务(英)-2025.2_19页_3mb
报告摘要
总结:Putting AI agents through their paces on general tasks
核心内容
本研究探讨了当前大型语言模型(LLMs)在执行一般性任务中的表现,特别是通过分析其在三个纽约时报游戏中的表现:Wordle、Face Quiz 和 Flashback。这些游戏虽然对人类来说相对简单,但要求AI具备自我意识、从错误中学习以及规划能力等高级认知技能。
主要观点
-
当前LLMs在一般任务中的表现有限
尽管LLMs在某些复杂任务中表现出色,但在需要自我纠正、实验和适应性的任务中表现不佳。研究指出,它们缺乏对自身错误的持续识别能力,也无法有效调整策略来弥补知识不足。 -
评估AGI-aspiting LLMs需要更全面的测试
传统的评估方法通常基于单一维度、明确的指标,这不足以衡量LLMs在现实世界中的通用智能。为了真正评估其是否具备AGI潜力,应采用涵盖多种认知能力的综合任务。 -
人类在动态环境中的适应性更强
人类在处理一般性任务时,能够灵活调整策略、识别错误并进行自我修正。相比之下,LLMs在这些方面存在明显短板,特别是在处理图像反馈和字母背景颜色时。 -
自我评估与修正机制是AGI的关键
研究强调,AGI-aspiting LLMs必须具备自我评估、自我批评和自动修正的能力。这些能力对于在现实环境中可靠执行任务至关重要,因为完美表现几乎不可能。
关键信息
- 测试方法:通过让LLMs玩Wordle等游戏,测试其在动态、多步骤任务中的表现。
- 实验对象:Claude CU 和 GPT o1 两个模型被用于实验。
- 实验结果:
- Claude CU 在63次Wordle测试中成功17次,16次陷入无效单词却最终声称胜利,16次错误声称胜利,4次正确识别失败。
- GPT o1 在63次测试中成功50次,其中3次有轻微定位错误,但均能恢复;13次失败,其中7次误判反馈,5次过早声称胜利。
- 主要问题:
- 无法正确识别字母背景颜色。
- 无法删除错误输入,导致后续猜测无效。
- 缺乏有效的实验策略,难以从错误中学习。
结构清晰要点
1. 引言与背景
- 本文讨论了LLMs是否能成为AGI的可能。
- 当前LLMs通常在单一任务中表现优异,但在涉及自我修正、学习和规划的复杂任务中表现不佳。
- 本文通过测试LLMs在Wordle等游戏中的表现,揭示其在现实任务中的局限性。
2. 文献综述
- 多数LLMs的评估基于复杂任务,如数学题和法律考试。
- 一些新的测试如FrontierMath和Humanity's Last Exam旨在评估AI的通用智能,但目前最先进的LLMs仍表现不佳。
- 人类在处理复杂、模糊任务时具有优势,而LLMs在这些方面仍需改进。
3. Wordle测试分析
3.1. Claude CU测试
- 表现:在63次测试中成功17次,16次陷入无效单词却声称胜利,16次错误声称胜利,4次正确识别失败。
- 错误类型:
- 无法正确识别字母背景颜色。
- 无法删除错误输入,导致后续猜测无效。
- 自我修正能力:Claude CU在部分情况下能够识别错误并调整策略。
3.2. GPT o1测试
- 表现:在63次测试中成功50次,13次失败。
- 错误类型:
- 误判字母颜色,导致错误反馈。
- 在部分情况下过早声称胜利。
- 自我修正能力:GPT o1在部分情况下能识别并修正错误,但整体仍存在不足。
4. 一般性任务评估的重要性
- 评估AGI-aspiting LLMs应关注其在复杂、多步骤任务中的表现。
- 人类在处理这类任务时具有高度的适应性和自我修正能力,而LLMs尚不具备这些能力。
- 为了确保LLMs在现实世界中的可靠应用,必须改进其自我评估和修正机制。
5. 未来展望
- 本文提出了两个场景,探讨了AGI-aspiting LLMs在中央银行等机构中的潜在应用。
- 需要更全面的测试方法,以确保LLMs在现实任务中的有效性。
结论
- 当前LLMs在执行需要自我意识和学习能力的一般任务中表现不佳。
- 评估AGI-aspiting LLMs应采用综合任务,而非单一维度测试。
- 为了实现AGI,LLMs必须具备自我评估、自我批评和自动修正的能力,这些能力是其在现实世界中可靠应用的关键。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载