【Meta_AI】2024年AI大语言模型学习报告_84页_40mb
报告摘要
Yann LeCun在2024年Lytle讲座中提出,当前AI系统距离实现人类水平智能仍存在重大差距。他强调AI应具备学习、记忆、推理、规划、常识理解等能力,同时保持安全可控性。现有技术如自监督学习(SSL)已广泛应用于文本、图像、语音等领域,但自回归大型语言模型(AR-LLMs)仍存在致命缺陷:缺乏常识、规划能力及对现实世界的理解,导致事实错误、逻辑矛盾和毒性输出。需转向目标驱动的AI架构,通过学习世界模型实现智能行为。
LeCun指出,人类和动物能快速学习新任务、理解物理规律,并具备规划与推理能力,而当前AI在这些方面表现不足。其核心挑战包括:1)从感官输入学习非任务特化的世界模型;2)实现类“系统2”的推理能力;3)基于目标进行复杂规划。他提出,自监督学习需结合联合嵌入架构(JEPA),通过预测抽象表征而非具体像素来避免生成模型的局限性,同时采用能量基础模型(EBM)和正则化方法提升泛化能力。
针对AI在图像识别、语言翻译等领域的应用,LeCun列举了NLLB(支持202种语言翻译)和SeamlessM4T(支持100种语言双向转换)案例,说明SSL的扩展性。但核心问题仍是AI无法像人类般理解物理世界,例如儿童在4年内通过非语言方式积累的数据量远超LLMs训练数据。他建议放弃生成模型,转向JEPA架构,采用正则化方法(如VICReg、 VICRegL)优化表征学习,减少预测误差并保持表征多样性。
目标驱动AI需包含感知、世界模型、目标函数、记忆、规划和安全约束模块。其特征是通过能量最小化实现规划,利用联合嵌入表征环境状态,并结合递归世界模型和分层规划处理复杂任务。如从NYU到巴黎的行程,高层模型设定目标,基层模型执行具体路线选择。LeCun认为,此类架构可提升AI在不确定环境中的鲁棒性,且非生成式方法在图像分类任务中已超越传统生成模型。
未来AI需具备开放性与安全性,依靠自监督学习构建通用知识平台。他呼吁建立开源AI系统,避免被少数科技公司垄断,并通过群体协作进行训练与优化。同时,强调AI将增强人类智能,推动社会进步,而非造成威胁。尽管存在短期风险(如虚假信息、算法歧视),但这些可通过技术手段(如内容过滤、伦理设计)解决。长期来看,AI将如印刷术般引发认知革命,但需通过系统设计确保其目标与人类价值观一致,而非盲目追求性能提升。
试读结束,高清完整版pdf/doc/ppt,请点下载