2024-11-24-复旦大学-2024年大语言模型的能力边界与发展思考报告_101页_17mb
报告摘要
大语言模型的能力边界与发展思考
核心结论
-
感知与生成能力强,深度理解和推理能力弱:
- 当前大模型在文本生成、模仿任务等方面表现出色,但本质上是基于统计规律预测下一个词(文字接龙),而非真正理解语义。
- 大模型能力来源于海量数据训练(知识记忆+表示学习),但不能进行逆向知识搜索或深度的逻辑推理/演绎。
- 数学等推理任务(如MathTrap数据集,错误率高达65%)和知识问答任务(如高考数学模拟分数普遍不及格)显示其能力边界。
-
能力边界清晰,存在显著短板:
- 知识运用困难: 无法完成分类、比较、逆向知识搜索等任务。
- 泛化能力有限: 在分布外(OOD)数据上表现恶化,提示能力主要来自微调而非固有智能。
- 对标人类AGI差距大: 目前尚处于单一任务优化阶段,无法实现层次化规划、物理世界理解等AGI必需的能力。
- 退化风险: 大规模微调会损害原有的世界知识。
-
未来发展方向的两条路径:
- 路径一:AGI方向(效仿OpenAI)
- 目标: 代替人类所有脑力劳动。
- 特点: 追求更大规模、持续迭代、理论基础驱动、资本密集,长期目标是通用人工智能。
- 挑战: 推理、世界建模、智能化的本质尚不清晰,资本与技术投入巨大。
- 路径二:垂直应用方向
- 目标: 解决特定场景下的特定问题。
- 特点: 基于现有大模型能力,利用廉价数据和端侧算力优化,注重场景选择与适配,可能更容易实现商业化落地。
- 挑战: 需准确评估模型能力边界,找到有竞争力的应用场景,而非低效复制通用能力。
- 路径一:AGI方向(效仿OpenAI)
-
发展关键因素:
- 基础理论: 对物理世界建模、知识表征、推理机制的研究仍是核心挑战。
- 能力边界认知: 明确模型能做什么、不能做什么,是合理投入资源和选择发展路径的前提。
- 高效训练技术: 如LoRA+MoE,在维持原有知识的同时提升特定能力。
汇报要求总结
本次分析旨在梳理当前主流大语言模型(以ChatGPT代表)的能力边界与发展趋势。我们重温了科技发展历史启示,回顾了ChatGPT强大的原因,剖析了模型发展全过程,并明确分析了模型能力获取的方式、实战应用中的表现与局限,同时针对未来发展前景提供建议思路,以期帮助全体参会人员在一个清晰和全面的视角下,认知当前领先的大语言模型能力及其满足用户需求的方式。
针对本次的重点汇报内容,我们围绕以下几个核心主题依次展开,目的在于同舟共济,审视全面框架下各领域发展瓶颈与突破路径。
- 模型核心任务:语言模型的根本在于生成连贯文本。
- 实现发展方向:预训练奠基,有监督微调提升,强化学习辅助优化。
- 数据与训练阶段总结:预训练需高密度优质数据,微调则需优化数据与训练策略。
- 知行合一,未来何在:真实性思考、方向分岔、策略建议。
- 知识问答与任务能力提升:冲击人类世界知识边界。
- 微调带来的权衡:精准数据量与混合带来的冲突。
- 指令微调与高效训练重点:识别挑战、把握共享特征、支撑事实假设。
- 核心能力与边界:多层级表现、现实具体应用中的体现
- 迈向未来:路径交叉、资源投向选择、场景内商业化应用动向。
最后,我们期待通过本次活动,大家共同透彻理解人工智能技术的内涵,积极探索其未来应用方向,共筑智能领域的未来发展蓝图。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载