【谷歌】2024面向教育的生成式AI的负责任发展:评价驱动的方法(英译中)_86页_4mb
报告摘要
面向教育的生成式AI的负责任发展:评价驱动的方法
核心内容
本报告探讨了生成式AI(Gen AI)在教育领域的负责任发展,特别是通过评价驱动的方法来优化AI导师的性能。报告强调了教育领域对AI技术的潜力和挑战,并提出了一个全面的评估框架,以确保AI系统能够有效支持学习者和教育工作者的需求。
主要观点
- 教育的重要性:优质教育是推动社会进步和经济发展的关键因素,但当前全球仍存在教育不平等现象,尤其是在低收入国家和美国部分地区。
- Gen AI的潜力与挑战:Gen AI可以提供个性化辅导,但其教学能力尚未完全实现,主要是由于教学直觉难以转化为提示,以及缺乏良好的评估实践。
- 参与式方法:通过与学习者和教育工作者的协作,确保AI系统的开发符合他们的需求和价值观。
- 微调优于提示:虽然提示工程是调整AI行为的一种方法,但微调(尤其是监督微调)更有效地嵌入教学行为,从而提升教学效果。
- 多维度评估框架:开发了涵盖定量、定性、自动和人工评估的七种教育基准,以全面评估AI导师的教学能力。
- AI与人类评估的结合:自动评估方法(如基于语言模型的评论家)可以提供快速反馈,但人类评估仍是衡量教学效果的黄金标准。
- 现实环境的测试:通过与亚利桑那州立大学(ASU)的合作,将AI导师集成到真实学习环境中,以评估其实际效果和改进方向。
关键信息
1. 教育的挑战与机遇
- 全球仍有大量学习者面临教育不平等的问题,Gen AI的普及可能有助于解决这一问题。
- 教育是社会流动性的重要驱动力,但目前AI工具尚未被充分优化以满足教育需求。
- AI可以提供即时反馈和个性化辅导,但其教学能力仍需提升。
2. 参与式方法
- 通过参与式研讨会、访谈和协同设计活动,收集学习者和教育者的反馈,以指导AI系统的开发。
- 与Daniel Shiffman及其学生合作,开发了Shift Bot,作为AI导师的原型,以提供更贴近实际学习场景的支持。
- 参与式方法有助于确保AI系统符合实际需求,同时识别技术的局限性。
3. 微调数据集
- 为了提升Gemini 1.0的教学能力,开发了LearnLM-Tutor微调数据集。
- 数据集包含人类辅导、Gen AI角色扮演和合成数据,以展示不同的教学策略。
- 微调数据集覆盖了广泛的主题,并包含多轮对话,以评估AI导师在动态学习环境中的表现。
4. 教育基准
- 开发了七个教育基准,涵盖定量、定性、自动和人工评估,以全面衡量AI导师的教学能力。
- 基准包括:鼓励主动学习、管理认知负荷、促进积极参与、深化元认知、激发好奇心、适应学习者水平和目标、以及保持对话主题。
- 这些基准为AI导师的开发和评估提供了指导。
5. 自动评估
- 引入了基于语言模型的自动评估(LME),以衡量AI导师在特定教学维度上的表现。
- 通过任务规范和LLM评论家,对AI导师的响应进行评分。
- 自动评估提供了快速反馈,但其准确性仍需改进,尤其是在捕捉教学的细微差别方面。
6. 人类评估
- 人类评估是衡量AI教学效果的黄金标准,但其成本高且难以扩展。
- 人类评估结果显示,learnlm-tutor在多个教学维度上优于Gemini 1.0,尤其是在促进学习者参与和识别错误方面。
- 人类评分者在评估AI导师时,主要关注教学行为是否符合教育原则。
7. 实际应用:ASU学习大厅计划
- 将learnlm-tutor集成到ASU学习大厅中,用于编程入门课程CSE 110。
- HallMate(基于learnlm-tutor的Chrome扩展)提供了即时反馈、代码帮助、资源推荐和学习策略支持。
- 学习者反馈表明,HallMate在帮助他们理解内容和解决问题方面表现良好,但也存在信任和依赖性问题。
结论
本报告展示了通过参与式方法和评价驱动的策略,开发和优化教育用例中的生成式AI系统的初步成果。通过结合定量、定性和自动评估,我们提出了一个更全面的AI教育评估框架,旨在促进AI在教育中的负责任发展,并最大化其积极影响。未来的工作将集中在进一步迭代和扩展这些评估方法,以确保AI导师能够更好地适应不同学习者的需求,并在实际教学中发挥更大的作用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载