兰德-Measuring-Deeper-Learning-Through-Cognitively-Demanding-Test-Items_-Results-from-the-Analysis-of-Six-National-and-International-Exams_121页_3mb
报告摘要
总结:通过认知要求测试题目衡量深度学习
核心内容
本报告分析了六项国家级和国际级考试的认知要求,以评估其在衡量深度学习方面的有效性。深度学习是指学生掌握核心学术内容、批判性思维、问题解决、合作、沟通以及“学会学习”的能力。研究旨在为威廉与弗洛拉·赫威特基金会的“深度学习计划”提供基准,以判断这些考试是否能够有效评估深度学习技能,并为未来基于共同核心州标准(CCSS)的评估提供参考。
主要观点
-
深度学习的定义与目标
深度学习强调学生在掌握核心内容的同时发展高阶认知技能。基金会希望通过这些考试评估,了解深度学习在美国的实施情况,并推动教育政策的改进。 -
考试选择与分析框架
研究选择了六项国际和国内广泛使用的考试:AP、IB、NAEP、PISA、TIMSS 和 PIRLS。分析采用了两个框架:Norman Webb 的深度知识(DOK)框架和 PARCC 的自我开发框架。DOK 框架将认知要求分为四个等级,PARCC 框架则根据数学和 ELA 的不同维度来衡量认知复杂性。 -
认知要求的评估
研究发现,六项基准考试在数学和 ELA 领域的认知要求普遍高于州级考试。例如,数学考试中约 15% 的题目被评定为 DOK 3 或以上,而 ELA 考试中这一比例达到 40%。相比之下,州级考试中 DOK 3 或以上题目仅占 2%(数学)和 20%(ELA)。 -
框架间的差异与调整
为了提高两个框架之间的可比性,研究对 PARCC 的评分机制进行了调整,重新分配了不同维度的权重。调整后的框架在数学和 ELA 领域与 DOK 框架的相关性分别为 0.93 和 0.91,表明调整后的评分机制与原始框架具有较高的一致性。 -
考试目的与学生群体的影响
考试的认知要求与其目标和学生群体密切相关。例如,AP 和 IB 考试面向学术能力较强的高中生,因此其题目更具有挑战性;而 TIMSS、PIRLS、NAEP 和 PISA 则面向所有学术水平的学生,题目认知要求相对较低。 -
高阶认知技能的评估标准
基于 Darling-Hammond 等人的框架,研究提出了两个高阶认知技能的评估标准:- 标准 I:至少三分之二的题目应达到 DOK 2 或以上。
- 标准 II:至少三分之一的数学题目和一半的 ELA 题目应达到 DOK 3 或以上。
研究发现,只有 IB 和 AP 考试在数学和 ELA 领域均满足这两个标准,而 PISA、NAEP、TIMSS 和 PIRLS 则未能满足。
-
对 CCSS 评估的启示
研究指出,虽然 CCSS 有潜力提高深度学习的评估比例,但在实践中创建高质量的深度学习考试仍然具有挑战性。因此,未来应分析 CCSS 考试的实际操作形式,以评估其是否真正衡量了深度学习。
关键信息
- 六项考试:AP、IB、NAEP、PISA、TIMSS、PIRLS
- 分析框架:DOK 框架(四个认知等级)和 PARCC 框架(数学和 ELA 五种或四种维度)
- 认知要求分布:数学考试中 DOK 3 或以上题目占比约 15%,ELA 考试中占比约 40%
- 高阶认知评估标准:
- 标准 I:至少三分之二的题目达到 DOK 2 或以上
- 标准 II:至少三分之一的数学题目和一半的 ELA 题目达到 DOK 3 或以上
- 满足标准的考试:
- 数学:AP、IB
- ELA:AP、IB
- 研究局限性:
- 考试题目认知要求被假设为固定属性,但实际可能受测试环境和学生个体差异影响
- 仅使用公开题目进行分析,可能无法完全代表所有考试内容
- 未考虑其他衡量深度学习的指标,如评分权重或时间分配
研究结论
本研究为评估深度学习提供了重要的基准数据,同时指出了当前考试在衡量深度学习方面存在的局限性。未来对 CCSS 考试的评估应考虑其与基准考试的相似性,特别是在考试目的和学生群体方面。此外,还需进一步发展框架,以全面评估深度学习技能,特别是内在和人际能力。
试读结束,高清完整版pdf/doc/ppt,请点下载