《当数字开始做决定》· 第一季“门槛线两边的人”· 第四篇
一、一份成绩单进入教室以后
假设一所小学收到新一轮NAPLAN结果。校长发现,三年级学生在写作上的总体表现低于相近背景学校,若干学生的个人报告被归入“Developing”或“Needs additional support”。
学校可以采取不同做法。它可以把结果与课堂作业、教师观察和学生语言背景放在一起,寻找真正需要加强的写作能力;也可以把下一年的目标直接定成“提高NAPLAN写作成绩”,增加模版练习、计时训练和题型重复,把没有进入测试的课程内容暂时让位。
两种做法都从同一个数字开始,最后形成的教学却不相同。
这说明NAPLAN并不只是站在教室外面记录学习成果。一旦成绩被用来设定目标、比较学校、配置支持或评价工作,它便进入了教学因果链。测量对象知道自己被怎样测量,便可能调整行为来适应指标。
真正的问题因此不是“NAPLAN能不能测量 literacy 和 numeracy”。它当然能够提供相关证据。问题是:当这项证据取得足够大的制度权重以后,学校是在改善学生真正需要的能力,还是在改善能够被测试看见的表现?
二、NAPLAN究竟测量什么?
NAPLAN是澳大利亚面向Year 3、5、7和9学生的全国性读写与计算能力评估,测试reading、writing、conventions of language以及numeracy。ACARA把结果定位为教师专业判断的补充,而不是替代日常课堂评估;它也明确指出,NAPLAN结果不测量一所学校的整体质量。National Assessment Program:《NAPLAN》
在线阅读、计算以及语言规范测试采用tailored test设计。学生先回答一组共同起点问题,后续题目难度会根据此前表现变化。最终成绩既取决于答对多少题,也取决于所分配题目的平均难度。这使测试能在有限时间内覆盖更宽的能力范围,但也意味着个人成绩不是简单的“正确题数”。National Assessment Program:《Tailored tests》
从2023年起,个人表现使用四个proficiency levels报告:
- Exceeding;
- Strong;
- Developing;
- Needs additional support。
“Strong”表示达到测试时点具有挑战性但合理的预期;“Needs additional support”表示尚未达到预期学习成果,并可能需要额外支持。官方说明同时提醒,这些描述是对该水平学生通常能够展示的技能所作的公平概括,不是对每一名学生的完整描述。同一水平的上端和下端,实际能够展示的能力仍可能明显不同。National Assessment Program:《Proficiency level descriptions》
这条提醒非常重要。一个proficiency level不是学生的固定身份,而是一次有限测试在特定领域、特定时点给出的分类。
三、“Developing”和“Strong”之间的线从哪里来?
四个等级看起来像自然存在的学习阶段,实际上需要人为设定cut-points。
NAPLAN 2025技术报告说明,2023年采用的新门槛经过三步形成:由有经验的教师、课程与测评专家进行标准设定;通过统计分析检查各年级之间是否形成合理的成长轨迹;再验证每个等级对应的技能描述。ACARA:《NAPLAN 2025 Technical Report》
所以,门槛并非随意画出。它把专业判断、课程预期和统计模型结合起来,目的在于回答一个实际问题:哪些学生已经达到当前年级具有挑战性但合理的预期,哪些学生仍在发展,哪些学生很可能需要额外支持?
但“经过严谨设定”不表示门槛两边存在本质差异。官方描述本身承认,同一等级内部存在范围。刚刚落入Developing的学生与刚刚进入Strong的学生,真实能力可能非常接近,制度标签却不同。
这条线最合理的用途,是触发进一步观察和支持。它最危险的用途,是把一次分类当成关于学生天赋、教师质量或学校价值的最终判断。
四、当指标成为目标,测量对象会发生什么?
NAPLAN结果有多个正当用途。家长可以借此与教师讨论孩子的优势和需要;教师可以识别需要挑战或支持的学生;学校可以检查课程中的薄弱环节;政府和教育系统可以观察不同群体和地区的长期差距。
可是同一个指标一旦关联声誉、资源和问责,学校便会产生优化它的动机。
这种反馈不一定出于欺骗。教师看见学生在某类写作任务上持续薄弱,本来就应该调整教学。问题在于,提升指标存在两条不同路径:
- 改善指标所代表的真实能力,使成绩随之上升;
- 训练学生更有效地应对特定测试,使成绩上升,但能力改善较窄。
两条路径在短期数据上可能难以区分。
澳大利亚过去对NAPLAN的官方审查曾记录关于过度依赖测试、学生压力、“teaching to the test”以及课程范围收窄的担忧。这些担忧不证明每所学校都会这样做,却揭示一个一般规律:当公开指标承载的后果越来越大,组织就会把更多注意力集中到可测量部分。Australian Government:《Review of the Australian Curriculum, Assessment and Reporting Authority》
于是,原本用于观察教育系统的数字开始反过来塑造教育系统。测试不再只问“学生学会了什么”,学校也开始问“哪些学习会出现在测试中”。
五、学校成绩不等于学校贡献
学校层面的NAPLAN差异还包含另一个容易被忽略的问题:学生成绩既受学校影响,也受家庭资源、语言背景、既往学习、健康、地区条件和学生流动等因素影响。
My School提供学校结果以及与统计上相近学生背景学校进行比较的工具,这比直接比较两所背景差异巨大的学校更有意义。但“相近背景”仍然不是随机实验,也不能把所有未观察差异消除。平均成绩较高,不表示全部差异都由学校造成;平均成绩较低,也不等于教师没有带来进步。ACARA:《My School》
此外,平均值可能隐藏分布。同样的学校平均成绩,可以来自大多数学生处于中间,也可以来自一部分学生表现很高、另一部分需要大量支持。如果资源决定只看一个平均数,真正需要帮助的群体可能再次被压缩到数字之外。
因此,NAPLAN可以成为学校改进的信号,却不能单独承担学校评级。ACARA所说的“NAPLAN不测量整体学校质量”不是一句礼貌免责声明,而是指标边界的核心部分。
六、如果结果不准确,谁可以复核?
NAPLAN可能出现不同性质的问题:学生在测试当天生病,设备或网络发生故障,辅助安排没有正确提供,测试管理出现事件,或者家庭认为结果与长期课堂表现明显不符。
对技术或管理事件,学校和各州、领地test administration authority有调查和处理程序;家长没有收到报告或对结果有疑问时,官方首先建议联系学校。对学习判断本身,最重要的复核不是要求把一个临界分数改到另一等级,而是把NAPLAN与课堂作业、校内评估、教师观察以及必要的专业测评放在一起。National Assessment Program:《NAPLAN results, reports and performance》
这两类复核不能混淆:
- 测试事件复核,检查数据和程序是否正确;
- 教育判断复核,检查一次成绩是否足以支持对学生和教学作出的决定。
如果NAPLAN只是额外证据,一次异常结果可以被其他信息校正。如果它被当成唯一真相,即使计算完全正确,决定也可能错误。
结论:好的测量应当改善教学,而不是替代教学目标
NAPLAN为全国教育系统提供了一种共同观察语言。没有这样的测量,长期差距可能被局部印象掩盖,需要支持的学生和学校也更难被系统识别。
但NAPLAN能够测量的,只是特定时点、特定领域中可以通过标准化任务表现出来的部分能力。它没有测量学校的全部教育价值,也没有穷尽学生的知识、创造力、好奇心和成长条件。
因此,真正的判断不是“要不要测试”,而是测试结果在决定中应占多大权重:
NAPLAN适合成为进一步观察和提供支持的起点,不适合成为对学生、教师或学校作出总判决的终点。
一项教育指标最成功的状态,不是所有课堂都越来越像测试,而是它帮助教师发现原先看不见的问题,随后重新让丰富的课程和专业判断接管教学。
当数字开始改变被测对象时,制度必须继续测量第二件事:我们提高的究竟是学生的能力,还是指标本身?
主要资料
- National Assessment Program:NAPLAN
- National Assessment Program:Tailored tests
- National Assessment Program:Proficiency level descriptions
- ACARA:NAPLAN 2025 Technical Report
- National Assessment Program:NAPLAN results, reports and performance
- Australian Government:Review of the Australian Curriculum, Assessment and Reporting Authority
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。