AI批改作业可靠性研究显示尚难替代教师
「卡迪夫大学与墨尔本大学研究发现,生成式AI尚无法像人类教师一样可靠评判学生书面作业。研究使用ChatGPT两个版本对50篇论文按7项标准评分,结果显示AI评分波动大,且倾向于压低高分、抬高低分,目前不适合取代教师进行作业评分。」
生成式人工智能在教育领域的应用一直备受关注,但一项最新研究为这一热潮泼了冷水。卡迪夫大学和墨尔本大学的研究人员合作开展了一项针对性测试,评估大语言模型在批改学生书面作业方面的可靠性。结果显示,当前阶段的AI模型仍无法像人类教师一样给出稳定、准确的分数。
研究团队使用ChatGPT的两个版本,对生物科学专业的50篇本科生论文进行评分。这些论文需要按照7项具体标准进行评判,研究人员还设计了4种不同的提示方式,以观察提示策略对结果的影响。随后,他们将AI给出的分数与人工评分的平均分和分数波动情况进行对比分析。
卡迪夫大学生物科学学院的威廉·凯博士指出,模型给出的分数波动很大,无法准确预测人工评分。生成式AI与人类批改同一批论文时存在明显差异。如果只看论文总分,两者给出的结果相对接近;但一旦具体到每项评分标准和每一篇论文,大模型与人工评分之间的差距就相当明显。
数据进一步揭示了这种差距的具体程度。除一种情况外,AI模型给出的平均分普遍高于人工评分。在平均分方面,AI与人工评分的最大差距达到16.1分;而在单篇论文的评分上,最大差距甚至达到40分。这样的偏差显然难以满足教育场景中对评分公正性的基本要求。
更值得注意的发现是,AI在评分时呈现出一种系统性倾向:它会压低高分论文的成绩,同时又抬高低分作业的成绩,最终使分数向中间集中。这种“趋中效应”意味着AI不仅无法准确识别优秀作业,还可能掩盖学生之间的真实水平差异,给教学评估带来误导。
威廉·凯博士强调,研究结果表明,至少现阶段,即使经过大量训练,AI仍无法可靠地对主观性较强的书面作业给出与人类相当的分数。“我们测试的大模型目前并不适合取代教师,为学生预测作业成绩。”
研究人员也承认,高等教育领域确实对大模型寄予厚望,希望借助其模式识别能力让作业评分更加客观,同时提高批改效率、减轻教职人员压力。但这项研究清楚地表明,目前并不适合这样做。此外,未经学生明确同意便将作业提交给AI工具,本身还涉及伦理问题。随着大模型继续发展,未来模仿人类判断的能力也许会提升,但要从这项研究的结论出发,让AI给出的分数与人工评分真正保持一致,恐怕并不容易。
来源:Heooo AI工具导航