# 卡迪夫大学新研究：AI 尚无法像人类教师一样可靠地批改作业

- 来源：IT之家（RSS）
- 发布时间：2026-08-24 22:16
- AIHOT 分数：43
- AIHOT 链接：https://aihot.virxact.com/items/cmt7bv9ek21bkro73vys6qzbt
- 原文链接：https://www.ithome.com/0/993/741.htm

## AI 摘要

卡迪夫大学和墨尔本大学研究发现，生成式AI目前无法像人类教师一样可靠评判学生书面作业。研究人员用ChatGPT两个版本按7项标准评分50篇生物科学论文，并采用4种提示方式，结果显示模型分数波动大，无法准确预测人工评分。除一种情况外，AI平均分普遍高于人工，最大差距达16.1分，单篇最大差距达40分，且分数系统性向中间集中。

## 正文

IT之家 8 月 24 日消息，据外媒 Phys.org 今天（24 日）报道，卡迪夫大学和墨尔本大学的一项新研究发现，生成式人工智能（GenAI）目前还无法像人类教师一样可靠地评判学生的书面作业。

研究人员使用 ChatGPT 的两个版本，对 50 篇生物科学专业本科生论文进行评分，以测试大模型评估学生作业的能力。ChatGPT 需要按照 7 项标准批改这些论文，研究人员还采用了 4 种不同的提示方式，随后将大模型与人工评分的平均分和分数波动情况进行比较。

卡迪夫大学生物科学学院威廉 · 凯博士指出：“研究结果显示，模型给出的分数波动很大，无法准确预测人工评分。生成式 AI 与人类批改同一批论文时存在明显差异。只看论文总分，两者给出的结果相对接近；一旦具体到每项评分标准和每一篇论文，大模型与人工评分之间的差距就相当明显。”

除一种情况外，AI 模型给出的平均分普遍高于人工评分。平均分方面，AI 模型与人工评分的最大差距达到 16.1 分；具体到单篇论文，最大差距达到 40 分。

IT之家获悉，威廉 · 凯还发现，AI 往往会压低高分论文的成绩，又把低分作业的成绩抬高，最终使分数系统性地向中间集中。

研究结果说明，至少现阶段，即使经过大量训练，AI 仍无法可靠地对主观性较强的书面作业给出与人类相当的分数。“我们测试的大模型目前并不适合取代教师，为学生预测作业成绩。”

研究人员指出，高等教育领域确实很关注大模型能否利用模式识别能力，让学生作业评分更加客观，同时提高批改效率、减轻教职人员压力。但这项研究表明，目前并不适合这么做。

此外，未经学生明确同意便把作业提交给 AI 工具，本身还涉及伦理问题；大模型也不能、也不应该被依赖来给学生的长篇书面作业评分。“随着大模型继续发展，未来模仿人类判断的能力可能会提高。但从这项研究来看，要让 AI 给出的分数与人工评分真正保持一致，恐怕并不容易。”
