top of page

OECD AI 测试分数揭示中学生学习出现逆转

OECD AI 测试分数揭示了一个令人担忧的矛盾:在学校作业中避免使用聊天机器人的学生,往往比使用它们的同学表现更好。这项发现来自 OECD 针对 15 岁学生开展的国际评估 PISA 2025。

这一结果挑战了教育领域对 AI 的一种流行假设。聊天机器人可以产出润色完善的作业、概括阅读材料,并在数秒内回答问题。然而,获得更好的辅助性成果,并不必然意味着学生建立了能够独立运用的知识。

这种区别将通用聊天机器人置于一条新兴分界线的一侧。另一侧则是促使学生推理、练习并解释答案的结构化系统。证据并不支持在教育中禁用 AI,而是支持追问:这项技术究竟是在帮助学生思考,还是仅仅替他们完成思考。

PISA 发现 AI 测试分数差距

OECD 的核心发现是:聊天机器人的使用与较弱的独立表现之间存在关联,而非证明 AI 导致了更低分数。

PISA 2025 结果提供了迄今为止对学生使用 AI 情况最广泛的观察之一。PISA,即国际学生评估项目,衡量 15 岁学生如何将知识应用于陌生问题。

到 2025 年,大多数参与教育体系中的多数学生都曾使用 AI 聊天机器人完成学校作业。在 OECD 国家中,仅有 14% 的学生表示,自己几乎从不将其用于调查所涵盖的用途。

这些用途包括概括指定文本、开展初步研究、起草书面作业,以及获取一般学习帮助。其中,一般学习辅助是报告中最常见的用途。

几乎每天使用的情况仍不算普遍。在 OECD 国家中,大约五分之一的学生表示经常使用。这一点很重要,因为使用频率和用途都与不同的表现模式相关。

对于特定学校任务,报告不使用聊天机器人的学生,其科学成绩通常高于使用者。这一模式出现在大多数参与国和经济体中。

这种关系并不是简单的线性关系。在研究人员根据社会经济背景进行调整后,每周使用 AI 获取一般学习帮助的学生,表现与非用户相近。

几乎每天使用 AI 或仅偶尔使用 AI 的学生,得分往往低于非用户。在概括文本或研究新主题时,中度用户有时优于使用有限者和高频用户。

起草写作则有所不同。当 AI 用于协助撰写作业时,中度用户的表现优势不那么明显。这一结果符合相关担忧:文本生成比研究辅助更可能替代认知工作。

这一比较采用了根据学生社会经济特征调整后的预测科学成绩。不过,它仍基于观察性、自我报告的使用数据。学生并未被随机分配到聊天机器人组和非聊天机器人组。

表现较弱的学生可能更频繁地寻求 AI 帮助。工作负担更重、支持网络较弱或信心较低的学生,也可能以不同方式采用聊天机器人。

OECD 明确警告,其发现并不能证明存在负面的因果效应。相反,这些发现描述了一种由谁采用 AI、为何使用以及使用频率所共同塑造的关系。

这一警告应当防止一个简单标题演变成错误结论。PISA 并未证明每一名学生在打开 ChatGPT 后都会失去知识。它确实揭示了一种学校无法安全忽视的一致性差距。

这一差距同样重要,因为 PISA 测试的是在没有辅助情况下的应用能力。聊天机器人可以改善在家提交的作业,却可能让学生在工具消失时准备不足。

已完成作业与保留能力之间的差异,构成了真正的矛盾。教育体系多年来一直在评估可见的产出。生成式 AI 如今可以改善这些产出,却未必能可靠地改善学习者本身。

OECD AI 测试分数揭示作业逆转

AI 可以让一份作业看起来更好,却可能削弱这份作业与学生实际掌握知识之间的联系。

OECD 更早发布的教育展望报告在新的 PISA 结果出炉前便指出了这一问题。通用 AI 可以提升任务表现,却未必带来持久的学习增益。

学生可能要求聊天机器人概括一个章节、组织论点或起草一篇文章。即使学生减少了阅读、规划和修改,最终提交的内容仍可能变得更清晰。

这些被跳过的步骤并非行政摩擦。它们往往正是学习活动本身。

写作要求学生提取信息、权衡证据、组织观点,并发现理解中的缺口。概括则要求判断哪些事实重要,以及它们如何相互关联。

当聊天机器人执行这些操作时,学生获得了答案,却不一定建立起答案背后的心理结构。即时结果看似高效,但独立测试会暴露学生真正保留了什么。

研究人员有时将这种模式称为认知卸载。学习者将部分心理任务转交给外部系统,从而降低完成任务所需的努力。

卸载并不必然有害。计算器、拼写检查器、搜索引擎和参考书都会将部分工作移出大脑。学生可以在使用这些工具的同时发展更深层的技能。

差别在于,学习者仍需完成什么。使用计算器仍要求有人选择运算方式并解读结果。聊天机器人则可以选择论点、撰写解释,并给出结论。

这种更广泛的替代会产生研究人员所谓的元认知惰性。元认知是指学习过程中,对自身理解、策略和错误进行监控。

当学生意识到困惑、重新审视薄弱答案,或寻求有针对性的帮助时,他们就在运用这种能力。流畅的聊天机器人回答可能会压制这些信号,让不完整的理解看起来已经得到解决。

PISA 结果还提供了另一条线索。避免使用 AI 聊天机器人的学生,也更可能报告出更强的求助行为。

向人求助通常涉及协商。教师、家长或同学可以询问学生已经尝试了什么,以及推理在哪一步失败。除非被提示以不同方式回应,通用聊天机器人往往会立即给出答案。

这种便利改变了避免努力的成本。在生成式 AI 出现之前,外包一篇完整文章需要金钱、协调,或明显的不当行为。如今,一篇看似合理的初稿可在短暂的浏览器会话中出现。

当工具被移除时,这种逆转最为明显。学生可能提交更强的辅助性作业,随后却在需要相同知识的封闭式评估中遇到困难。

一项关于中国中学教育的 2026 年研究,提供了这一模式更鲜明的版本。这项学习惩罚研究分析了 26,811 名 7 至 12 年级学生长达 30 个月的记录。

研究人员追踪了九门学科中的作业、完成时间、每月闭卷考试和高风险升学考试。AI 的采用与更高的作业效率相关,但与较差的无辅助表现相关。

这项研究同样需要谨慎解读。AI 的采用并非随机分配,研究人员还根据行政数据推断了部分外包行为。它无法证明每名学生或每间课堂都必然受到普遍性的负面影响。

不过,它的设计弥补了普通作业分析的一项不足:它将辅助性作业与学生必须在没有工具的情况下完成的评估进行比较。

OECD AI 测试分数在更广泛的国际样本中指向了同一方向。这些发现共同挑战了主要依据课后作业产出评分的做法。

如果学校继续将润色完善的作业视为学习的直接证据,AI 会让这一信号变得不那么可靠。作业可能越来越多地衡量获取资源、提示技巧和编辑能力,而不是独立掌握程度。

数据并不支持简单禁止 AI

最有力的证据区分了无指导的答案生成,与围绕教学和主动参与设计的 AI 使用。

OECD 的警告很容易被简化为 AI 总会损害学习的说法。但其自身发现否定了这种解读。

每周使用 AI 获取一般学习帮助,与不使用 AI 的科学表现相近。针对某些任务的中度使用,也比罕见使用或高强度使用产生更好的结果。

这种模式表明,频率很重要,但仅凭频率并不足够。工具的用途及其周围的教学设计都可能改变结果。

要求获得完整答案的学生,与要求获得提示的学生,所经历的并不相同。这两种情况也都不同于由教师质疑错误推理的监督式课程。

这种区别出现在对照研究中。世界银行的一项研究在尼日利亚埃多州的中学生中,测试了一项为期六周、由教师支持的 AI 辅导项目。

该项目使用 Microsoft Copilot 在课后支持英语学习。教师监督结构化活动、提供提示,并帮助学生评估系统的回答。

参与干预的学生在涵盖英语、AI 知识和数字技能的评估中提高了 0.31 个标准差。因此,这项尼日利亚辅导试验提供了有指导的使用能够改善学习的证据。

这一结果并不与 OECD 的警告矛盾。它阐明了警告背后的机制。

尼日利亚项目并未向学生提供一个不受限制的答案引擎,然后假定学习会随之发生。它将模型置于课程、时间安排和教师主导的流程之中。

聊天机器人作为教学系统内的辅导工具发挥作用。它并未替代该系统。

更近期的实验性证据也让纯粹负面的叙事变得更复杂。研究人员 Zara Contractor 和 Germán Reyes 随机分配本科生,在有或没有生成式 AI 的条件下学习一个陌生主题。

参与者在学习后立即完成无辅助评估,并在一周后再次完成评估。AI 访问使即时知识得分提高了 0.27 个标准差,这些收益在一周后仍然存在。

这项随机实验发现,增强型用户的延迟收益更强。这些学生要求 AI 解释概念,而不是为他们生成文本。

自动化用户则呈现相反模式。他们在产出质量上的短期改善,在 AI 访问被移除后消失了。

这种对比为解读 OECD AI 测试分数提供了一个实用框架。关键问题并不是聊天机器人是否出现在学习过程中。

问题在于,哪些认知步骤仍由学生完成。解释、提取、比较和自我纠正能够支持学习。自动化产出则可能绕过这些步骤。

年龄和背景也限制了直接比较。随机实验涉及本科生,而 PISA 考察的是 15 岁学生。世界银行的干预则在尼日利亚的特定环境中开展。

结构化的课后项目无法预测数百万名学生私下使用不同聊天机器人的情况。小规模实验也无法解决涵盖所有学科的长期影响问题。

即便如此,积极研究仍暴露出一刀切禁令的弱点。移除 AI 同样会移除能够扩大反馈与练习机会的辅导选择。

因此,政策选择并非无限制使用与彻底排除之间的二选一。学校需要制定规则,区分有助于学习的辅助与替代学生自身努力的行为。

聊天机器人或许可以被允许提出苏格拉底式问题、生成练习题,或解释答案为何错误;但应被限制为不能代写评分作业的最终文本。

学生也可以记录互动历史,并说明采纳了哪些建议。这一过程让推理过程变得可见,而不是将最终文档视为唯一证据。

面向学生的工具应支持检索、反思和来源比对。个人的学生工作空间可以帮助整理材料,但学习者仍需自行评估并建立联系。

OECD 报告将教学设计视为分界线。通用型工具的可用性本身并不是学习策略。学校必须决定哪些使用方式保留了学习投入,哪些又将其抹去。

学校如今面临评估难题

聊天机器人对仍将非监督产出等同于个人理解的学校造成了最大压力。

生成式 AI 并未制造作业和课程作业中的所有漏洞。它只是让既有漏洞更容易被利用,也更难被忽视。

教师早已知道,带回家完成的作业反映出学生获得帮助程度的不均衡。有些学生获得大量家庭帮助、私人辅导或编辑反馈,另一些学生则独自完成。

AI 增添了一个随时可用的协作者,能够生成答案的实质内容。最终文本可能依然难以与学生正当完成的作业区分开来。

检测软件无法可靠地解决这一问题。误报可能惩罚原创写作,而经过修改的 AI 文本又可能逃过检测。学校需要能揭示学生过程的评估设计。

压力并不止于蓄意作弊。即使学生在宽松政策下使用聊天机器人,也可能规避日后表现所需的练习。

这使得意图成为不完整的衡量标准。一个本意良好的学习者可能反复索取润色完善的解释,感觉自己很有收获,却直到考试时才发现知识缺口。

英国资格认证监管机构已直接处理学术诚信问题。其 2026 年课程作业指南指出,将 AI 生成的作品作为自己的作品提交属于作弊。

然而,惩罚只解决了学习问题的一部分。学生可以遵守披露规则,却依然过度依赖生成式答案。

学校需要通过多种形式观察能力。简短的口头答辩、监督写作、迭代草稿、实践演示和现场解题,都能提供更有力的证据。

这些形式并非不受辅导影响,但它们确实让最终由 AI 生成的成果更难替代学生本人的理解。

评估重构同样伴随成本。口试需要教职人员投入时间,监督作业会降低灵活性,项目式评估可能带来主观评分和协调负担。

这些成本的分布并不均衡。资金充足的学校能够培训教师并设立更小规模的评估小组;师资短缺的教育体系可能更依赖可规模化的书面作业。

AI 供应商同样面临压力。通用型产品通常以提供有用、完整的回应为优化目标。这一目标可能与教学相冲突,因为教学有时需要暂不直接给出答案。

有效的教育模式或许会先要求学习者尝试解题。它可以逐步提供更明确的提示、识别误解,并要求学习者说明理由后再继续。

系统还需要具备适龄的隐私保护与透明的数据实践。学生对话可能包含学业记录、个人困扰和敏感的行为信号。

教师需要掌握课程对齐的控制权。一个提供正确但不符合教学大纲方法的聊天机器人,可能让学生困惑,或破坏经过精心安排的课程进度。

幻觉仍是另一项问题。自信却错误的解释可能灌输错误观念,尤其当学习者缺乏足够知识去质疑它时。

OECD 报告称,约六成学生曾在课堂上被要求评估 AI 生成的信息。其中,46% 有时会这样做,33% 经常这样做,22% 则非常频繁地这样做。

这些数字表明,评估技能已进入许多课堂。但同时,仍有相当比例的学生未能经常练习核查 AI 输出。

教育工作者对学术诚信的担忧已相当普遍。在 OECD《数字教育展望》中,72% 的初中教师认为 AI 可能让学生将生成内容作为自己的作品提交。

与此同时,37% 的初中教师表示自己在 2024 年曾使用 AI 完成工作。另有 57% 认同 AI 有助于编写或改进课程计划。

这种组合概括了制度层面的张力。学校看到 AI 对教师的实用价值,同时担忧学生可以借此绕过学习过程。

政策必须兼顾两方面。教师可以使用 AI 制作差异化练习、起草反馈,或模拟辅导对话;学生仍需要获得能够进行有效挣扎的受保护机会。

有效挣扎并不意味着撤去所有帮助,而是提供足以继续前进的支持,同时不移除构建掌握能力所需的推理过程。

因此,OECD 的 AI 教育报告将责任转向机构和产品设计者。告诉学生“负责任地使用 AI”过于模糊,无法有效指导行为。

规则应明确允许的行为、必须进行的披露,以及必须在无辅助情况下具备的能力。规则还应解释,为何保留某些阻力在教育上仍属必要。

相关性是核心不确定因素

PISA 对比的重要性在于其规模,但其设计无法判定聊天机器人的使用是否导致科学成绩较弱。

学生接触 AI 时拥有不同的能力、动机和资源。这些差异既可能影响采用情况,也可能影响考试成绩。

学习困难的学生可能因为既有教学未能奏效而更频繁使用聊天机器人。这样一来,较低表现早于 AI 使用出现,而非由 AI 使用导致。

成绩优异的学生可能因已具备良好学习习惯而较少使用聊天机器人。他们较高的分数可能反映的是这些习惯,而非没有使用 AI。

自我报告的使用频率也带来另一项限制。学生可能对“帮助我学习”有不同理解,会忘记偶尔使用的情况,或少报看似被禁止的行为。

这些类别还合并了许多互动方式。一名每周使用一次的学生可能只是索取练习题,另一名学生却可能在相同的报告频率下完成整份作业。

PISA 已在科学成绩对比中调整社会经济背景因素。这改善了分析,但无法控制使用者与非使用者之间的每一项差异。

OECD 直接承认了这一点。其报告称,这些关系可能反映了谁采用 AI 以及如何使用 AI 所构成的复杂组合。

因此,新闻标题措辞应保持谨慎。“使用 AI 的学生得分较低”描述的是观察到的关联;“AI 导致学生得分较低”则作出了 PISA 数据无法支持的因果主张。

中国的面板研究提供了更强的时间与结果比较,但它仍然属于观察性研究。研究人员并未在数千名儿童中随机分配长期使用聊天机器人的机会。

对照试验能够解决部分选择偏差问题,但通常覆盖的样本更小、周期更短,或干预方式高度结构化。

尼日利亚试验表明,在特定条件下,受指导的 AI 辅导能够发挥帮助作用。但这并不能证明非监督的聊天机器人使用会产生同样结果。

本科生实验发现,当 AI 增强解释时,学习效果有所提升。但其参与者、学科内容和受控环境均不同于日常中学场景中的使用情况。

这些限制并不会消除警示,它们界定了学校下一步应调查的内容。

如果不同数据来源反复显示,作业表现更强但无辅助表现更弱,教育工作者就有充分理由重新设计评估。他们不必等待一个普遍适用的因果估计。

与此同时,过早的确定性可能导致糟糕政策。全面禁令可能迫使使用行为转入地下,阻碍有益的辅导,并让学校失去教授 AI 素养的机会。

更站得住脚的回应是受控采用。学校可以比较不同班级、学科和工具设计,同时衡量辅助产出与之后无辅助表现。

学校还应监测不同学生群体之间的差异。AI 可能帮助缺乏辅导资源的学习者,却伤害那些主要借它逃避努力的学生。

无障碍需求需要特别谨慎对待。一些学生会使用 AI 获得语言支持、阅读辅助或整理思路。限制措施不应在没有等效替代方案的情况下取消这些便利。

学科差异同样重要。生成一篇历史论文,所替代的心理活动不同于获得数学证明的反馈。

长期衡量至关重要。一种工具可能在一周后提升测验成绩,却在一个学期后削弱记忆保持;另一种工具起初可能拖慢工作速度,却能培养持久的推理能力。

因此,核心不确定性并非 AI 是否改变学习。它已经改变了围绕学习的顺序、投入和证据。

不确定的是,哪些设计能在什么条件下、为哪些学生带来持久知识。OECD 的发现提供的是基线,而不是最终答案。

三项信号将揭示下一步走向

下一阶段应依据独立表现、教学产品设计和评估改革来判断,而非仅看聊天机器人的采用情况。

第一个信号是研究人员如何分析 PISA 2025 数据库。国家层面的研究可以检验这种关联是否跨学科、学校政策和学生背景持续存在。

在加强控制后仍存在一致差距,将强化 OECD 的警示。若不同使用目的或学校实践之间差异很大,则会增强制定针对性规则而非广泛限制的理由。

研究人员应区分起草、总结、研究、反馈和辅导。将它们统称为一般性 AI 使用,会掩盖学校最需要理解的机制。

第二个信号是主要聊天机器人提供商是否改变教育模式。一项有意义的产品转变,应让学生保持主动,而不是将每次互动都优化为即时完成。

有用的指标包括延迟提示、尝试要求、教师控制、课程对齐,以及针对已识别误解量身定制的解释。独立试验应检验这些功能是否能改善无辅助情况下的记忆保持。

营销说法无法解决这一问题。供应商需要进行这样的比较:在教学后移除工具,衡量学生是否能将知识迁移到新问题中。

第三个信号是下一个学年周期中的评估重构。学校和考试机构将通过评分规则、监督任务和披露要求展现其优先事项。

更多的口头答辩、分阶段提交的草稿,以及课堂内演示,将表明教育机构已不再仅凭最终的课后作业成果来判断。继续依赖无人监督生成的文本,只会延续当前的不匹配。

在隐私规则允许的情况下,学校应公开这些改革的证据。教育工作者需要了解,重新设计的评估是否在不造成不合理工作负担的前提下提升了有效性。

家长和学生同样需要更明确的预期。一项仅仅允许或禁止“AI”的规定,无法区分辅导与自动代做。

最有用的标准应当直截了当地问:脱离聊天机器人后,学生是否仍能解释、复现并应用这项工作?

OECD AI 测试分数已将这个问题变成一项国际政策议题。它们既不足以引发恐慌,也不支持自满。

学生应审视自己目前使用聊天机器人的方式。可以请求解释、反方观点、练习题,以及对原创尝试的反馈。避免让系统取代思考的第一稿。

教师应在工具消失后检验学习成果。产品团队应衡量保留下来的能力,而不只是更快的完成速度或更高的满意度。

下一轮证据将显示,学校能否在不外包学习者努力的前提下保留 AI 的辅导价值。这一结果取决于当下正在作出的设计选择。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page