top of page

Whitesides 的课堂 AI 研究计划进入众议院,但证据仍落后于应用步伐

众议员 George Whitesides 推动众议院委员会通过一项修正案,要求专家识别 AI 对课堂儿童影响方面的证据缺口。尽管研究基础尚未稳固、学校采用速度却在加快,该修正案仍以口头表决方式获得通过。

这一提案的范围比围绕它传播的 Google News 标题所暗示的更为有限。Whitesides、众议员 April McClain Delaney 和众议员 Andrea Salinas 并未创建一项联邦课堂实验,也未对学校施加新规定。他们的倡议以研讨会为核心,审视现有研究并找出研究人员尚未充分回答的问题。

这种区别构成了真正的矛盾。学校已经在使用聊天机器人、自动化辅导工具、课程规划系统和学习分析工具。国会才刚开始组织评估这些部署所需的证据。

该措施也并非独立存在,而是被纳入更大规模的立法方案中。在众议院科学委员会审议期间,它成为《2025 年 NSF AI Education Act》H.R. 5351 的一部分。这一路径为提案带来动力,但并不保证其获得通过、资金支持或形成全国性研究计划。

众议院委员会实际批准了什么

经核实的国会行动是一项研究缺口修正案,而非全国性的课堂 AI 强制令。

众议院科学、太空与技术委员会在一场涵盖多项人工智能法案的更广泛审议中,审议了 H.R. 5351。该基础法案侧重于 National Science Foundation 对 AI 教育、研究、劳动力培养及机构协作的支持。

在此过程中,Whitesides 提出一项修正案,设立关于课堂 AI 整合的研讨会。根据委员会的审议记录,这些研讨会将识别有关 AI 对儿童影响的数据及已发表研究结果中的缺口。

委员会成员以口头表决方式通过了该修正案。随后,他们以 33 比 0 的记名表决结果,向众议院有利报告经修正后的 H.R. 5351。

这些行动很重要,但仍处于立法程序的中间阶段。一份有利的委员会报告会推动法案进入众议院全体可能审议的阶段,并不会使法案自动成为法律。

当读者通过 Google News 看到标题时,这一区别尤其重要。聚合式标题常常将修正案、法案、发起人和委员会行动压缩为一句简短描述。原始记录则提供了更准确的说明。

Whitesides 的措施并未宣称 AI 有益或有害。它的出发点是,决策者缺乏一套足够连贯的证据体系,以了解儿童在课堂中使用 AI 的经历。

研讨会模式反映了这种不确定性。它不会为联邦试验选择某一款产品,而是召集相关专家,共同梳理研究人员已知的信息和仍未解决的问题。

这一过程可能揭示学业成果、批判性思维、隐私、无障碍性、学生依赖、教师工作量或年龄适宜使用等方面的缺口。不过,委员会摘要并未说明上述每项议题都会获得同等关注。

H.R. 5351 的内容也不止 Whitesides 修正案。更广泛的法案记录将该措施确定为《2025 年 NSF AI Education Act》。其立法范围包括围绕人工智能的教育与劳动力发展。

Salinas 另行提出了一项修正案,允许设立最多八个社区学院或职业技术教育 AI 中心。委员会以 14 比 18 的记名表决否决了该提案。

这一结果凸显了审议中的一条分界线。成员们一致推进了经修正的法案,并以口头表决接受了证据梳理工作;但他们并未批准所有拟议的 AI 教育基础设施扩张方案。

McClain Delaney 的参与也表明,这一倡议属于一批关注 AI 监管、科学政策和教育问题的立法者所推动的更广泛工作。不过,核心成果仍然明确:委员会接受了 Whitesides 关于正式寻找缺失证据的提案。

因此,最准确的解读应当保持克制。国会尚未决定学校应如何使用 AI。一个众议院委员会已同意,在更强有力的决策能够得到合理支持之前,需要先获得更清晰的全貌。

为什么课堂应用如今正对国会施加压力

政策问题已不再是学生是否会接触 AI,而是公共证据能否跟上部署速度。

生成式 AI 是通过消费者工具进入教育领域的,而非通过协调一致的课程推广。许多学区尚未制定政策时,学生就已能在家中、个人设备上或通过学校账户使用通用聊天机器人。

教师也面临同样被压缩的时间线。有些教师使用 AI 制作教案、差异化教学材料、反馈草稿和处理行政工作;另一些则因准确性、隐私、作弊和技能发展弱化等担忧而限制学生使用。

这种不均衡的采用方式使国家层面的政策制定更加复杂。“课堂中的 AI”可能描述截然不同的干预方式,从教师起草一份练习单,到学生在数学教学中接受自动化辅导。

这项技术的变化速度也快于传统教育研究。围绕某个模型、界面或安全系统设计的研究,在产品更新后可能迅速失去部分相关性。研究人员因此必须将持久的教学原则与暂时性的产品行为区分开来。

学校并不总能等待理想证据出现。工具已经可用时,学区负责人就必须决定可接受使用政策、采购要求、数据保护措施和教师培训重点。

这给国会和联邦研究机构带来压力。全面禁止可能阻碍有益应用;不加批判地采用,则可能让儿童置身于尚未被充分理解的实验之中。

现有最有力的研究已经指向不同方向。Johns Hopkins 的一项课堂试点研究考察了 22 名初高中学生将一款设有防护措施的聊天机器人作为协作辅导工具使用的情况。

研究人员发现,两组学生在最终评估分数上没有显著差异。他们还观察到,学生经常将聊天机器人视为信息来源,而非参与其原本设计的辅导过程。

Johns Hopkins 的研究结果说明,仅有产品使用权限并不能证明教育价值。互动设计、教师预期和学生行为都会影响结果。

另一项研究考察了使用 AI 支持型辅导系统的 12 年级数学学生。研究对象包括来自四所伊朗公立高中的 97 名男生,完整班级被分配至实验组和对照组。

该研究报告了数学成绩、保持度、参与度和学生感受方面的提升。然而,其研究人群、地点、教学背景和准实验设计,限制了政策制定者将结果推广至所有美国学校时的信心。

这并非该研究独有的缺陷。教育研究往往高度依赖本地情境。班级规模、教师准备程度、课程、语言、设备获取条件和既有学业水平,都可能改变一项干预的效果。

联邦层面的证据审查有助于区分重复出现的发现与孤立结果。它还可以识别现有研究忽视的人群,包括低龄儿童、残障学生、农村学校和多语学习者。

因此,对于通过 Google News 关注这一事件的教育工作者而言,关键并非又一项国会 AI 公告,而是政府能否足够精确地界定问题,从而产出可比较的证据。

若缺少这项工作,学区仍将依据供应商演示、本地试点、教师轶事和衡量不同结果的研究来作出决策。这种碎片化方式使热情洋溢和危言耸听的主张都难以检验。

核心冲突在于应用与证据之间

AI 工具正作为产品进入课堂,而研究人员必须将其视为不断变化的教学系统来评估。

这是该提案的主要政策冲突。应用通过采购决策和个人行为发生;可靠证据则需要稳定的定义、对照组、恰当的结果衡量方式,以及足够长的时间来发现持久影响。

聊天机器人可能提升作业表现,却未能改善独立掌握程度。它可能减少教师备课时间,同时带来新的核查工作。它也可能提高参与度,却鼓励学生回避困难的推理过程。

在不同条件下,每一种结果都可能成立。这就是为什么“AI 是否帮助学生?”这样单一的问题,只能提供薄弱的政策指导。

一项涉及高中数学的随机对照试验提供了更清晰的例子。研究人员比较了使用标准 GPT-4 界面、配备教师设计防护措施的辅导工具以及传统资源的效果。

使用 AI 的学生在有支持的练习期间表现更好。然而,当研究人员在评估中移除 AI 使用权限时,使用标准界面的学生表现更差。设有防护措施的辅导工具降低了这种负面影响。

已发表的数学试验表明,界面设计可以决定 AI 是支持学习,还是替代学习。相同的底层模型可能产生不同的教育结果。

这一区别应当塑造通过 H.R. 5351 设立的任何研讨会。研究人员不应将所有生成式 AI 的使用视为同一种干预。

他们需要记录系统允许什么、接收什么信息、是否直接给出答案,以及教师如何监督其使用。他们还需要区分短期任务完成情况与独立知识保持情况。

年龄同样重要。使用受限辅导工具的高中生,与依赖对话式助手的小学生,面临的是不同的发展性问题。

持续时间也带来另一项挑战。许多试点仅持续数周或一个学期。这些时段可以发现即时变化,却可能错过累积性依赖、不断演变的学习习惯或 AI 素养提升的延迟效应。

结果指标的选择也可能左右叙事。供应商可能强调参与度,而学区更重视考试表现。家长可能关注隐私、独立推理能力和人际互动质量。

联邦研讨会无法仅靠统计数据解决这些价值取舍。它们可以让这些权衡更加透明,并建议哪些结果应得到一致衡量。

正是在这里,这项国会倡议可以在不为某家特定公司背书的情况下创造价值。一套共享的研究议程可以让未来的试点更容易在不同学区和产品之间进行比较。

它可以界定最低报告要求。研究人员或许会记录参与者人口统计特征、课堂条件、教师参与情况、模型版本、安全设置、持续时间,以及评估是在有无 AI 使用权限的情况下进行。

此类标准将使正面和负面研究结果更具参考价值。它们也能帮助学校识别何时一项研究与其学生群体或预期用途并不匹配。

不过,这项提议面临一项基本限制。研讨会可以形成议程、分类体系和建议,却不会自动产生纵向研究或独立的产品评估。

国会仍需支持后续研究。相关机构需要获得适当的授权、资金、人员配备以及与学校合作伙伴接触的渠道。

当研究需要稳定的模型访问权限或详细的产品信息时,科技公司也需要予以合作。否则,软件更新后,研究人员可能难以复现研究结果。

标题背后的真正转向已很清晰。AI 供应商常将教育描述为一个前景广阔的应用领域。委员会修正案则从一个较不令人舒适的前提出发:政策制定者对于其对儿童影响的一些基础性问题,仍缺乏答案。

现有研究仍无法定论的问题

令人鼓舞的发现与已记录的危害可以同时存在,因为课堂情境会改变干预措施的效果。

关于 AI 赋能教学的研究,正越来越多地报告其在特定条件下的积极效果。2026 年发表于 Scientific Reports 的一项研究考察了一个供 12 年级数学学生使用的 AI 辅导系统。

研究人员报告称,实验组的学习成果有所改善,包括更长期的知识保持。该项辅导研究提供了一个有价值的数据点,但并不能证明每个聊天机器人或辅导产品都会取得同样的结果。

系统本身、学科、学生群体和教师实践都至关重要。围绕课程设计的数学平台,与针对不受限制问题作答的通用聊天机器人并不相同。

其他研究也显示出类似的差异。AI 学习分析可以帮助教师识别学习困难的学生或课堂作业中的模式。然而,仪表板也可能促使教育工作者信任那些忽略了动机、社会情境或被误读行为的测量结果。

当研究人员超越考试成绩时,证据缺口尤为明显。批判性思维、创造力、自信心、协作能力和智力独立性都难以得到一致衡量。

隐私是另一个尚未解决的领域。一个系统可以改善某项学业指标,同时收集敏感的学生数据。教育有效性并不能免除数据保护义务。

偏见需要单独评估。模型在不同语言、方言、残障情境或文化参照下,可能产生不同质量的结果。课堂平均值可能掩盖不同学生群体之间不均等的表现。

无障碍性同时带来机遇与风险。AI 可以改写指令、生成示例,或支持替代性沟通方式。不正确或不合适的便利措施同样可能造成新的障碍。

教师仍是一个重要变量。有经验的教育者或许能识别虚构答案,并引导学生调整使用方式。培训不足的教师可能无法发现细微错误,或不得不花费额外时间审查生成的材料。

学校资源同样影响结果。拥有可靠设备、技术支持和专业发展资源的学区,其实施体验不会与资源不足的学校相同。

研究基础在对照组设置方面也存在困难。“传统教学”在不同课堂之间差异很大。归因于 AI 的差异,部分可能反映的是教师实践、课程质量或学生获取校外帮助的机会。

模型的快速更新进一步削弱了简单比较的效力。一项研究可能提及某个商业产品,却未记录确切的模型版本或系统设置。未来研究人员于是可以复现品牌名称,却无法复现原始干预措施。

这些问题证明开展证据梳理是合理的,但也界定了其局限。研讨会可以识别缺失的数据,却无法确定学校应容忍多大程度的不确定性。

政策制定者最终必须作出判断。他们必须决定哪些用途需要更强的证据,哪些风险足以支持限制措施,以及哪些低风险应用值得在监督下进行试验。

Whitesides 的提议似乎旨在改善这些选择背后的信息基础。不应将其表述为联邦立法者已经就课堂 AI 辩论达成定论的证据。

这种审慎态度同样适用于有利结果。小规模试点可以揭示作用机制和实际问题,但很少能单凭自身支持全国性结论。

负面发现也需要同样谨慎看待。一个不受限制的聊天机器人造成有害结果,并不能证明每个受到防护的辅导系统都会损害学习。它表明,系统设计必须成为研究问题的一部分。

因此,从 Google News 进入的读者应避免二元化解读。委员会并非在“AI 有效”和“AI 失败”之间作出选择,而是在承认这些说法对于负责任的政策而言过于宽泛。

州级试验正快于联邦政策推进

各州和学区已经在开展联邦研究议程需要理解的现实试验。

北卡罗来纳州提供了一个有益的对照案例。该州 2026 年教育立法纳入了 AI 培训、产品使用权限、报告要求和正式评估。

该州为 Khanmigo 许可证和一门教育者课程拨付了资金。它还指示 Office of Learning Research 研究该产品的有效性,包括其对学生表现和成长的影响。

该法律要求研究结果在 2028 年 4 月 1 日前提交至一个立法监督委员会,同时还要求就参与情况和使用情况进行年度报告。

另有条款涉及另一款 AI 教育平台 MagicSchool。该州要求对两个项目进行评估,采取了比联邦研讨会提议更具产品针对性的方法。

北卡罗来纳州法律还列出了教育者准备工作的相关主题,包括幻觉、来源评估、学术诚信、隐私、偏见、无障碍性以及与家庭的透明沟通。

这一模式为国会提供了若干启示。首先,实施与评估可以一同设计,而非被视为彼此分离的阶段。

其次,产品层面的数据可以提供具体答案。研究人员可以衡量谁使用了某个系统、使用频率如何,以及参与群体之间的结果是否存在差异。

第三,州级试点无法替代更广泛的联邦研究。一个州的采购选择、课程设置、人口结构和报告体系,未必能代表全国。

联邦研讨会可以将这类地方试验连接起来。它们可以识别共同指标,并鼓励各州公布足够的方法细节,以便进行有意义的比较。

联邦政府还可以支持单个学区无力承担的独立研究。纵向研究、多州试验和跨人口群体的评估,都需要协调与持续资源。

一项全国性研究议程可以减少重复投入。学区经常就学生隐私、教师工作负担、评估诚信和独立学习提出相似的问题。

共享证据不会消除地方控制权。它会为地方决策者根据自身社区调整政策提供更坚实的基础。

这一方法必须保持独立性。产品开发者拥有重要的技术知识,但他们也对正面研究结果具有商业利益。

因此,研究设计应披露资金来源、数据访问方式、产品变更和供应商参与情况。结果应包括不利结果,而非仅呈现经过挑选的成功指标。

家长、教师和学生应参与界定研究结果。一项只围绕行政效率设计的研究,可能忽视课堂直接感受到的影响。

学生的声音尤为重要,因为实际行为常常偏离工具的预期设计。Johns Hopkins 的试点发现,学生在研究人员原本预期会出现辅导式对话时,却在请求获取信息。

预期用途与实际用途之间的差距并非无关紧要。它可能决定一个 AI 系统是鼓励推理、提供捷径,还是干脆无人使用。

研究人员还应考察当访问权限结束后会发生什么。如果学生只有在工具提供支持时才有所提升,学校就需要判断这一结果是否符合其教育目标。

这一担忧将 AI 评估与一项熟悉的教学原则联系起来。帮助应当培养能力,而不应只是让学生在帮助仍可获得时提高表现。

使用AI knowledge base的人也面临类似区分。快速检索可以支持思考,但检索质量本身并不能证明理解已经形成。

对于课堂 AI,这一区别具有更高的利害关系。儿童仍在发展那些可能被自动化系统支持、绕过或重塑的能力。

三个信号将显示这项提议是否重要

该修正案的重要性将取决于立法进展、研究设计,以及学校真正能够使用的证据。

第一个信号是 H.R. 5351 在委员会之外的推进情况。委员会已对修订后的法案作出有利报告,但仍需要进一步的众议院行动。

读者应关注国会领导层是否安排该法案、众议院是否修改其措辞,以及参议院是否审议兼容的措施。法案获得通过将强化这样一种判断:证据梳理已成为联邦优先事项。

未能推进并不会消除委员会的担忧。它只会表明,一个委员会内部的共识尚未转化为完整的联邦项目。

第二个信号是任何后续研讨会的设计。参与者的选择将揭示这一过程能否涵盖完整的课堂问题。

一个可信的群体应包括教育研究人员、发展专家、教师、学校领导、学生、家长、无障碍专家、隐私专家和技术研究人员。供应商的参与可以补充有用背景,但不应主导议程。

研讨会应提出具体研究问题,而非泛泛呼吁开展更多研究。有用的产出应明确优先年龄群体、结果指标、研究时长、报告标准和学生数据保护措施。

它们还应区分 AI 使用的常见形式。教师生产力工具、受防护的辅导系统、开放式聊天机器人、自动评分系统和预测分析,具有不同的机制与风险。

第三个信号是,相关机构和立法者是否将已识别的缺口与获得资助的独立研究联系起来。没有后续行动的研究议程会很快过时。

有意义的后续行动可能包括多地点试验、纵向研究、通用报告框架,或聚焦代表性不足学生群体的资助项目。向公众开放方法和结果,将使这些投资更具价值。

州级评估将提供更早的检验。北卡罗来纳州的报告要求及其 2028 年 4 月的研究截止日期,将显示立法机构能否从产品部署中获得有用证据。

研究人员应超越采用数量。高使用率可能反映兴趣、便利性或机构要求,并不能独立证明学习效果。

他们应考察学生在没有 AI 时是否能保留知识、教师在核验后是否节省时间,以及不同学生群体之间的结果是否存在差异。隐私事件和支持需求也应纳入评估。

如果未来证据改变政策,这项提案将更具可信度。研究应能够缩小、扩大或重新设计课堂使用方式,而不只是为已作出的决定背书。

这一标准同样适用于科技公司。供应商应预期学校会要求与特定年龄段、学科、产品配置和学习目标相关的证据。

开发者可以通过记录模型变更、安全功能、数据实践以及预期的教学行为来做好准备。稳定的研究访问条件将有助于独立团队长期检验相关主张。

教育工作者也可以从同样务实的问题开始:学生应练习什么技能?系统提供了哪些辅助?之后学生能否独立完成?哪些信息会离开学校?

家长可以询问某个工具是否为可选项、会存储哪些数据,以及教师如何审查其输出。无论该法案最终命运如何,这些问题都依然重要。

对于通过 Google News 关注此事的知识工作者而言,更大的启示不止于教育领域。AI 的采用速度往往快于负责评估其影响的机构。

学校使这一差距格外明显,因为使用者是儿童,目标是发展,而不只是提高生产力。更快得到答案,并不一定意味着更好的教育成果。

Whitesides 修正案并未弥合证据缺口。它提供了一种更清晰界定这一缺口的可能机制。

这是谨慎的一步,但如果国会继续推进,它可能影响后续研究。下一个问题不是立法者能否召集专家,而是他们的工作能否形成学校信任、供应商难以轻易操纵、并真正让学生受益的测试。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page