top of page

OECDのAI教育報告書、AIを使う生徒は通常スコアが低いと指摘

9月11日
読了時間: 18分

OECDのAI教育報告書は難しい対立を浮き彫りにした。学校の課題でチャットボットを使う生徒の大半は、利用を避ける生徒よりも低いスコアだった。この傾向は、91の国と経済圏に住む15歳の生徒76万人を対象とした2025年の評価で見られた。

この見出しは、すべての生徒がChatGPTやGeminiを閉じるべきだという意味ではない。適度な利用者は、たまに使う利用者や集中的に使う利用者より良い成績を示す場合もあった。また、学校がAI生成情報の評価方法を教えた場合、頻繁な利用者にもわずかな優位性が見られた。

したがって、本当の分かれ目はAI利用者と非利用者の対立ではない。認知の外部委託か、指導を伴う練習かである。チャットボットは洗練された回答を生成できるが、利用者がその問い、根拠、あるいは背後にある推論を理解していることまでは保証しない。

この違いは、学校、家庭、AI開発者に対し、教育への導入で何を測るべきかを再考するよう迫っている。宿題が速く終わることや、見栄えの良い提出物ができることは、自動的に学習を意味しない。自力でのパフォーマンスこそ、より難しく、より重要な試験であり続ける。

OECDのAI教育報告書が実際に明らかにしたこと

学校の課題でAIを使わなかった生徒は、一般に利用者を上回った。ただし、この結果は因果関係が証明された害ではなく、関連性を示すものである。

OECDは2026年9月8日、PISA 2025 resultsを公表した。PISA(国際生徒評価プログラム)は、15歳の生徒が未知の問題に知識をどう応用するかを測定する。

2025年の評価は、このプログラムで過去最大の実施回だった。参加した91の国と経済圏で76万人の生徒を対象とした。科学を主要科目とし、読解と数学は基礎知識を測る追加指標として用いられた。

PISAは初めて、生徒が学校の課題でAIチャットボットをどの程度使うかについて詳細な情報を収集した。質問は4つの一般的な活動を対象とした。

生徒は、学習の補助、新しいテーマの調査、指定された読書課題の要約、文章課題の下書きにチャットボットを使ったかを回答した。調査は、たまに使う、適度に使う、毎週使う、ほぼ毎日使うという利用頻度も区別した。

AIはすでに大半の生徒にとって日常的なものとなっていた。OECD加盟国では、調査対象となったすべての学校課題において、チャットボットをまったく、またはほとんど使わないと答えた生徒は14%にとどまった。

それでも、非利用者は一般に利用者より高い科学スコアを獲得した。文章課題の下書きにAIを使わなかった生徒も、その目的で使ったと答えた生徒を上回った。

この傾向は活動内容と頻度によって異なった。学習支援のためにAIを毎週使う生徒は、調整後の科学スコアで非利用者と同程度だった。一方、ほぼ毎日使う生徒や、たまにしか使わない生徒は低いスコアになる傾向があった。

要約や予備調査では、適度な利用者は限定的な利用者と集中的な利用者の双方を上回った。OECDは、こうした課題における適度な利用を、月1回から週2回の間と定義している。

下書きでは、この中程度の利用による優位性はより弱かった。チャットボットによる下書きを避けた生徒が、依然として最も明確な全般的優位を保っていた。

これらの比較では、生徒の社会経済的地位を考慮して予測科学スコアを調整した。この調整は重要である。AIの導入は均等ではなかったためだ。

頻繁な利用者は、より恵まれた家庭環境にいる傾向があった。非利用者は、デバイス、安定したインターネット接続、有料AIサービスへのアクセスの制限など、社会経済的な不利に直面する可能性が高かった。

社会経済的背景を考慮した後でも、利用行動と学習傾向を切り分けるのは難しかった。学習に苦しむ生徒は、すでに課題が難しいためにAIを頼るかもしれない。一方で、AIの多用は、自立した技能を育てるために必要な努力を減らす可能性もある。

報告書は、どちらの方向の影響が支配的かを判断できない。利用状況と成績を同じ評価期間中に捉えた横断的な証拠を示している。

したがってOECDは、チャットボットを開くことが生徒のスコアを直接下げるとは主張していない。より強い結論は実用的だ。アクセスだけでは、より良い学習を予測できない。

この結論は、授業でのAI導入を支える一般的な前提に疑問を投げかける。利用可能性は数えやすい一方、理解は測定がはるかに難しい。

より良い宿題が、より弱い学習を隠すことがある

生成AIは、完成した成果物の質を高められる一方で、生徒が自力で取り組む準備となる練習を弱める可能性がある。

OECDの知見は、より広範な実験研究の蓄積とも一致する。汎用チャットボットは、支援を受けながら行う課題で生み出される即時の成果をしばしば改善する。しかし、その支援が取り除かれると、そうした向上は消えることがある。

同機関のdigital education outlookは、この問題をパフォーマンスと学習の間のギャップとして説明している。パフォーマンスは、生徒が今日の課題をうまく完了できたかを測る。学習は、その生徒が後にその知識を応用できるかを測る。

生徒はチャットボットに章の要約を依頼し、正確で読みやすい回答を得られる。その出力だけでは、生徒が主張の中心を把握したか、根拠を吟味したか、内容を記憶したかについてはほとんど分からない。

下書きでは、さらに鋭い対立が生まれる。チャットボットは短い指示文を数秒で構成されたエッセイに変えられる。結果として提出された文章は、その生徒が自力では再現できない語彙や構成を示すかもしれない。

目に見える成果物は改善するが、見えない学習プロセスは縮小する。生徒は情報を思い出し、不確実性を解消し、根拠を選び、弱い推論を見直す時間を減らす。

こうしたステップは非効率に感じられるかもしれない。しかし、学習の多くはそこで起きる。

この仕組みは、PISAデータに見られた特異な利用頻度曲線の説明にもなる。適度な利用は能動的な学習プロセスを補完できる。集中的な利用は、そのプロセスを置き換える機会を増やす。

たまに使う利用者のスコアが低くなる理由もいくつか考えられる。混乱しているときや遅れを取っているときにだけチャットボットを開く生徒もいるかもしれない。その場合、利用頻度は原因ではなく、既存の困難を反映している。

OECD Digital Education Outlookは、Türkiyeの高校生を対象とした統制された数学研究を検討した。生徒は練習中に、一般的なGPT-4インターフェース、または特別に設計されたチュータリング版のいずれかを利用した。

チュータリングシステムは、AIにアクセスできなかった生徒と比べ、練習時の成績を127%改善した。一般的なチャットボットによる改善は48%だった。

しかし、一般的なチャットボットで練習した生徒は、AIへのアクセスを一度も受けなかった生徒より、クローズドブック試験で17%低いスコアとなった。チュータリング群はその不利益の大半を回避した。

基礎となるcontrolled math studyは重要な比較を示している。両システムは同じ基盤モデルのファミリーを使っていたが、その挙動は異なる生徒の行動を促した。

一般的なインターフェースは容易に答えを提示した。チューターには、すぐに課題を完了させずに生徒を問題解決へ導くための安全策が組み込まれていた。

この違いにより、議論はモデルの正確性を超える。生徒が自立したアプローチを組み立て、検証する前に届くなら、正しい答えであっても学習を損なう可能性がある。

教育AIには、別の品質指標が必要だ。開発者は通常、モデルが正しく答えるか、指示に従うか、利用者を満足させるかを評価する。学習システムは、生産的な努力を保てるかも評価しなければならない。

生産的な努力とは、すべての答えを出さないことではない。想起を促し、説明を求め、誤解を見つけ、学習者が問題に取り組んだ後まで支援を遅らせることを意味する。

従来型のチャットボットは、即時の有用性を最適化する。教育用チューターは、ときにその衝動に抵抗しなければならない。

これは居心地の悪いプロダクト上の対立を生む。生徒は作業を減らすツールを好むことが多い一方、学校には自立した能力を高めるツールが必要だ。

利用数、完了速度、満足度は、誤った設計を評価してしまう可能性がある。課題を簡単にするシステムは、試験成績を弱めながらも、ダッシュボード上では成功しているように見えるかもしれない。

PISAのAI利用生徒のスコアは、この測定上の問題を世界規模で可視化した。学校は、導入状況や課題の質だけで教育テクノロジーを判断することはできない。

チャットボットが存在しない、制限される、あるいはすぐ使える答えを提示できない状況でも、技能が転移するという証拠が必要である。

AIリテラシーが結果を変える

学校が頻繁なAI利用と、AIが生成した情報を問い直す明示的な練習を組み合わせたとき、生徒は最も大きな恩恵を受けた。

OECD加盟国の生徒の約6割は、AI生成情報の評価を伴う授業課題を受けたと報告した。国別の割合は31%から80%超まで幅があった。

そのうち46%は、こうした活動をときどき行ったと答えた。約33%は頻繁に行い、22%は非常に頻繁に行ったと回答した。

生徒は、一般的なオンライン情報を評価する練習をより多く受けていた。およそ10人に8人は、インターネットで見つけた情報の質を評価するよう授業で求められたと答えた。

この違いは重要だ。AIの出力は、推論や根拠が不完全でも流暢な文章を生み出すためである。

その評価には、通常の読解力に加え、生成システムがどのように応答を構築するかについての理解も必要となる。生徒は主張を精査し、情報源をたどり、不確実性を認識し、信頼できる資料と回答を比較しなければならない。

PISAは、こうした機会を得た生徒の間で、控えめながら注目すべき逆転を確認した。AI情報を評価する方法を学んだ頻繁な利用者は、非利用者および月2回以下しかAIを使わない生徒をわずかに上回った。

この結果は、評価に関する授業が改善を引き起こしたことを証明するものではない。より強力なAI教育を提供する学校は、より優れた教師、資源、あるいは幅広い学業支援も備えている可能性がある。

ただし、AI利用が一律に有害だという考えは弱まる。教育環境と生徒の行動が、結果を形作っているように見える。

OECDのAI literacy findingsは、受動的な消費ではなく解釈を重視している。この焦点は、効果的なチャットボット利用の中心に読解力を置くものだ。

有効な授業演習としては、正確な記述、根拠のない前提、そして1つの偽の引用を含むAI生成の説明を生徒に与える方法が考えられる。生徒はその後、各主張に注釈を付け、検証する。

別の課題では、学習者にまずAIなしで最初の回答を書かせることもできる。その後でチャットボットに批評を求め、どの提案を受け入れ、あるいは拒否したかを説明させる。

こうした活動は、生徒が主導権を保つ。モデルは自動回答機ではなく、分析対象やフィードバックの情報源となる。

また、教師が確認できる証拠も生み出す。最終的なエッセイだけでは、どれほどの推論が生徒自身によるものかを隠してしまう可能性がある。下書き、プロンプト、情報源のメモ、書面による判断は、その過程を明らかにする。

ここでは、個人の知識管理の実践が責任ある利用を支えられる。情報源と自分自身のメモを保存する生徒は、AIの応答を根拠の追跡記録と照らし合わせることができる。

構造化された学生向けワークスペースは、読む資料、ノート、疑問をつなげて管理するのに役立つ。とはいえ、学習効果は依然として、学生がその資料をどう使うかに左右される。

批判的に評価する力を、AI安全性に関する一度きりの授業にしてはならない。通常の理科、歴史、文章作成、調査課題の中に組み込む必要がある。

学生には、もっともらしい回答に異議を唱える許可も必要だ。チャットボットは自信をもって語るため、若い利用者は洗練された表現を権威と誤認しかねない。

教師は、検証や訂正を評価することでその影響を抑えられる。モデルの根拠のない主張を見抜いた学生は、期待された答えにたどり着いたことだけでなく、その推論に対して評価されるべきだ。

目標は、不信感そのものではない。証拠、課題の種類、不確実性に基づく、適切に調整された信頼である。

この考え方は、AIが学習に与える実際の影響により合致する。同じモデルでも、思考を短縮することもあれば、それを発展させるフィードバックを提供することもある。

スコア差は、AIが低下を引き起こしたことを証明しない

OECDのデータは警告の兆候を示しているが、学生の成績に影響する多くの要因からチャットボットの影響だけを切り分けることはできない。

AI利用者の成績が低いという見出しは、容易に証拠を先走る。PISAは、数十万人の学生を無作為にチャットボット利用群と非利用群に割り当てたわけではない。

学生は自身の行動を自己申告した。自己申告による頻度には不正確さがあり、「学習を助けてくれる」という表現の解釈も回答者によって異なりうる。

ある学生は、完成済みの回答を生成するためにAIを使うかもしれない。別の学生は、練習問題、フィードバック、別の説明を求めるかもしれない。どちらも同じ大まかな利用カテゴリーに分類されうる。

理科のスコアも、2025年中に完了した活動だけではなく、蓄積された知識を表す。学生は、それぞれ異なる学校、教師、家庭の支援、意欲、過去の達成度を背景に評価へ臨んだ。

逆因果関係も十分に考えられる。成績の低い学生ほど追加の支援を必要とするため、より頻繁にチャットボットへ頼るかもしれない。その場合、利用者のスコアが低くても、AIがその差を生んだことの証明にはならない。

OECDもこの限界を明確に認めている。こうした関係は、AIが理科の成績に悪影響を及ぼすことを必ずしも示すものではないとしている。

より広範な学力の傾向も、生成AIが広く採用される前から始まっていた。OECD加盟国全体では、読解スコアは2015年から2025年の間に28ポイント低下し、数学スコアは22ポイント低下した。

OECDは、これらの変化を読解で約1年半、数学で1年強の学習に相当するとしている。

ChatGPTが一般公開されたのは2022年後半にすぎない。それだけで10年にわたる低下を説明することはできない。

パンデミックによる混乱、出席状況、家庭の関与、デジタルによる注意散漫、カリキュラムの変更、学習環境はいずれも分析に含めるべきだ。PISAの結果は、低下に占める各要因の正確な割合を割り当ててはいない。

OECD平均では、理科の成績は2022年から2025年にかけて安定していた。この安定性は、チャットボットの採用が即時の全体的な崩壊を招いたという主張をさらに複雑にする。

同時に、因果関係の証明がないからといって、警告を無視すべきではない。観察された傾向は一貫して、集中的かつ指導のない支援よりも、非利用、適度な利用、または指導付きの利用を有利に示している。

統制研究も、学習上の不利益をもっともらしくする仕組みを示している。学生が想起や推論を試みる前に回答を受け取ると、後に支援なしで測定される技能を練習する機会が減る。

したがって、最も妥当な立場は、パニックと無関心の間にある。PISAは、AIが学生の知能を低下させることを証明してはいない。一般的な導入が、全般的な学業上の優位性をもたらしていないことを示している。

この発見は、立証責任を変えるべきだ。学生が学校課題に使っているというだけで、学校はチャットボットが教育的であると想定すべきではない。

AI開発企業にも、エンゲージメント指標を超える証拠が必要だ。企業が学習製品を売り出すなら、時間を置いた独立評価を通じて持続的な改善を示すべきである。

そのような検証では、一般的なチャットボット、制約付きのチュータリングツール、教師主導の利用、AIを使わない練習を比較すべきだ。また、効果が教科や学生集団をまたいで持続するかも追跡すべきである。

公平性も新たな不確実性を加える。恵まれない立場の学生は、AI生成情報を評価する課題を授業内で受ける可能性が低かった。

また、アクセスの制約が理由である可能性もあり、非利用者である割合も高かった。指導を拡充せずにアクセスだけを広げれば、ある格差を別の格差に置き換えることになりかねない。

中心的なリスクは、単に一部の学生がより優れたモデルを利用できることではない。一部の学生はモデルを問い直す方法を学ぶ一方、他の学生には即答だけが提供されることだ。

学校はチャットボットを取り締まるだけでなく、課題を再設計しなければならない

この調査結果は、包括的なアクセス判断から、課題、評価、AI製品の設計へと重心を移す。

学校は当初、生成AIを主に学術的誠実性の問題として扱った。この懸念は今も大きい。

別のOECD教師調査では、中等教育前期の教師の72パーセントが、AIは学生が生成された成果物を自分のものとして提出できるため、誠実性を損なうおそれがあると回答した。

検出だけでは弱い対応にとどまる。AI検出器は、文章が機械支援による執筆に似ているかを推定するが、学生が課題をどのように作成したかを確実に再構築することはできない。

学生はAIをブレインストーミング、文法フィードバック、根拠のない下書き、あるいは全面的な代替に使うかもしれない。最終的な文章から、こうした違いを明確に見分けられることはほとんどない。

評価設計では、より有用な証拠を捉えられる。教師は、アウトライン、出典注釈、中間草稿、口頭での説明、または短い監督付きのフォローアップを求められる。

こうした方法は推論を可視化する。また、学校が一定のAI支援を認める場合にも有用であり続ける。

閉じた資料なしの試験は、独立した能力を測る一つの手段となる。ただし、学習には調査、協働、推敲、ツールの活用も含まれるため、それだけを唯一の答えにすべきではない。

バランスの取れた制度では、両方のモードを評価できる。学生はAIなしで基礎知識を示すとともに、AIを用いた責任ある応用も示すべきだ。

OECDのグローバル発表は、目的意識を持った適度なテクノロジー利用を訴えている。同時に、注意、努力、理解を置き換えることには警鐘を鳴らしている。

この原則は、学校に実行可能な基準を与える。課題では、どの認知的作業を学生自身が担い、どこでAIが貢献できるかを明示すべきだ。

たとえば教師は、初期の問題解決ではAIを禁止し、推敲段階では利用を認めることができる。学生はその後、自分のアプローチとモデルの回答を比較できる。

歴史の課題では、テーマの探索を認めつつ、すべての事実主張を承認済みの情報源に結び付けることを求められる。学生は、却下したAIの提案について短い説明を提出する。

文章作成の授業では、チャットボットを著者ではなく批評者として使える。モデルは不明瞭な箇所を指摘するが、修正方法を決めるのは学生である。

こうした設計では、AI利用は回答をコピーするよりも時間がかかる。この摩擦は、学習者に自らの思考を点検させる場合に価値を持つ。

開発者も並行した設計上の課題に直面する。教育モードには、親しみやすい口調、簡略化された説明、年齢別のインターフェース制御だけでは足りない。

信頼できるチューターは、誤解を診断し、学生に回答を確定させ、ヒントを段階的に調整すべきだ。中心となる知的課題を早すぎる段階で完了させることは避けるべきである。

教師には、対話の可視性も必要だ。有用な教室向けシステムは、不必要な個人データを開示せずに、試みた概念、求めたヒント、訂正した誤りを要約できる。

特に未成年者にとって、プライバシーと安全性は依然として重要だ。学校には、データ保持、モデル訓練、年齢適合性、学生との会話へのアクセスを対象とする明確な規則が必要である。

教師の準備も、もう一つの重要な論点だ。OECDによると、中等教育前期の教師の37パーセントが2024年に業務でAIを利用した。

教師は、方針文書だけで学生の行動を導くことはできない。AIが学習を支える場合と、不可欠な練習を取り除く場合を示す、教科別の事例が必要だ。

適切なアプローチは教科によって異なる。電卓のような支援は、数学の概念を習得した後には適切かもしれないが、導入段階では有害になりうる。

言語学習者は会話練習の恩恵を受けられる。それでも、自動補完なしに語彙を想起し、文を組み立てる機会は必要だ。

したがって問うべきなのは、すべての教室がAIを導入すべきか禁止すべきかではない。それぞれの利用が、授業で育てようとする精神的な働きを保っているかどうかである。

教育AIが改善しているかを示す三つの兆候

次の段階は、単なるチャットボット導入率ではなく、独立した学習、指導付き利用へのアクセス、製品の挙動によって評価されるべきだ。

第一の兆候は、支援なしでの成績である。学校と研究者には、AI利用後に学生が技能を保持し転移できているかを検証する、時間を置いた評価が必要だ。

直後の課題の質だけでは不十分である。有用なシステムは、ツールが使えない場合や、問題が練習例と異なる場合にも結果を改善すべきだ。

今後の無作為化研究が教科をまたぐ持続的な改善を示せば、OECDの警告は弱まるだろう。洗練された宿題が弱い試験成績に先行し続けるなら、その警告はより強まる。

第二の兆候は、AIを明示的に評価する指導へのアクセスである。PISAは、学生のおよそ10人に6人が、AI生成情報を評価する授業内の練習を何らかの形で受けていたと報告した。

この割合は上がるべきだが、参加だけでは足りない。研究者は、それらの授業の質、頻度、教科への統合度を測定すべきである。

社会経済的な格差にも注意を払うべきだ。恵まれない立場の学生は現在、学校の授業中にAI出力を評価する機会が少ないと報告している。

その格差が縮小し、指導付きの利用者が改善するなら、AIリテラシーは意味のある介入策と見なせるだろう。独立した改善なしにアクセスだけが拡大するなら、学校にはより深い教育上の変化が必要になる。

第三の兆候は、教育製品が回答の代替を抑制しているかどうかだ。開発者は、チュータリングモードがどのように学生の推論を維持し、支援終了後の学習をどう測定するかを説明すべきである。

有用な証拠には、独立した評価、透明性の高い研究設計、一般的なチャットボットとの比較が含まれる。エンゲージメントの数値では、教育上の問いに答えられない。

日常的な利用時の製品の挙動も重要だ。チューターは解答を提示する前に試行を求めるだろうか。証拠を求め、不確実性を明らかにするだろうか。

教師は各課題で利用可能な支援の種類を設定できるだろうか。学生は完成済みの回答だけを受け取るのではなく、自身の推論がどう変化したかを振り返れるだろうか。

こうした選択が、AIが近道、チューター、あるいは両者が不均一に混ざったものになるかを決める。

OECDのAI教育報告書は、チャットボットが学校から消えるふりをすることを正当化しない。調査対象の学生の大半はすでに利用しており、取り締まりでその現実を覆すことはできない。

ただし、より高い基準を正当化する。学生はAI支援のある課題を終えたとき、単により良い文章を手にしているのではなく、始める前より多くを知っているべきだ。

保護者や学習者も、同じ基準をすぐに適用できる。チャットボットを使った後、それを閉じてから、考えを説明し、関連する問題を解き、あるいは情報源を用いて回答を擁護してみるとよい。

理解がチャットウィンドウとともに消えるなら、ツールは作業を完了させただけで、学習を支えたわけではない。次に問うべきなのは、学校と開発者がその違いを踏まえて設計するかどうかである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page