top of page

Brown UniversityのAI不正利用事例が大学試験の危機を浮き彫りに

Brown UniversityのRoberto Serrano教授は、持ち帰り形式の中間試験でクラス平均が96%に達した後、深刻な矛盾を見いだした。監督下での試験では平均点が大きく下落し、試験セキュリティの動的な性質が明らかになった。この事例は、既存の評価システムを変えないまま検知ツールを追加するだけでは、大学が学術水準を守れないことを示唆している。

Serrano教授は、高度な数理経済学科目である「Welfare Economics and Social Choice Theory」を担当している。2025年12月にBrownのキャンパスで発生した死傷者を伴う銃撃事件の後、学生が不安を訴えたことを受け、同教授は持ち帰り試験を認めた。報じられた授業内の事例によると、その後、同教授は授業中に広範な無許可AI利用の証拠を見つけた。

問題は、一つの授業や一つのチャットボットにとどまらない。大学は柔軟な学習を約束する一方、特定の学生が定められた技能を身につけたことを認定している。生成AIの登場により、管理された環境の外で課題が行われるたびに、これらの約束を両立させることが難しくなっている。

Brownはいま、世界中の大学が直面するのと同じ選択を迫られている。AI不正利用を主に個人の不正行為として扱うのか、それとも検証可能な学習を中心に評価を再設計するのか。前者は慣れ親しんだ手続きを維持する。後者は、従来の手続きでは十分な証拠を提供できなくなったことを認める。

96%の中間試験が警鐘を鳴らした

重要な変化は、学生がChatGPTにアクセスできたことではない。定着した試験が、個人の学習を裏付ける信頼できる証拠を生み出せなくなったことだ。

Serrano教授はこの科目を約20年にわたり教え、通常は約30人の学生を受け入れてきた。2026年春、持ち帰り試験を導入した後、履修者数は86人に達した。この方式は学生に無制限の作業時間を与え、教室に戻ることへの正当な懸念にも対応するものだった。

持ち帰り形式の中間試験の平均点は96%だった。Serrano教授によれば、新しい試験はより難しかったにもかかわらず、過去の中間試験の平均点は65%から80%の範囲だったという。報道によると、クラスのほぼ半数が満点を取った。

高得点だけで不正行為を証明することはできない。例外的に優秀なクラス、無制限の作業時間、共同作業、よりよい準備、試験間の違いはいずれも得点分布を変え得る。告発は学生の教育や評判に影響する可能性があるため、この限界は重要だ。

Serrano教授は、解答そのものにも別の兆候を見つけた。複数の解答が、より自然な直接的な数学的証明ではなく、間接的な背理法を用いていたと報じられている。Serrano教授と採点者が問題をChatGPTに入力すると、同様に回りくどいアプローチが生成された。

この類似は疑念を高めたが、どの学生がどのツールを使ったかを特定するものではなかった。言語モデルは、同じプロンプトに対して異なる回答を生成できる。学生が共有ノートを使ったり、問題について議論したりした結果、珍しい手法に収束することもあり得る。

Serrano教授は、期末試験を監督付きの教室内試験に切り替えた。期末試験でおおむね同程度の分布が得られれば中間試験を成績に算入し、そうでなければ配点を変更すると学生に伝えた。

履修者数と成績の変化は劇的だった。事件に関する報道によると、学生27人が科目を履修取り下げし、その中には中間試験で満点を取った22人が含まれていた。59人が期末試験を受験し、19人が不合格となり、期末試験の平均点は約49%まで下がった。

報じられるところでは、中間試験の結果から10ポイント以内に収まる点数を取った学生は2人だけだった。この傾向は、持ち帰り試験の得点が独力での習熟を反映していなかったというSerrano教授の主張を強める。ただし、個々の事例すべてでAI利用を立証するものではない。

この区別こそが、制度上の問題を規定する。大学は、統計的な疑いを自動的な有罪認定とせずに、資格の価値を守るための十分な証拠を必要としている。単発の剽窃事案だけを想定して作られた手続きでは、一つの評価で数十件の疑わしい提出物が生じた場合に対応しにくい。

報道によれば、BrownはSerrano教授に対し、個々の学生について申立てを行い、各試験答案を審査用に提出するよう求めた。大学の広報担当者は、申立てが一人の学生に関するものであれ複数人に関するものであれ、手続きは同じだと述べた。Serrano教授は、そのような対応ではこの規模の不正行為を扱えないと主張した。

大学の慎重さには、擁護できる目的がある。学術上の懲戒には、通知、証拠、そして学生が反論する機会が必要だ。しかし、評価設計そのものがクラスの大部分に不確実性を生み出している場合、事例ごとの手続きでは不十分になる。

このため、この出来事はBrownを超えて重要である。失敗は正式な不正認定の前に起きた。大学が、自らの得点が何を測定しているのかをもはや自信を持って説明できなくなった時点で起きていた。

AI不正利用の動的な性質が問題の重大性を変える

大学は、禁止された支援を取り締まっているだけではない。学位が依然として個人の知識と判断力を証明するものかどうかを守ろうとしている。

ここでいうAI不正利用の動的な性質とは、変化し続ける境界を指す。モデルの推論能力が向上するたびに、ソフトウェアが説得力をもって完了できる監督外課題の範囲は広がる。今学期には安全と見なされた評価も、次の科目が始まる前には脆弱になり得る。

生成AIは、ユーザーの指示から新しいテキスト、画像、コード、その他のコンテンツを生成するソフトウェアだ。ソースを一語一句再現する必要はない。そのため、出力は表現としては独自でも、著者性の面では独自でない可能性があり、従来の剽窃チェックは有用性を失う。

数理経済学はかつて、通常のエッセイ執筆よりAIに強いように見えた。学生は論証を選び、証明を構築し、形式的な結果を結び付ける必要があった。Serrano教授の説明は、現在のツールが、推論に不自然さがあっても高得点を得られるほどもっともらしい解答を生成できることを示唆している。

圧力はまず教員にかかる。AI利用のルールを定め、課題を設計し、授業を行い、疑わしい提出物を調べ、事案を記録し、その判断を擁護しなければならない。こうした責任のいずれについても、十分な研修を受けていない教員は多い。

学生も別の形の圧力に直面する。ルールは科目、学部、教員ごとに異なる。ある授業ではブレインストーミングに認められるツールが、別の授業では不正行為となり得る。境界が曖昧であれば、誠実な遵守は難しくなり、執行の一貫性も低下する。

管理者は組織上のリスクを負う。雇用主や専門職団体は、成績証明書が実証された能力を反映していると考えている。大学がその能力を検証できなければ、成績や資格への信頼は弱まる。

オーストラリアの高等教育規制機関は、評価セキュリティを、不正行為に対して課題を強化するための措置と定義している。同機関の評価セキュリティに関するガイダンスは、信頼できる評価を資格に対する公的信頼と結び付けている。この枠組みは、問題を単なるルール違反者の摘発以上のものとして捉える。

したがって大学には、二種類の評価が必要だ。一部の課題では学生がAIを用いて学ぶことを支援し、別の課題では学生が独力で何をできるかを検証しなければならない。これらの目的を混同すれば、無制限の外注か、全面的な禁止のどちらかにつながる。

学習課題では、実験、下書き、フィードバック、AI支援による比較を認めることができる。検証課題では、学習成果に適した条件のもとで著者性と能力を確立しなければならない。同じ課題が両方の目的に等しく適することは、ほとんどない。

例えば学生は、AIを使って政策分析を準備できる。その後、前提を口頭で説明し、重要な計算を再現し、代替的な証拠が結論をどう変えるかを説明することができる。この一連の流れは、AIリテラシーと個人の理解の両方を試す。

教員には、増加する業務負担への支援も必要だ。口頭確認、段階的な課題、監督付きの課題には時間がかかる。大学は、個々の教員にすべての運用コストを負担させたまま、評価改革を発表することはできない。

Brownの事例では、制度的な保証の問題が一つの授業で表面化したため、ある教授に圧力が集中した。大学はこの負担配分を逆転させなければならない。プログラムが評価セキュリティの責任を持ち、教員は共有された設計を実施すべきだ。

検知だけでは学術的公正性の仕組みを支えられない

AI検知ツールは、著者性に関する弱い証拠から始まり、重大な懲戒判断に行き着く対立を解決できない。

AI検知ツールは、テキストが機械生成の文章にどの程度似ているかを推定する。学生がどのようにその作品を作成したかを観察するものではない。したがって、その出力は行為の記録ではなく、推論にすぎない。

偽陽性は、誠実な学生を告発にさらす可能性がある。偽陰性は、巧妙な不正利用を見逃す可能性がある。編集、翻訳、プロンプトの洗練、人間と機械を混在させた下書き、モデルの更新はいずれも結果に影響し得る。

この問題は、第二言語で文章を書く学生にとって特に深刻になる。定型的な語彙や予測可能な文構造は、モデルの出力に似て見えることがある。検知スコアを証拠として扱う教育機関は、言語パターンと不正行為を混同するリスクを負う。

Quality Assurance Agencyは、偽陽性や回避を含む検知の限界を考慮するよう教育機関に助言している。同機関の評価ツールキットは、重大な影響を伴う課題を見直し、許容されるAI利用を明確化し、適切な場合には透明性を求めることを推奨している。

Serrano教授は検知ツールだけに頼らなかった。同教授は、過去の成績、履修者数の変化、解答パターン、モデル生成の回答、履修取り下げ、監督付き期末試験を比較した。これらのシグナルを合わせることで、中間試験が信頼できる測定ではなかったという強い論拠が形成された。

それでも、個人に関する疑問は残る。期末試験のほうが難しかった可能性がある。学生は監督下でより強い不安を感じた可能性がある。履修取り下げにより、比較対象となる集団も変化した。最近の統計的批判は、こうした代替的説明によって、得点差から証明できる範囲には限界があると論じている。

この批判は、中間試験への信頼を回復させるものではない。大学が二つの判断を分けなければならない理由を示している。一つは、評価が依然として有効かどうかを問う判断だ。もう一つは、特定の学生が不正行為を行ったかどうかを問う判断である。

教育機関は、すべての学生を自動的に有罪とせずに、侵害された評価を無効にする、または配点を下げることができる。その上で、証拠が定められた基準を満たす場合に限り、個別の懲戒手続きを進められる。このアプローチは、資格の公正性と適正手続きの双方を守る。

大学は、学習の過程で生み出された証拠も保存すべきである。下書きの履歴、注釈付きの資料、計算過程、実験記録、コードコミット、短い振り返りは、成果物がどのように発展したかを示せる。こうした記録は、最終文書だけを切り離して見るよりも多くの情報を与えてくれる。

ただし、プロセスの証拠は適切な範囲にとどめなければならない。継続的な監視はプライバシー上のリスクを生み、教育を職場監視のようなものに変えてしまいかねない。教育機関が収集すべきなのは、明示された学習成果と公表済みの評価ルールを支える情報だけである。

AI利用の開示も、もう一つの層となる。学生は使用したツールを特定し、許可された役割を説明し、関連するプロンプトを保存し、どの主張を検証したかを示せる。開示は隠れた不正利用を防ぐものではないが、認められた利用を監査可能にする。

同じ原則は、学生がパーソナルナレッジベースを構築する際にも役立つ。情報源に関するノート、改訂履歴、推論の記録は、学習を検出器のスコアへと矮小化することなく、知的成長を記録できる。

その証拠には明確な方針が伴わなければならない。「AIを責任を持って使う」という指示だけでは、採点対象の課題にとって曖昧すぎる。評価では、AIがアイデアの生成、文章の編集、コードの作成、問題解決、引用の提示に使えるかどうかを明記すべきである。

ルールは、学生が何を提出しなければならないかも説明すべきだ。プロンプトの提出が必要なら、どのプロンプトをどの形式で提出するのかを示す。口頭での確認があり得る場合は、学生が課題に着手する前にそのことを知らせるべきである。

そうすれば、文章が「AIらしく見える」かを推測する負担は、既知の要件に照らして定義された行為を確認することへ移る。これは学術的誠実性にとって、より公正な基盤となる。

大学には厳格な確認とAIを活用した学習が必要だ

実行可能な対応策は、全面禁止でも無制限のAI利用でもなく、二本立ての評価システムである。

第一のレーンには、個人に不可欠な能力を検証する厳格な評価を置くべきだ。監督付き試験、口頭試問、ライブでの問題解決、実技デモンストレーション、管理されたデジタル課題などが含まれる。形式は、認定する技能に合わせる必要がある。

第二のレーンには、AI利用が許可または求められるオープンな評価を置くべきだ。学生はモデルの出力を比較し、誤りを特定し、弱い推論を改善し、判断を記録できる。こうした課題は、AIリテラシーを隠れた近道ではなく学習成果として扱う。

各プログラムは、どれだけの証拠を各レーンに配置するかを決めなければならない。医学課程では、臨床判断を厳格に実演して確認する必要がある。ソフトウェア課程では、AIによるコーディング支援を認めつつ、学生に生成コードをライブで説明、テスト、修正させることが考えられる。

経済学は分かりやすい例を示している。学生はオープンな課題で、モデルを使って福祉に関する論拠を提案してもよい。その後の厳格な課題では、結果を導出し、隠れた前提を特定し、政策的な含意を擁護するよう求められる可能性がある。

モデル能力が広がり続ける性質を考えれば、大学はこの均衡を定期的に見直す必要がある。ツールは新たな推論、コーディング、閲覧、マルチメディア機能を次々と獲得しているため、固定的な方針はすぐに時代遅れになる。

個別科目の孤立した変更よりも、プログラム単位の見直しが重要だ。教員がそれぞれ独立して対応すれば、学生は混乱する寄せ集めのルールに直面する。一部の科目は過度に制限的になり、別の科目では学習をもはや検証できない課題が使われ続けることになる。

オーストラリアの規制当局向けに策定された評価改革の原則は、プログラム全体にわたる評価設計を推奨している。また、学習のための評価と、学習を保証する評価を区別している。

この区別は、資源配分の判断を導くべきである。大学には、価値の高い学習成果を検証するための十分な監督体制が必要だ。同時に、コースの目的を損なわずにAIを活用するオープンな課題を教員が設計できるよう支援する学習デザイナーも必要である。

厳格な評価は、デジタル以前の試験をすべて再現することを意味しない。従来の時間制限付きテストは記憶力を評価する一方で、調査、協働、専門的判断を見落とすことがある。目標は、懐古趣味ではなく検証された能力である。

口頭評価にも限界がある。不安を抱える学生に不利になり、アクセシビリティ上の懸念を生み、教職員の時間を大きく消費する可能性がある。大学は、意味のある証拠を加えられる場合に限って、短く構造化された口頭確認を使うべきだ。

無作為の確認は、作業負荷を減らせる。教員は提出物から限られた数の主張を選んで説明を求めたり、学生に重要な手順の一つを再現させたりできる。学生は、自分の成果物のどの部分についても説明可能でなければならないと理解することになる。

評価ポートフォリオも選択肢の一つである。ポートフォリオは、時間をかけて収集した複数の証拠を組み合わせる。そうすれば、一件の疑わしい提出物の重みは小さくなり、成長の軌跡や独立したパフォーマンスのパターンも見えやすくなる。

大学は、重要な関門科目と最終学年の成果物を優先すべきだ。こうした評価は、資格の信頼性にとって最大のリスクを伴う。価値の低い小テストをすべて一度に作り直すことは、限られた教職員の時間を浪費する。

方針には、適切に段階づけられた措置も必要である。禁止された試験を意図的に外部へ委託することは重大な不正行為だ。分かりにくいルールの下で初めて開示を誤った場合には、別の対応がふさわしい。AI利用のあらゆる形態に、一つの処分を当てはめることはできない。

報道によれば、Brownの委員会は、処罰への過度な集中を抑えながら、より明確な期待を示すよう勧告した。この立場は、より強固な評価の安全性と両立する。予防、検証、教育、懲戒は、それぞれ異なる機能を果たす。

安全なシステムは、処罰が必要になる前に不正行為の機会を減らす。学生に対し、どのような証拠を、なぜ提出しなければならないのか、そして独立した能力がなお重要である理由を伝える。その結果、ルールと評価条件が整合するため、執行の信頼性も高まる。

大学は再設計に学生を参加させるべきだ。学生は、方針がどこで矛盾しているか、科目がすでにどのツールを当たり前のものとしているか、そして作業負荷の圧力が行動をどう形づくるかを知っている。学生の参加は抜け穴を明らかにし、遵守の改善につながる。

教員の能力開発も同様に重要だ。UNESCOの教育ガイダンスは、教育機関に対してAIの教育的・倫理的な適合性を評価するよう求めている。そのためには、評価設計、プライバシー、モデルの限界、公平なアクセスに関する研修が必要である。

公平性は後回しにできない。AI利用が必須であれば、すべての学生が適切なツールにアクセスできなければならない。任意の場合でも、学生には学業上の不利益を受けない、AIを使わない実行可能な選択肢が必要だ。

アクセシビリティは、厳格な評価の設計にも反映されなければならない。監督、手書き、口頭での質問、ロックされたソフトウェアは、障壁を生む可能性がある。大学は、同等の検証基準を維持しながら合理的配慮を守るべきである。

目標は、すべての不正行為をなくすことではない。そのようなことを達成した評価システムはこれまで存在しない。目標は、不正をより困難にし、誠実な参加をより明確にし、資格の正当性を守ることである。

大学が本気かどうかを示す三つの兆候

次の試金石は、教育機関が評価の運用を変えるかどうかであり、責任あるAIについての一般論をまた一つ公表するかどうかではない。

第一の兆候は、プログラム単位での評価マッピングである。大学は、独立した検証が必要な学習成果を特定し、その確認がどこで行われるかを示すべきだ。この地図のない方針では、資格の中核に関する問いに答えられないままである。

マッピングは、一般的な懸念を説明責任のある設計へと変えるため、構造改革の論拠を強めるだろう。大学が問題を個々の教員に委ね続ければ、Brownでの経験は他の科目でも繰り返される。

第二の兆候は、検証能力への投資である。監督付き試験スペース、訓練された口頭評価者、学習デザイナー、利用しやすい評価システム、業務負荷の調整に注目すべきだ。人員配置を伴わない改革は、不均一で脆弱なままにとどまる。

この投資によって、すべての課題を管理下に置く必要はない。プログラムが不可欠な能力を認定する重要な地点に焦点を当てるべきである。教育機関は、学生や雇用主がその保証を理解できるだけの情報を公表すべきだ。

第三の兆候は、AI不正行為に対する公正な証拠基準である。大学には、検出器の出力、文書履歴、口頭確認、一致する誤り、パフォーマンス上の異常をどのように評価するのかを説明する文書化されたルールが必要だ。また、不服申し立ての手続きも定めるべきである。

明確な基準は、処罰に至らない事案でも信頼を強めるだろう。教育機関が、侵害された評価と、立証された個人の違反とを区別できることを示せるからである。検出器のスコアを決定的なものとして扱い続ければ、その信頼は損なわれる。

Brownの事案は、全学生に対する確定した裁定ではなく、広範な無許可の支援があったという申し立てにとどまる。その証拠は持ち帰り形式の中間試験に重大な疑念を生じさせる一方で、個人の責任については不確実性が残る。

この不確実性は、脆弱な試験を維持する理由にはならない。それを再設計すべき理由である。より良い評価は、提出後に管理者が著者性を再構築しなければならなくなる前に、学習の直接的な証拠を生み出す。

AI不正行為が進化し続ける性質は、技術的な検出が常に動く標的を追いかけることを保証している。大学が握る、より持続的な手段は、学生に何を、どのような条件で、どのような裏付け証拠とともに実証させるかである。

学生は、自分のプログラムがAIを活用した学習と独立した検証を明確に分けているかを問うべきだ。教員は、教育機関の手続きがクラス全体に及ぶ評価の失敗に対応できるかを問うべきである。雇用主は、大学が学位の背後にある能力をどのように保証しているかを問うべきだ。

Brownの事例は警告である一方、実践的な方向性も示している。大学は不可欠な評価を安全に行い、透明性のあるAI利用を教え、適切な範囲でプロセスの証拠を保存し、個別の申し立てには適正手続きを適用すべきである。

最も重要な問いは、学生がAIを使って従来型の課題を完了できるかどうかでは、もはやない。できるのである。問われているのは、資格に対する信頼がSerranoの試験スコアと同じほど急落する前に、大学が評価を再設計するかどうかだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page