OECD-Bericht zur KI-Bildung: Schülerinnen und Schüler, die KI nutzen, erzielen meist niedrigere Ergebnisse
Der OECD-Bericht zur KI-Bildung hat einen schwierigen Konflikt offengelegt: Die meisten Schülerinnen und Schüler, die Chatbots für Schulaufgaben nutzen, schnitten schlechter ab als jene, die darauf verzichteten. Dieses Muster zeigte sich in einer Erhebung von 2025 mit 760.000 15-Jährigen in 91 Ländern und Volkswirtschaften.
Diese Schlagzeile bedeutet nicht, dass alle Schülerinnen und Schüler ChatGPT oder Gemini schließen sollten. Moderate Nutzer erzielten teilweise bessere Ergebnisse als gelegentliche oder intensive Nutzer. Häufige Nutzer hatten zudem einen leichten Vorteil, wenn Schulen ihnen beibrachten, KI-generierte Informationen zu bewerten.
Die eigentliche Trennlinie verläuft daher nicht zwischen KI-Nutzern und Nichtnutzern. Sie liegt zwischen kognitivem Auslagern und angeleiteter Übung. Ein Chatbot kann eine überzeugend formulierte Antwort liefern, ohne sicherzustellen, dass sein Nutzer die Frage, die Belege oder die dahinterliegende Argumentation versteht.
Diese Unterscheidung setzt Schulen, Familien und KI-Entwickler unter Druck, neu zu überdenken, woran sich der Bildungseinsatz messen sollte. Schnellere Hausaufgaben und besser aussehende Abgaben stehen nicht automatisch für Lernen. Selbstständige Leistung bleibt der schwierigere und wichtigere Test.
Was der OECD-Bericht zur KI-Bildung tatsächlich herausfand
Schülerinnen und Schüler, die KI für Schulaufgaben vermieden, übertrafen Nutzer im Allgemeinen, doch das Ergebnis beschreibt einen Zusammenhang und keinen nachgewiesenen Schaden.
Die OECD veröffentlichte ihre PISA-2025-Ergebnisse am 8. September 2026. PISA, das Programme for International Student Assessment, misst, wie 15-Jährige Wissen auf unbekannte Probleme anwenden.
Die Erhebung 2025 war die bislang größte Ausgabe des Programms. Sie umfasste 760.000 Schülerinnen und Schüler in 91 teilnehmenden Ländern und Volkswirtschaften. Naturwissenschaften waren das Hauptfach, während Lesen und Mathematik zusätzliche Maße für grundlegendes Wissen lieferten.
Zum ersten Mal erhob PISA detaillierte Informationen darüber, wie häufig Schülerinnen und Schüler KI-Chatbots für Schulaufgaben nutzten. Die Fragen deckten vier verbreitete Aktivitäten ab.
Die Schülerinnen und Schüler gaben an, ob sie Chatbots zum Lernen, zur Recherche eines neuen Themas, zum Zusammenfassen vorgegebener Lektüre oder zum Entwerfen schriftlicher Aufgaben verwendeten. Die Umfrage unterschied zudem zwischen gelegentlicher, moderater, wöchentlicher und nahezu täglicher Nutzung.
KI war für die meisten Schülerinnen und Schüler bereits normal geworden. In den OECD-Ländern gaben nur 14 Prozent an, für jede untersuchte Schulaufgabenaktivität nie oder fast nie Chatbots zu nutzen.
Dennoch erzielten Nichtnutzer im Allgemeinen höhere Naturwissenschaftsergebnisse als Nutzer. Schülerinnen und Schüler, die KI nicht zum Entwerfen von Aufgaben nutzten, übertrafen auch jene, die sie dafür verwendeten.
Das Muster unterschied sich je nach Aktivität und Häufigkeit. Schülerinnen und Schüler, die KI wöchentlich zum Lernen nutzten, erreichten ähnliche bereinigte Naturwissenschaftsergebnisse wie Nichtnutzer. Jene, die sie fast täglich oder nur gelegentlich nutzten, erzielten tendenziell niedrigere Werte.
Beim Zusammenfassen und bei der ersten Recherche schnitten moderate Nutzer besser ab als sowohl begrenzte als auch intensive Nutzer. Die OECD definierte moderate Nutzung für diese Aufgaben als zwischen einmal monatlich und zweimal wöchentlich.
Beim Entwerfen zeigte sich eine schwächere Variante dieses Vorteils der mittleren Nutzung. Schülerinnen und Schüler, die das Verfassen mit Chatbots vermieden, behielten dennoch den deutlichsten allgemeinen Vorsprung.
Diese Vergleiche bereinigten prognostizierte Naturwissenschaftsergebnisse um den sozioökonomischen Status der Schülerinnen und Schüler. Diese Anpassung ist wichtig, weil die KI-Nutzung nicht gleichmäßig verteilt war.
Häufige Nutzer kamen tendenziell aus privilegierteren Verhältnissen. Nichtnutzer waren eher sozioökonomisch benachteiligt, unter anderem durch eingeschränkten Zugang zu Geräten, zuverlässigen Internetverbindungen oder kostenpflichtigen KI-Diensten.
Selbst unter Berücksichtigung des sozioökonomischen Hintergrunds blieben Nutzungsverhalten und Lernhaltungen schwer voneinander zu trennen. Eine Schülerin oder ein Schüler mit Schwierigkeiten könnte sich an KI wenden, weil die Aufgabe bereits schwierig ist. Eine intensive KI-Nutzung könnte auch den Aufwand verringern, der nötig ist, um selbstständige Fähigkeiten zu entwickeln.
Der Bericht kann nicht bestimmen, welche Richtung überwiegt. Er liefert Querschnittsdaten, das heißt, die Umfrage erfasste Nutzung und Leistung im selben Bewertungszeitraum.
Die OECD behauptet daher nicht, dass das Öffnen eines Chatbots die Punktzahl eines Schülers direkt senkt. Ihre stärkere Schlussfolgerung ist praktischer: Zugang allein sagt kein besseres Lernen voraus.
Diese Schlussfolgerung stellt eine verbreitete Annahme hinter der Einführung von KI im Unterricht infrage. Verfügbarkeit lässt sich leicht zählen, Verständnis hingegen ist deutlich schwerer zu messen.
Bessere Hausaufgaben können schwächeres Lernen verdecken
Generative KI kann die Qualität fertiggestellter Arbeiten steigern und zugleich die Übung schwächen, die Schülerinnen und Schüler auf selbstständiges Arbeiten vorbereitet.
Die Erkenntnisse der OECD passen zu einer breiteren Reihe experimenteller Forschung. Allzweck-Chatbots verbessern häufig die unmittelbare Qualität von Ergebnissen, die während einer unterstützten Aufgabe entstehen. Diese Gewinne können verschwinden, wenn die Unterstützung wegfällt.
Der Digital Education Outlook der Organisation beschreibt dieses Problem als Lücke zwischen Leistung und Lernen. Leistung misst, ob ein Schüler die heutige Aufgabe erfolgreich erledigt hat. Lernen misst, ob der Schüler dieses Wissen später anwenden kann.
Eine Schülerin oder ein Schüler kann einen Chatbot bitten, ein Kapitel zusammenzufassen, und eine präzise, gut lesbare Antwort erhalten. Dieses Ergebnis sagt wenig darüber aus, ob die Person das Hauptargument erkannt, die Belege abgewogen oder den Stoff behalten hat.
Beim Entwerfen entsteht ein noch schärferer Konflikt. Ein Chatbot kann aus einer kurzen Eingabe innerhalb von Sekunden einen strukturierten Aufsatz machen. Die daraus entstehende Abgabe kann Wortschatz und Organisation zeigen, die der Schüler nicht selbstständig reproduzieren kann.
Das sichtbare Produkt verbessert sich, doch der verborgene Lernprozess schrumpft. Der Schüler verbringt weniger Zeit damit, Informationen abzurufen, Unsicherheit aufzulösen, Belege auszuwählen und schwache Argumentation zu überarbeiten.
Diese Schritte können ineffizient wirken. Sie sind zugleich der Ort, an dem ein großer Teil des Lernens stattfindet.
Dieser Mechanismus hilft, die ungewöhnliche Häufigkeitskurve in den PISA-Daten zu erklären. Moderate Nutzung kann einen aktiven Lernprozess ergänzen. Intensive Nutzung schafft mehr Möglichkeiten, diesen Prozess zu ersetzen.
Auch gelegentliche Nutzer können aus mehreren Gründen niedrigere Ergebnisse erzielen. Manche öffnen einen Chatbot nur, wenn sie verwirrt sind oder zurückliegen. Ihre Nutzungshäufigkeit spiegelt dann eine bereits bestehende Schwierigkeit wider, anstatt sie zu verursachen.
Der OECD Digital Education Outlook untersuchte eine kontrollierte Mathematikstudie mit Schülerinnen und Schülern der Oberstufe in Türkiye. Während der Übungsphase erhielten die Schülerinnen und Schüler entweder eine allgemeine GPT-4-Oberfläche oder eine speziell entwickelte Nachhilfeversion.
Das Nachhilfesystem verbesserte die Übungsleistung gegenüber Schülerinnen und Schülern ohne KI-Zugang um 127 Prozent. Der allgemeine Chatbot verbesserte sie um 48 Prozent.
Allerdings erzielten Schülerinnen und Schüler, die mit dem allgemeinen Chatbot übten, in einer Closed-Book-Prüfung 17 Prozent niedrigere Ergebnisse als jene, die nie KI-Zugang erhalten hatten. Die Nachhilfegruppe vermied den größten Teil dieses Nachteils.
Die zugrunde liegende kontrollierte Mathematikstudie bietet einen wichtigen Vergleich. Beide Systeme verwendeten dieselbe zugrunde liegende Modellfamilie, doch ihr Verhalten förderte unterschiedliche Handlungen der Schülerinnen und Schüler.
Die allgemeine Oberfläche lieferte bereitwillig Antworten. Der Tutor enthielt Schutzmechanismen, die Schülerinnen und Schüler durch Probleme führen sollten, ohne die Arbeit sofort zu erledigen.
Dieser Unterschied verlagert die Debatte über die Modellgenauigkeit hinaus. Selbst eine korrekte Antwort kann Lernen untergraben, wenn sie eintrifft, bevor ein Schüler einen selbstständigen Ansatz entwickelt und überprüft.
Bildungs-KI benötigt daher ein weiteres Qualitätsmaß. Entwickler bewerten in der Regel, ob ein Modell korrekt antwortet, Anweisungen befolgt und Nutzer zufriedenstellt. Ein Lernsystem muss auch produktiven Aufwand erhalten.
Produktiver Aufwand bedeutet nicht, jede Antwort vorzuenthalten. Er bedeutet, zum Abrufen von Wissen anzuregen, um eine Erklärung zu bitten, ein Missverständnis zu benennen und Unterstützung aufzuschieben, bis der Lernende das Problem selbst versucht hat.
Ein herkömmlicher Chatbot optimiert auf unmittelbare Hilfsbereitschaft. Ein Bildungstutor muss diesem Impuls manchmal widerstehen.
Dadurch entsteht ein unangenehmer Produktkonflikt. Schülerinnen und Schüler bevorzugen oft Werkzeuge, die Arbeit reduzieren, während Schulen Werkzeuge benötigen, die selbstständige Fähigkeiten verbessern.
Nutzung, Bearbeitungsgeschwindigkeit und Zufriedenheit können das falsche Design belohnen. Ein System, das Aufgaben mühelos macht, kann auf einem Dashboard erfolgreich wirken und gleichzeitig die Prüfungsleistung schwächen.
Die PISA-Ergebnisse von KI nutzenden Schülerinnen und Schülern machen dieses Messproblem auf globaler Ebene sichtbar. Schulen können Bildungstechnologie nicht allein anhand von Nutzung oder Aufgabenqualität beurteilen.
Sie benötigen Belege dafür, dass Fähigkeiten auf Situationen übertragbar sind, in denen der Chatbot fehlt, eingeschränkt ist oder keine fertige Antwort liefern kann.
KI-Kompetenz verändert das Ergebnis
Schülerinnen und Schüler profitierten am meisten, wenn Schulen häufige KI-Nutzung mit expliziter Übung zum Hinterfragen der von ihr erzeugten Informationen verbanden.
Etwa sechs von zehn Schülerinnen und Schülern in den OECD-Ländern gaben an, Unterrichtsaufgaben erhalten zu haben, bei denen KI-generierte Informationen bewertet wurden. Die nationalen Anteile reichten von 31 Prozent bis zu mehr als 80 Prozent.
Von diesen Schülerinnen und Schülern sagten 46 Prozent, dass sie solche Aktivitäten manchmal durchführten. Etwa 33 Prozent taten dies häufig, während 22 Prozent angaben, dies sehr häufig zu tun.
Die Schülerinnen und Schüler erhielten mehr Übung in der Bewertung gewöhnlicher Online-Informationen. Ungefähr acht von zehn sagten, dass sie im Unterricht die Qualität von im Internet gefundenen Informationen bewerten sollten.
Diese Unterscheidung ist wichtig, weil KI-Ausgaben spezifische Herausforderungen schaffen. Ein Chatbot erzeugt flüssige Sprache, selbst wenn seine Argumentation oder Beleglage unvollständig ist.
Ihre Bewertung erfordert gewöhnliche Lesefähigkeiten und ein gewisses Verständnis dafür, wie generative Systeme Antworten konstruieren. Schülerinnen und Schüler müssen Behauptungen prüfen, Quellen nachverfolgen, Unsicherheit erkennen und Antworten mit zuverlässigem Material vergleichen.
PISA stellte bei Schülerinnen und Schülern, die diese Möglichkeiten erhielten, eine moderate, aber bemerkenswerte Umkehr fest. Häufige Nutzer, die lernten, KI-Informationen zu bewerten, übertrafen Nichtnutzer und Schülerinnen und Schüler, die KI höchstens zweimal monatlich nutzten, leicht.
Das Ergebnis beweist nicht, dass Bewertungsunterricht die Verbesserung verursachte. Schulen mit stärkerem KI-Unterricht könnten auch bessere Lehrkräfte, Ressourcen oder umfassendere akademische Unterstützung haben.
Es schwächt jedoch die Annahme, KI-Nutzung sei einheitlich schädlich. Das Bildungsumfeld und das Verhalten der Schülerinnen und Schüler scheinen das Ergebnis zu prägen.
Die Erkenntnisse der OECD zur KI-Kompetenz betonen Interpretation statt passivem Konsum. Dieser Fokus rückt Lesefähigkeit ins Zentrum einer effektiven Chatbot-Nutzung.
Eine nützliche Unterrichtsaufgabe könnte Schülerinnen und Schülern eine KI-generierte Erklärung geben, die korrekte Aussagen, unbelegte Annahmen und ein falsches Zitat enthält. Die Schülerinnen und Schüler würden dann jede Behauptung kommentieren und überprüfen.
Eine weitere Aufgabe könnte Lernende dazu verpflichten, zunächst ohne KI eine erste Antwort zu schreiben. Anschließend könnten sie einen Chatbot um Kritik bitten und erklären, welche Vorschläge sie angenommen oder abgelehnt haben.
Diese Aktivitäten bewahren die Eigenverantwortung der Schülerinnen und Schüler. Das Modell wird zu einem Analyseobjekt oder einer Feedbackquelle statt zu einer automatischen Antwortmaschine.
Sie schaffen zudem Belege, die Lehrkräfte prüfen können. Ein fertiger Aufsatz allein kann verschleiern, wie viel der Argumentation vom Schüler stammt. Entwürfe, Eingaben, Quellennotizen und schriftliche Bewertungen machen den Prozess sichtbar.
Hier können persönliche Wissenspraktiken eine verantwortungsvolle Nutzung unterstützen. Schülerinnen und Schüler, die Quellen und eigene Notizen aufbewahren, können KI-Antworten mit einer Belegspur vergleichen.
Ein strukturierter Arbeitsbereich für Studierende kann dabei helfen, Lektüre, Notizen und Fragen miteinander zu verknüpfen. Der Lernwert hängt jedoch weiterhin davon ab, wie Studierende dieses Material nutzen.
Kritische Bewertung darf nicht zu einer einmaligen Unterrichtseinheit über KI-Sicherheit werden. Sie muss in alltäglichen Aufgaben in Naturwissenschaften, Geschichte, Schreiben und Recherche vorkommen.
Studierende brauchen außerdem die Erlaubnis, eine überzeugend formulierte Antwort infrage zu stellen. Chatbots kommunizieren selbstsicher, und jüngere Nutzer können geschliffene Sprache mit Autorität verwechseln.
Lehrkräfte können diesem Effekt entgegenwirken, indem sie Überprüfung und Korrektur honorieren. Ein Schüler, der eine unbelegte Behauptung eines Modells erkennt, sollte Anerkennung für sein Denken erhalten – nicht nur dafür, die erwartete Antwort zu liefern.
Das Ziel ist nicht Misstrauen um seiner selbst willen. Es geht um angemessenes Vertrauen, das sich an Belegen, Aufgabenart und Unsicherheit orientiert.
Dieser Ansatz entspricht besser den tatsächlichen Auswirkungen von KI auf das Lernen. Dasselbe Modell kann Denkprozesse entweder verkürzen oder Feedback geben, das sie erweitert.
Die Punktedifferenz beweist nicht, dass KI den Rückgang verursacht hat
Die OECD-Daten liefern ein Warnsignal, können Chatbots jedoch nicht von den zahlreichen Faktoren isolieren, die die Leistungen von Schülern beeinflussen.
Schlagzeilen darüber, dass KI-Nutzer schlechter abschneiden, können der Evidenz leicht vorauslaufen. PISA hat nicht zufällig Hunderttausende Schüler der Nutzung oder Nichtnutzung von Chatbots zugeteilt.
Die Schüler beschrieben ihr eigenes Verhalten. Selbstberichtete Nutzungshäufigkeit kann ungenau sein, und Befragte können „mir beim Lernen helfen“ unterschiedlich auslegen.
Ein Schüler könnte KI nutzen, um vollständige Antworten zu erzeugen. Ein anderer könnte Übungsfragen, Feedback oder eine alternative Erklärung anfordern. Beide können in derselben breiten Nutzungskategorie erfasst werden.
Naturwissenschaftliche Ergebnisse spiegeln zudem angesammeltes Wissen wider, nicht nur Aktivitäten aus dem Jahr 2025. Schüler kamen mit unterschiedlichen Schulen, Lehrkräften, familiärer Unterstützung, Motivation und bisherigen Leistungen zur Bewertung.
Auch umgekehrte Kausalität bleibt plausibel. Leistungsschwächere Schüler könnten Chatbots häufiger nutzen, weil sie zusätzliche Hilfe benötigen. Dieses Muster würde niedrigere Werte unter Nutzern erzeugen, ohne zu beweisen, dass KI die Lücke verursacht hat.
Die OECD erkennt diese Einschränkung ausdrücklich an. Sie erklärt, dass die Zusammenhänge nicht zwangsläufig darauf hindeuten, dass KI die Leistungen in den Naturwissenschaften negativ beeinflusst.
Breitere Leistungstrends begannen zudem schon vor der weitverbreiteten Einführung generativer KI. In den OECD-Ländern sanken die Lesewerte zwischen 2015 und 2025 um 28 Punkte. Die Mathematikwerte fielen um 22 Punkte.
Die OECD setzt diese Veränderungen mit ungefähr eineinhalb Lernjahren im Lesen und etwas mehr als einem Lernjahr in Mathematik gleich.
ChatGPT wurde erst Ende 2022 öffentlich verfügbar. Allein kann es einen Rückgang über ein Jahrzehnt nicht erklären.
Pandemiebedingte Störungen, Anwesenheit, familiäre Beteiligung, digitale Ablenkung, Änderungen im Lehrplan und Lernbedingungen gehören alle in die Analyse. Die PISA-Ergebnisse schreiben keinem einzelnen Faktor einen genauen Anteil am Rückgang zu.
Die Leistungen in den Naturwissenschaften blieben im OECD-Durchschnitt zwischen 2022 und 2025 stabil. Diese Stabilität erschwert zusätzlich die Behauptung, die Einführung von Chatbots habe unmittelbar einen allgemeinen Einbruch verursacht.
Gleichzeitig sollte das Fehlen eines Kausalitätsnachweises die Warnung nicht entkräften. Das beobachtete Muster spricht wiederholt eher für Nichtnutzung, moderate Nutzung oder angeleitete Nutzung als für intensive, unbegleitete Unterstützung.
Kontrollierte Studien liefern zudem Mechanismen, die einen Lernnachteil plausibel machen. Wenn Schüler Antworten erhalten, bevor sie versuchen, Wissen abzurufen und zu schlussfolgern, üben sie weniger der Fähigkeiten, die später ohne Unterstützung gemessen werden.
Die überzeugendste Position liegt daher zwischen Panik und Selbstzufriedenheit. PISA beweist nicht, dass KI Schüler weniger intelligent macht. Die Studie zeigt, dass gewöhnliche Nutzung bislang keinen allgemeinen akademischen Vorteil gebracht hat.
Dieses Ergebnis sollte die Beweislast verschieben. Schulen sollten nicht annehmen, ein Chatbot sei pädagogisch wertvoll, nur weil Schüler ihn für Schulaufgaben nutzen.
Auch KI-Entwickler benötigen mehr Nachweise als Engagement-Zahlen. Wenn ein Unternehmen ein Lernprodukt vermarktet, sollte es durch zeitlich verzögerte und unabhängige Bewertungen dauerhafte Fortschritte belegen.
Solche Tests sollten allgemeine Chatbots, eingeschränkte Tutoring-Tools, lehrergeleitete Nutzung und Übungen ohne KI vergleichen. Sie sollten außerdem verfolgen, ob Vorteile über Fächer und Schülergruppen hinweg bestehen bleiben.
Gerechtigkeit fügt eine weitere Unsicherheit hinzu. Benachteiligte Schüler erhielten seltener Aufgaben im Unterricht, bei denen KI-generierte Informationen bewertet werden sollten.
Sie waren zudem häufiger Nichtnutzer, möglicherweise wegen eingeschränkten Zugangs. Den Zugang ohne mehr Anleitung auszuweiten, könnte eine Kluft durch eine andere ersetzen.
Das zentrale Risiko besteht nicht einfach darin, dass manche Schüler bessere Modelle haben. Es besteht darin, dass manche lernen, Modelle kritisch zu befragen, während andere nur sofortige Antworten erhalten.
Schulen müssen Aufgaben neu gestalten, nicht nur Chatbots überwachen
Die Ergebnisse verlagern den Druck von pauschalen Zugangsentscheidungen hin zur Gestaltung von Aufgaben, Prüfungen und KI-Produkten.
Schulen behandelten generative KI zunächst vor allem als Problem der akademischen Integrität. Diese Sorge bleibt erheblich.
In einer separaten OECD-Lehrerbefragung gaben 72 Prozent der Lehrkräfte der unteren Sekundarstufe an, KI könne die Integrität beeinträchtigen, indem Schüler generierte Arbeiten als ihre eigenen ausgeben.
Erkennung allein ist eine schwache Antwort. KI-Detektoren schätzen, ob ein Text maschinell unterstütztem Schreiben ähnelt, können aber nicht zuverlässig rekonstruieren, wie ein Schüler eine Aufgabe erstellt hat.
Ein Schüler könnte KI für Brainstorming, Grammatik-Feedback, unbelegtes Ausformulieren oder vollständigen Ersatz nutzen. Der Endtext offenbart diese Unterschiede selten eindeutig.
Das Prüfungsdesign kann aussagekräftigere Belege liefern. Lehrkräfte können Gliederungen, Quellenanmerkungen, Zwischenentwürfe, mündliche Erklärungen oder kurze beaufsichtigte Nachbesprechungen verlangen.
Diese Methoden machen Denkprozesse sichtbar. Sie bleiben auch nützlich, wenn eine Schule bestimmte Formen von KI-Unterstützung erlaubt.
Prüfungen ohne Hilfsmittel liefern ein Maß für selbstständige Fähigkeiten. Sie sollten nicht zur einzigen Antwort werden, denn Lernen umfasst auch Recherche, Zusammenarbeit, Überarbeitung und den Einsatz von Werkzeugen.
Ein ausgewogenes System kann beide Modi bewerten. Schüler sollten grundlegendes Wissen ohne KI und verantwortungsvolle Anwendung mit KI zeigen.
Die globale Veröffentlichung der OECD plädiert für einen zielgerichteten, moderaten Technologieeinsatz. Sie warnt zugleich davor, Aufmerksamkeit, Anstrengung und Verständnis zu ersetzen.
Dieses Prinzip gibt Schulen einen praktikablen Maßstab. Eine Aufgabe sollte festlegen, welche kognitive Arbeit beim Schüler liegt und wo KI beitragen darf.
Eine Lehrkraft könnte KI beispielsweise beim anfänglichen Lösen einer Aufgabe untersagen, sie aber während der Überarbeitung erlauben. Schüler könnten ihren Ansatz dann mit der Antwort des Modells vergleichen.
Eine Geschichtsaufgabe könnte die Erkundung eines Themas erlauben, zugleich aber verlangen, dass jede Tatsachenbehauptung mit einer zugelassenen Quelle verknüpft wird. Schüler würden eine kurze Erklärung zu allen verworfenen KI-Vorschlägen einreichen.
Ein Schreibkurs könnte Chatbots als Kritiker statt als Autoren einsetzen. Das Modell könnte unklare Passagen markieren, doch der Schüler würde entscheiden, wie sie überarbeitet werden.
Diese Designs machen die KI-Nutzung langsamer als das Kopieren einer Antwort. Diese Reibung ist wertvoll, wenn sie Lernende dazu zwingt, ihr eigenes Denken zu prüfen.
Entwickler stehen vor einer parallelen Gestaltungsaufgabe. Bildungsmodi brauchen mehr als einen freundlichen Ton, vereinfachte Erklärungen oder altersgerechte Interface-Kontrollen.
Ein glaubwürdiger Tutor sollte Fehlvorstellungen diagnostizieren, Schüler dazu bringen, sich auf eine Antwort festzulegen, und Hinweise schrittweise anpassen. Er sollte vermeiden, die zentrale intellektuelle Aufgabe zu früh zu erledigen.
Lehrkräfte benötigen außerdem Einblick in die Interaktion. Ein nützliches Klassenzimmersystem könnte die bearbeiteten Konzepte, angeforderten Hinweise und korrigierten Fehler zusammenfassen, ohne unnötige persönliche Daten offenzulegen.
Datenschutz und Sicherheit bleiben wichtig, insbesondere bei Minderjährigen. Schulen brauchen klare Regeln zu Datenspeicherung, Modelltraining, Altersangemessenheit und dem Zugang zu Schülergesprächen.
Auch die Vorbereitung von Lehrkräften ist ein weiterer Druckpunkt. Die OECD berichtet, dass 37 Prozent der Lehrkräfte der unteren Sekundarstufe KI 2024 für ihre Arbeit nutzten.
Lehrkräfte können das Verhalten von Schülern nicht allein mit Richtliniendokumenten lenken. Sie benötigen fachspezifische Beispiele, die zeigen, wann KI das Lernen unterstützt und wann sie unverzichtbare Übung ersetzt.
Der richtige Ansatz wird je nach Fach variieren. Rechnerähnliche Unterstützung könnte angemessen sein, nachdem ein mathematisches Konzept beherrscht wird, aber während seiner Einführung schaden.
Sprachlernende können von Gesprächsübungen profitieren. Sie brauchen weiterhin Möglichkeiten, Vokabeln abzurufen und Sätze ohne automatische Vervollständigung zu bilden.
Die Frage lautet daher nicht, ob jedes Klassenzimmer KI einführen oder verbieten sollte. Entscheidend ist, ob jede Nutzung die geistige Tätigkeit bewahrt, die der Unterricht entwickeln soll.
Drei Signale werden zeigen, ob Bildungs-KI besser wird
Die nächste Phase sollte anhand selbstständigen Lernens, des Zugangs zu angeleiteter Nutzung und des Produktverhaltens beurteilt werden – nicht anhand der bloßen Verbreitung von Chatbots.
Das erste Signal ist Leistung ohne Unterstützung. Schulen und Forschende benötigen zeitlich verzögerte Bewertungen, die prüfen, ob Schüler nach der Nutzung von KI Fähigkeiten behalten und übertragen können.
Die unmittelbare Qualität einer Aufgabe reicht nicht aus. Ein nützliches System sollte Ergebnisse verbessern, wenn das Tool nicht verfügbar ist und wenn die Frage vom Übungsbeispiel abweicht.
Wenn künftige randomisierte Studien nachhaltige Fortschritte über verschiedene Fächer hinweg zeigen, wird die OECD-Warnung schwächer. Wenn überzeugend formulierte Hausaufgaben weiterhin schwächeren Prüfungen vorausgehen, wird sie stärker.
Das zweite Signal ist der Zugang zu explizitem Unterricht zur Bewertung von KI. PISA stellte fest, dass etwa sechs von zehn Schülern im Unterricht Gelegenheit erhielten, KI-generierte Informationen zu bewerten.
Dieser Anteil sollte steigen, doch Teilnahme allein genügt nicht. Forschende sollten Qualität, Häufigkeit und fachliche Einbindung dieser Unterrichtseinheiten messen.
Sie sollten außerdem die sozioökonomische Lücke beobachten. Benachteiligte Schüler berichten derzeit von weniger Möglichkeiten, KI-Ausgaben im Unterricht zu bewerten.
Wenn sich diese Lücke schließt und angeleitete Nutzer bessere Ergebnisse erzielen, wird KI-Kompetenz wie eine bedeutsame Intervention wirken. Wenn der Zugang ohne selbstständige Fortschritte wächst, werden Schulen tiefgreifendere didaktische Veränderungen benötigen.
Das dritte Signal ist, ob Bildungsprodukte den Ersatz eigener Antworten verhindern. Entwickler sollten erklären, wie Tutoring-Modi das Denken der Schüler bewahren und wie sie Lernen messen, nachdem die Unterstützung endet.
Nützliche Nachweise würden unabhängige Bewertungen, transparente Studiendesigns und Vergleiche mit gewöhnlichen Chatbots umfassen. Engagement-Zahlen können die Bildungsfrage nicht beantworten.
Auch das Produktverhalten während der alltäglichen Nutzung ist wichtig. Fordert der Tutor einen Lösungsversuch, bevor er eine Lösung liefert? Verlangt er Belege und macht er Unsicherheit sichtbar?
Können Lehrkräfte für jede Aufgabe die verfügbare Art der Hilfe konfigurieren? Können Schüler nachvollziehen, wie sich ihr Denken verändert hat, statt nur eine fertige Antwort zu erhalten?
Diese Entscheidungen werden bestimmen, ob KI zu einer Abkürzung, einem Tutor oder einer ungleichen Mischung aus beidem wird.
Der OECD-Bericht zur KI-Bildung rechtfertigt nicht, so zu tun, als würden Chatbots aus Schulen verschwinden. Die meisten befragten Schüler hatten sie bereits genutzt, und Durchsetzung kann diese Realität nicht umkehren.
Er rechtfertigt jedoch einen höheren Maßstab. Schüler sollten eine KI-unterstützte Aufgabe mit mehr Wissen verlassen, als sie zuvor hatten – nicht bloß mit einem besseren Text.
Eltern und Lernende können denselben Test sofort anwenden. Nach der Nutzung eines Chatbots sollten sie ihn schließen und die Idee erklären, ein verwandtes Problem lösen oder die Antwort mit Quellen verteidigen.
Wenn das Verständnis mit dem Chatfenster verschwindet, hat das Tool die Arbeit erledigt, aber das Lernen nicht unterstützt. Die nächste Frage ist, ob Schulen und Entwickler für diese Unterscheidung gestalten werden.



