Le rapport de l’OCDE sur l’IA dans l’éducation constate que les élèves qui utilisent l’IA obtiennent généralement de moins bons résultats
Le rapport de l’OCDE sur l’IA dans l’éducation met en lumière un conflit difficile : la plupart des élèves utilisant des chatbots pour leurs travaux scolaires ont obtenu des scores inférieurs à ceux des élèves qui les évitaient. Cette tendance est apparue dans une évaluation de 2025 portant sur 760 000 jeunes de 15 ans dans 91 pays et économies.
Ce titre ne signifie pas que chaque élève devrait fermer ChatGPT ou Gemini. Les utilisateurs modérés ont parfois obtenu de meilleurs résultats que les utilisateurs occasionnels ou intensifs. Les utilisateurs fréquents ont également bénéficié d’un léger avantage lorsque les établissements leur apprenaient à évaluer les informations générées par l’IA.
La véritable ligne de fracture n’oppose donc pas les utilisateurs d’IA aux non-utilisateurs. Elle oppose la délégation cognitive à une pratique guidée. Un chatbot peut produire une réponse soignée sans garantir que son utilisateur comprend la question, les éléments de preuve ou le raisonnement qui la sous-tendent.
Cette distinction pousse les établissements, les familles et les développeurs d’IA à repenser ce que devrait mesurer l’adoption dans l’éducation. Des devoirs réalisés plus rapidement et des rendus plus convaincants ne traduisent pas automatiquement un apprentissage. La capacité à réussir de manière autonome demeure le test le plus exigeant et le plus important.
Ce que le rapport de l’OCDE sur l’IA dans l’éducation a réellement révélé
Les élèves qui évitaient l’IA pour leurs travaux scolaires surpassaient généralement les utilisateurs, mais ce résultat décrit une association et non un préjudice démontré.
L’OCDE a publié ses résultats PISA 2025 le 8 septembre 2026. PISA, le Programme international pour le suivi des acquis des élèves, mesure la manière dont les jeunes de 15 ans appliquent leurs connaissances à des problèmes inconnus.
L’évaluation de 2025 constituait la plus grande édition du programme. Elle a couvert 760 000 élèves dans 91 pays et économies participants. Les sciences en étaient la matière principale, tandis que la compréhension de l’écrit et les mathématiques apportaient des mesures complémentaires des connaissances fondamentales.
Pour la première fois, PISA a recueilli des informations détaillées sur la fréquence à laquelle les élèves utilisaient des chatbots d’IA pour leurs travaux scolaires. Les questions portaient sur quatre activités courantes.
Les élèves ont indiqué s’ils utilisaient des chatbots pour les aider à apprendre, faire des recherches sur un nouveau sujet, résumer des lectures imposées ou rédiger des travaux écrits. L’enquête distinguait également un usage occasionnel, modéré, hebdomadaire et presque quotidien.
L’IA était déjà devenue courante pour la plupart des élèves. Dans les pays de l’OCDE, seuls 14 % ont déclaré ne jamais, ou presque jamais, utiliser de chatbots pour chacune des activités scolaires examinées.
Pourtant, les non-utilisateurs obtenaient généralement de meilleurs scores en sciences que les utilisateurs. Les élèves qui n’utilisaient pas l’IA pour rédiger leurs devoirs surpassaient également ceux qui déclaraient y recourir à cette fin.
La tendance variait selon l’activité et la fréquence. Les élèves utilisant l’IA chaque semaine pour les aider à apprendre obtenaient des scores ajustés en sciences comparables à ceux des non-utilisateurs. Ceux qui l’utilisaient presque tous les jours, ou seulement occasionnellement, avaient tendance à obtenir de moins bons résultats.
Pour la synthèse et les recherches préliminaires, les utilisateurs modérés réussissaient mieux que les utilisateurs limités comme intensifs. L’OCDE définissait un usage modéré pour ces tâches comme une fréquence allant d’une fois par mois à deux fois par semaine.
La rédaction présentait une version plus faible de cet avantage lié à un usage intermédiaire. Les élèves qui évitaient de confier leurs rédactions à un chatbot conservaient néanmoins l’avantage général le plus net.
Ces comparaisons ajustaient les scores prédits en sciences selon le statut socioéconomique des élèves. Cet ajustement importe, car l’adoption de l’IA n’était pas répartie uniformément.
Les utilisateurs fréquents avaient tendance à provenir de milieux plus favorisés. Les non-utilisateurs étaient plus susceptibles de rencontrer des désavantages socioéconomiques, notamment un accès limité aux appareils, à des connexions internet fiables ou à des services d’IA payants.
Même en tenant compte du milieu socioéconomique, il restait difficile de dissocier les comportements d’usage et les dispositions d’apprentissage. Un élève en difficulté peut se tourner vers l’IA parce que le travail est déjà difficile. Un usage intensif de l’IA peut aussi réduire l’effort nécessaire au développement de compétences autonomes.
Le rapport ne peut pas déterminer quel sens prévaut. Il fournit des données transversales, ce qui signifie que l’enquête a saisi l’usage et la performance durant la même période d’évaluation.
L’OCDE n’affirme donc pas qu’ouvrir un chatbot fait directement baisser le score d’un élève. Sa conclusion plus solide est plus pratique : l’accès seul ne prédit pas un meilleur apprentissage.
Cette conclusion remet en cause une hypothèse courante qui sous-tend l’adoption de l’IA en classe. La disponibilité est facile à compter, tandis que la compréhension est bien plus difficile à mesurer.
De meilleurs devoirs peuvent masquer un apprentissage plus faible
L’IA générative peut améliorer la qualité du travail terminé tout en affaiblissant la pratique qui prépare les élèves à travailler de manière autonome.
Les conclusions de l’OCDE s’inscrivent dans un ensemble plus large de recherches expérimentales. Les chatbots généralistes améliorent souvent le résultat immédiat produit lors d’une tâche assistée. Ces gains peuvent disparaître lorsque l’assistance est retirée.
Les perspectives de l’éducation numérique de l’organisation décrivent ce problème comme un écart entre performance et apprentissage. La performance mesure si un élève a réussi la tâche du jour. L’apprentissage mesure s’il peut appliquer ces connaissances ultérieurement.
Un élève peut demander à un chatbot de résumer un chapitre et recevoir une réponse exacte et lisible. Ce résultat indique peu de choses sur sa capacité à identifier l’argument principal, évaluer les éléments de preuve ou retenir le contenu.
La rédaction crée un conflit encore plus marqué. Un chatbot peut transformer une courte consigne en dissertation structurée en quelques secondes. Le rendu final peut afficher un vocabulaire et une organisation que l’élève est incapable de reproduire de manière autonome.
Le produit visible s’améliore, mais le processus d’apprentissage caché se réduit. L’élève consacre moins de temps à retrouver des informations, résoudre des incertitudes, sélectionner des éléments de preuve et réviser un raisonnement fragile.
Ces étapes peuvent sembler inefficaces. C’est aussi là qu’une grande partie de l’apprentissage se produit.
Ce mécanisme aide à expliquer la courbe de fréquence inhabituelle des données PISA. Un usage modéré peut compléter un processus d’apprentissage actif. Un usage intensif offre davantage d’occasions de remplacer ce processus.
Les utilisateurs occasionnels peuvent également obtenir de moins bons résultats pour plusieurs raisons. Certains n’ouvrent un chatbot que lorsqu’ils sont perdus ou en retard. Leur fréquence d’usage reflète alors une difficulté préexistante plutôt qu’elle ne la provoque.
Les Perspectives de l’éducation numérique de l’OCDE ont examiné une étude contrôlée de mathématiques menée auprès de lycéens en Türkiye. Pendant les exercices, les élèves recevaient soit une interface générale GPT-4, soit une version de tutorat spécialement conçue.
Le système de tutorat a amélioré de 127 % la performance pendant les exercices par rapport aux élèves sans accès à l’IA. Le chatbot généraliste l’a améliorée de 48 %.
Cependant, les élèves qui s’étaient entraînés avec le chatbot généraliste ont obtenu des scores inférieurs de 17 % lors d’un examen sans documents par rapport aux élèves n’ayant jamais bénéficié d’un accès à l’IA. Le groupe utilisant le tutorat a évité l’essentiel de cette pénalité.
L’étude contrôlée de mathématiques sous-jacente offre une comparaison importante. Les deux systèmes utilisaient la même famille de modèles sous-jacente, mais leur comportement encourageait différentes actions chez les élèves.
L’interface générale fournissait facilement des réponses. Le tuteur comprenait des garde-fous destinés à guider les élèves à travers les problèmes sans effectuer immédiatement le travail à leur place.
Cette différence déplace le débat au-delà de l’exactitude du modèle. Même une réponse correcte peut nuire à l’apprentissage lorsqu’elle arrive avant qu’un élève ne formule et ne teste une démarche autonome.
L’IA éducative a donc besoin d’une autre mesure de qualité. Les développeurs évaluent habituellement si un modèle répond correctement, suit les instructions et satisfait les utilisateurs. Un système d’apprentissage doit aussi préserver l’effort productif.
L’effort productif n’exige pas de retenir chaque réponse. Il consiste à solliciter le rappel, demander une explication, identifier une idée fausse et différer l’assistance jusqu’à ce que l’apprenant tente de résoudre le problème.
Un chatbot classique optimise l’aide immédiate. Un tuteur éducatif doit parfois résister à cette impulsion.
Cela crée un conflit de produit inconfortable. Les élèves préfèrent souvent les outils qui réduisent le travail, tandis que les établissements ont besoin d’outils qui améliorent les capacités autonomes.
L’usage, la vitesse d’exécution et la satisfaction peuvent récompenser une mauvaise conception. Un système qui rend les devoirs sans effort peut sembler performant sur un tableau de bord tout en affaiblissant les résultats aux examens.
Les scores des élèves dans PISA sur l’IA rendent ce problème de mesure visible à l’échelle mondiale. Les établissements ne peuvent pas évaluer les technologies éducatives uniquement à travers l’adoption ou la qualité des devoirs.
Ils ont besoin de preuves que les compétences se transfèrent dans des situations où le chatbot est absent, restreint ou incapable de fournir une réponse toute faite.
La culture de l’IA change le résultat
Les élèves ont le plus bénéficié lorsque les établissements ont associé un usage fréquent de l’IA à un entraînement explicite à questionner les informations qu’elle produit.
Environ six élèves sur dix dans les pays de l’OCDE ont déclaré avoir reçu en classe des devoirs impliquant l’évaluation d’informations générées par l’IA. Les proportions nationales allaient de 31 % à plus de 80 %.
Parmi ces élèves, 46 % ont indiqué réaliser parfois de telles activités. Environ 33 % le faisaient souvent, tandis que 22 % ont déclaré le faire très souvent.
Les élèves recevaient davantage d’entraînement à l’évaluation des informations ordinaires en ligne. Environ huit sur dix ont déclaré que les cours leur avaient demandé d’évaluer la qualité d’informations trouvées sur internet.
Cette distinction importe, car les résultats de l’IA posent des difficultés spécifiques. Un chatbot produit un langage fluide même lorsque son raisonnement ou ses éléments de preuve sont incomplets.
Les évaluer exige des compétences habituelles en lecture ainsi qu’une certaine compréhension de la manière dont les systèmes génératifs construisent leurs réponses. Les élèves doivent examiner les affirmations, remonter aux sources, reconnaître l’incertitude et comparer les réponses à des sources fiables.
PISA a relevé un renversement modeste mais notable chez les élèves qui recevaient ces occasions. Les utilisateurs fréquents qui apprenaient à évaluer les informations produites par l’IA surpassaient légèrement les non-utilisateurs et les élèves utilisant l’IA deux fois par mois ou moins.
Le résultat ne prouve pas que les leçons d’évaluation ont causé l’amélioration. Les établissements offrant une formation plus solide à l’IA peuvent également disposer de meilleurs enseignants, de davantage de ressources ou d’un soutien scolaire plus large.
Il affaiblit toutefois l’idée selon laquelle l’usage de l’IA serait uniformément néfaste. Le cadre éducatif et le comportement de l’élève semblent façonner le résultat.
Les conclusions de l’OCDE sur la culture de l’IA mettent l’accent sur l’interprétation plutôt que sur la consommation passive. Cette approche place la capacité de lecture au cœur d’un usage efficace des chatbots.
Un exercice utile en classe pourrait fournir aux élèves une explication générée par l’IA contenant des affirmations exactes, des hypothèses non étayées et une fausse citation. Les élèves annoteraient ensuite chaque affirmation et en vérifieraient la validité.
Un autre devoir pourrait demander aux apprenants de rédiger une première réponse sans IA. Ils pourraient ensuite demander une critique à un chatbot, puis expliquer quelles suggestions ils ont acceptées ou rejetées.
Ces activités préservent l’appropriation du travail par les élèves. Le modèle devient un objet d’analyse ou une source de retours, plutôt qu’une machine à réponses automatiques.
Elles créent également des preuves que les enseignants peuvent examiner. Une dissertation finale seule peut masquer la part de raisonnement provenant de l’élève. Les brouillons, invites, notes de sources et jugements écrits révèlent le processus.
C’est là que les pratiques de gestion des connaissances personnelles peuvent soutenir un usage responsable. Les élèves qui conservent leurs sources et leurs propres notes peuvent comparer les réponses de l’IA à une trace des éléments de preuve.
Un espace de travail étudiant structuré peut aider à maintenir les lectures, les notes et les questions connectées. La valeur pédagogique dépend toujours de la manière dont l’étudiant utilise ces ressources.
L’évaluation critique ne peut pas se limiter à une leçon ponctuelle sur la sécurité de l’IA. Elle doit s’intégrer aux tâches ordinaires de sciences, d’histoire, d’écriture et de recherche.
Les étudiants doivent aussi être autorisés à remettre en question une réponse formulée avec aisance. Les chatbots communiquent avec assurance, et les jeunes utilisateurs peuvent confondre un langage soigné avec de l’autorité.
Les enseignants peuvent contrer cet effet en valorisant la vérification et la correction. Un étudiant qui repère une affirmation non étayée d’un modèle devrait être récompensé pour son raisonnement, et pas seulement pour avoir donné la réponse attendue.
L’objectif n’est pas la méfiance pour elle-même. Il s’agit d’une confiance calibrée selon les preuves, le type de tâche et l’incertitude.
Cette approche correspond mieux à l’impact réel de l’IA sur l’apprentissage. Un même modèle peut soit écourter la réflexion, soit fournir un retour qui la prolonge.
L’écart de scores ne prouve pas que l’IA a causé le déclin
Les données de l’OCDE identifient un signal d’alerte, mais elles ne permettent pas d’isoler l’effet des chatbots parmi les nombreuses forces qui influencent les résultats des élèves.
Les titres affirmant que les utilisateurs d’IA obtiennent de moins bons résultats peuvent facilement aller au-delà des preuves disponibles. PISA n’a pas réparti aléatoirement des centaines de milliers d’élèves entre l’usage ou le non-usage de chatbots.
Les élèves ont décrit leur propre comportement. La fréquence déclarée peut être imprécise, et les répondants peuvent interpréter différemment l’expression « m’aider à apprendre ».
Un élève peut utiliser l’IA pour générer des réponses complètes. Un autre peut lui demander des questions d’entraînement, un retour ou une explication alternative. Tous deux peuvent relever de la même grande catégorie d’usage.
Les scores en sciences reflètent aussi des connaissances accumulées, et non uniquement les activités réalisées en 2025. Les élèves sont arrivés à l’évaluation avec des établissements, des enseignants, un soutien familial, une motivation et des acquis antérieurs différents.
La causalité inverse reste plausible. Les élèves ayant de moins bons résultats pourraient s’appuyer plus souvent sur les chatbots parce qu’ils ont besoin d’une aide supplémentaire. Cette tendance produirait des scores plus faibles chez les utilisateurs sans prouver que l’IA a créé l’écart.
L’OCDE reconnaît ouvertement cette limite. Elle indique que ces relations ne signifient pas nécessairement que l’IA affecte négativement les résultats en sciences.
Les tendances plus générales en matière de réussite ont également commencé avant l’adoption généralisée de l’IA générative. Dans les pays de l’OCDE, les scores en lecture ont chuté de 28 points entre 2015 et 2025. Les scores en mathématiques ont baissé de 22 points.
L’OCDE assimile ces évolutions à environ un an et demi d’apprentissage en lecture et à un peu plus d’un an en mathématiques.
ChatGPT n’est devenu publiquement disponible qu’à la fin de 2022. Il ne peut pas expliquer à lui seul un déclin sur dix ans.
Les perturbations liées à la pandémie, l’assiduité, l’implication des familles, les distractions numériques, les changements de programme et les conditions d’apprentissage doivent tous entrer dans l’analyse. Les résultats PISA n’attribuent pas une part précise du déclin à chaque facteur.
Les performances en sciences sont restées stables entre 2022 et 2025 dans la moyenne de l’OCDE. Cette stabilité complique encore les affirmations selon lesquelles l’adoption des chatbots aurait provoqué un effondrement global immédiat.
En même temps, l’absence de preuve causale ne devrait pas effacer l’avertissement. Le schéma observé favorise de façon répétée le non-usage, un usage modéré ou un usage guidé plutôt qu’une assistance intensive et non encadrée.
Des études contrôlées fournissent aussi des mécanismes qui rendent crédible un coût pour l’apprentissage. Lorsque les élèves reçoivent les réponses avant de tenter de les retrouver et de raisonner, ils exercent moins de compétences qui seront ensuite mesurées sans assistance.
La position la plus solide se situe donc entre la panique et la complaisance. PISA ne prouve pas que l’IA rend les élèves moins intelligents. Il montre que l’adoption ordinaire n’a pas apporté d’avantage scolaire généralisé.
Cette conclusion devrait modifier la charge de la preuve. Les écoles ne devraient pas présumer qu’un chatbot est pédagogique simplement parce que les élèves l’utilisent pour leurs travaux scolaires.
Les développeurs d’IA ont également besoin de preuves allant au-delà de l’engagement. Si une entreprise commercialise un produit d’apprentissage, elle devrait démontrer des gains durables au moyen d’évaluations différées et indépendantes.
De tels tests devraient comparer les chatbots généralistes, les outils de tutorat contraints, l’usage guidé par les enseignants et l’entraînement sans IA. Ils devraient aussi suivre la persistance des bénéfices selon les matières et les groupes d’élèves.
L’équité ajoute une autre incertitude. Les élèves défavorisés étaient moins susceptibles de recevoir en classe des tâches impliquant l’évaluation d’informations générées par l’IA.
Ils étaient également plus souvent non-utilisateurs, potentiellement en raison d’un accès limité. Étendre l’accès sans étendre l’accompagnement pourrait remplacer une fracture par une autre.
Le risque central n’est pas seulement que certains élèves disposent de meilleurs modèles. C’est que certains apprennent à interroger les modèles tandis que d’autres ne reçoivent que des réponses instantanées.
Les écoles doivent repenser les tâches, pas seulement surveiller les chatbots
Les résultats déplacent la pression des décisions générales d’accès vers la conception des devoirs, des évaluations et des produits d’IA.
Les écoles ont d’abord considéré l’IA générative principalement comme un problème d’intégrité académique. Cette préoccupation reste importante.
Dans une enquête distincte de l’OCDE auprès des enseignants, 72 pour cent des enseignants du premier cycle du secondaire ont déclaré que l’IA peut nuire à l’intégrité en permettant aux élèves de présenter un travail généré comme étant le leur.
La détection seule offre une réponse limitée. Les détecteurs d’IA estiment si un texte ressemble à une rédaction assistée par machine, mais ils ne reconstituent pas de manière fiable la façon dont un élève a produit un devoir.
Un élève peut utiliser l’IA pour réfléchir à des idées, obtenir des retours de grammaire, rédiger sans fondement ou remplacer entièrement son travail. Le texte final révèle rarement ces différences de manière nette.
La conception des évaluations peut recueillir des preuves plus utiles. Les enseignants peuvent demander des plans, des annotations de sources, des brouillons intermédiaires, des explications orales ou de courts suivis supervisés.
Ces méthodes rendent le raisonnement visible. Elles restent également utiles lorsqu’une école autorise certaines formes d’assistance par IA.
Les examens sans documents fournissent une mesure de la capacité autonome. Ils ne devraient pas devenir la seule réponse, car l’apprentissage comprend aussi la recherche, la collaboration, la révision et l’usage d’outils.
Un système équilibré peut évaluer les deux modes. Les élèves devraient démontrer des connaissances fondamentales sans IA et une application responsable avec l’IA.
La publication mondiale de l’OCDE plaide pour un usage intentionnel et modéré de la technologie. Elle met également en garde contre le remplacement de l’attention, de l’effort et de la compréhension.
Ce principe donne aux écoles une norme applicable. Un devoir devrait préciser quel travail cognitif revient à l’élève et où l’IA peut contribuer.
Par exemple, un enseignant pourrait interdire l’IA lors de la résolution initiale d’un problème, mais l’autoriser pendant la révision. Les élèves pourraient ensuite comparer leur approche avec la réponse du modèle.
Un devoir d’histoire pourrait autoriser l’exploration d’un sujet tout en exigeant que chaque affirmation factuelle soit reliée à une source approuvée. Les élèves remettraient une courte explication de toute suggestion de l’IA qu’ils ont rejetée.
Un cours d’écriture pourrait utiliser les chatbots comme critiques plutôt que comme auteurs. Le modèle pourrait signaler des passages peu clairs, mais l’élève déciderait de la manière de les réviser.
Ces conceptions rendent l’usage de l’IA plus lent que la copie d’une réponse. Cette friction est précieuse lorsqu’elle oblige les apprenants à examiner leur propre raisonnement.
Les développeurs font face à un défi de conception parallèle. Les modes éducatifs nécessitent davantage qu’un ton amical, des explications simplifiées ou des contrôles d’interface adaptés à l’âge.
Un tuteur crédible devrait diagnostiquer les idées fausses, demander aux élèves de s’engager sur une réponse et ajuster progressivement les indices. Il devrait éviter d’accomplir trop tôt la tâche intellectuelle centrale.
Les enseignants ont également besoin de visibilité sur l’interaction. Un système de classe utile pourrait résumer les concepts tentés, les indices demandés et les erreurs corrigées sans exposer de données personnelles inutiles.
La confidentialité et la sécurité restent importantes, en particulier pour les mineurs. Les écoles ont besoin de règles claires sur la conservation des données, l’entraînement des modèles, l’adéquation à l’âge et l’accès aux conversations des élèves.
La préparation des enseignants constitue un autre point de pression. L’OCDE rapporte que 37 pour cent des enseignants du premier cycle du secondaire ont utilisé l’IA dans leur travail en 2024.
Les enseignants ne peuvent pas guider le comportement des élèves au moyen de seuls documents de politique. Ils ont besoin d’exemples propres à leur discipline montrant quand l’IA soutient l’apprentissage et quand elle élimine une pratique essentielle.
La bonne approche variera selon la discipline. Une assistance comparable à une calculatrice peut être appropriée après la maîtrise d’un concept mathématique, mais nuisible lors de son introduction.
Les apprenants en langues peuvent bénéficier d’une pratique conversationnelle. Ils ont toujours besoin d’occasions de retrouver du vocabulaire et de construire des phrases sans complétion automatique.
La question n’est donc pas de savoir si chaque classe devrait adopter ou interdire l’IA. Elle est de savoir si chaque usage préserve l’action mentale que la leçon vise à développer.
Trois signaux montreront si l’IA éducative s’améliore
La prochaine phase devrait être évaluée à travers l’apprentissage indépendant, l’accès à un usage guidé et le comportement des produits, plutôt qu’à travers la simple adoption des chatbots.
Le premier signal est la performance sans assistance. Les écoles et les chercheurs ont besoin d’évaluations différées qui déterminent si les élèves retiennent et transfèrent leurs compétences après avoir utilisé l’IA.
La qualité immédiate des devoirs ne suffit pas. Un système utile devrait améliorer les résultats lorsque l’outil n’est pas disponible et lorsque la question diffère de l’exemple d’entraînement.
Si de futures études randomisées montrent des gains durables dans toutes les matières, l’avertissement de l’OCDE perdra en force. Si des devoirs soignés continuent de précéder des examens plus faibles, il se renforcera.
Le deuxième signal est l’accès à un enseignement explicite sur l’évaluation de l’IA. PISA a constaté qu’environ six élèves sur dix avaient bénéficié d’une certaine pratique en classe pour évaluer des informations générées par l’IA.
Cette part devrait augmenter, mais la participation seule ne suffit pas. Les chercheurs devraient mesurer la qualité, la fréquence et l’intégration disciplinaire de ces leçons.
Ils devraient également surveiller l’écart socioéconomique. Les élèves défavorisés déclarent actuellement moins d’occasions d’évaluer les résultats de l’IA pendant les cours.
Si cet écart se réduit tandis que les utilisateurs guidés progressent, la littératie en IA apparaîtra comme une intervention significative. Si l’accès s’étend sans gains indépendants, les écoles auront besoin de changements pédagogiques plus profonds.
Le troisième signal est la capacité des produits éducatifs à résister à la substitution des réponses. Les développeurs devraient expliquer comment les modes de tutorat préservent le raisonnement des élèves et comment ils mesurent l’apprentissage une fois l’assistance terminée.
Des éléments utiles incluraient des évaluations indépendantes, des protocoles d’étude transparents et des comparaisons avec des chatbots ordinaires. Les chiffres d’engagement ne peuvent pas répondre à la question éducative.
Le comportement du produit compte également au quotidien. Le tuteur demande-t-il une tentative avant de fournir une solution ? Demande-t-il des preuves et révèle-t-il l’incertitude ?
Les enseignants peuvent-ils configurer le type d’aide disponible pour chaque tâche ? Les élèves peuvent-ils examiner comment leur raisonnement a évolué au lieu de ne recevoir qu’une réponse terminée ?
Ces choix détermineront si l’IA devient un raccourci, un tuteur ou un mélange inégal des deux.
Le rapport de l’OCDE sur l’éducation et l’IA ne justifie pas de prétendre que les chatbots disparaîtront de l’école. La plupart des élèves interrogés les avaient déjà utilisés, et l’application des règles ne peut pas inverser cette réalité.
Il justifie en revanche une exigence plus élevée. Les élèves devraient terminer une tâche assistée par IA en sachant davantage qu’auparavant, et non simplement en disposant d’un meilleur texte.
Les parents et les apprenants peuvent appliquer immédiatement le même test. Après avoir utilisé un chatbot, fermez-le et expliquez l’idée, résolvez un problème connexe ou défendez la réponse avec des sources.
Si la compréhension disparaît avec la fenêtre de discussion, l’outil a accompli le travail mais n’a pas soutenu l’apprentissage. La question suivante est de savoir si les écoles et les développeurs concevront leurs outils en tenant compte de cette distinction.



