OECD AI 교육 보고서: AI를 사용하는 학생들은 대체로 더 낮은 점수를 기록
OECD의 AI 교육 보고서는 난감한 충돌을 드러냈다. 학업에 챗봇을 사용하는 대부분의 학생은 이를 피한 학생보다 낮은 점수를 받았다. 이러한 양상은 91개 국가 및 경제권의 15세 학생 76만 명이 참여한 2025년 평가 전반에서 나타났다.
이 헤드라인이 모든 학생이 ChatGPT나 Gemini를 닫아야 한다는 뜻은 아니다. 적정 수준의 사용자는 가끔 사용하거나 집중적으로 사용하는 학생보다 더 나은 성과를 보이기도 했다. 또한 학교가 학생들에게 AI가 생성한 정보를 평가하는 방법을 가르쳤을 때, 빈번한 사용자도 소폭의 우위를 얻었다.
따라서 실제 구분선은 AI 사용자와 비사용자 사이에 있지 않다. 인지적 작업의 외주화와 지도된 연습 사이에 있다. 챗봇은 사용자가 질문과 근거, 그 뒤에 있는 추론을 이해하도록 보장하지 않은 채 완성도 높은 답변을 만들어낼 수 있다.
이러한 차이는 학교, 가정, AI 개발자에게 교육 도입이 무엇을 측정해야 하는지 재고하도록 압박한다. 더 빠른 숙제와 더 그럴듯한 제출물이 자동으로 학습을 의미하지는 않는다. 독립적으로 수행하는 능력은 더 어렵지만 더 중요한 시험으로 남는다.
OECD AI 교육 보고서가 실제로 발견한 내용
학업에 AI를 사용하지 않은 학생은 일반적으로 사용자보다 더 높은 성과를 보였지만, 이 결과는 입증된 해악이 아니라 연관성을 설명한다.
OECD는 2026년 9월 8일 PISA 2025 결과를 발표했다. 국제학생평가프로그램인 PISA는 15세 학생들이 낯선 문제에 지식을 어떻게 적용하는지 측정한다.
2025년 평가는 이 프로그램 역사상 가장 큰 규모였다. 91개 참여 국가 및 경제권의 학생 76만 명을 포괄했다. 과학이 주된 평가 과목이었으며, 읽기와 수학은 기초 지식을 위한 추가 측정 지표로 활용됐다.
PISA는 처음으로 학생들이 학업에 AI 챗봇을 얼마나 자주 사용하는지에 관한 상세한 정보를 수집했다. 설문 문항은 네 가지 일반적인 활동을 다뤘다.
학생들은 학습 지원, 새로운 주제 조사, 지정 읽기 자료 요약, 글쓰기 과제 초안 작성에 챗봇을 사용했는지 응답했다. 설문은 가끔 사용하는 경우, 적정 사용, 주간 사용, 거의 매일 사용하는 경우도 구분했다.
AI는 이미 대부분 학생에게 일상적인 도구가 됐다. OECD 국가 전체에서 조사된 모든 학업 활동에 챗봇을 전혀 또는 거의 사용하지 않는다고 답한 비율은 14%에 불과했다.
그럼에도 비사용자는 일반적으로 사용자보다 높은 과학 점수를 얻었다. 과제 초안 작성에 AI를 사용하지 않은 학생 역시 해당 목적으로 AI를 사용했다고 응답한 학생보다 높은 성과를 보였다.
양상은 활동과 사용 빈도에 따라 달랐다. 매주 AI를 학습 지원에 사용한 학생은 비사용자와 비슷한 보정 과학 점수를 기록했다. 거의 매일 사용하거나 가끔만 사용한 학생은 점수가 더 낮은 경향을 보였다.
요약과 사전 조사에서는 적정 사용자가 제한적 사용자와 집중적 사용자보다 더 나은 성과를 냈다. OECD는 이러한 과제에서의 적정 사용을 월 1회에서 주 2회 사이로 정의했다.
초안 작성에서는 이러한 중간 수준 사용의 이점이 더 약하게 나타났다. 챗봇을 이용한 초안 작성을 피한 학생들이 여전히 가장 뚜렷한 전반적 우위를 유지했다.
이 비교에서는 학생의 사회경제적 지위를 고려해 예상 과학 점수를 보정했다. AI 도입이 고르게 분포되지 않았기 때문에 이 보정은 중요하다.
빈번한 사용자는 상대적으로 더 유리한 배경을 가진 경우가 많았다. 비사용자는 기기, 안정적인 인터넷 연결, 유료 AI 서비스에 대한 제한적 접근을 포함한 사회경제적 불이익에 처했을 가능성이 더 높았다.
사회경제적 배경을 고려한 뒤에도, 사용자 행동과 학습 성향은 분리하기 어려웠다. 학업이 이미 어렵기 때문에 어려움을 겪는 학생이 AI를 찾을 수 있다. 반대로 AI의 과도한 사용은 독립적 역량을 개발하는 데 필요한 노력을 줄일 수도 있다.
보고서는 어느 방향의 영향이 더 큰지 판단할 수 없다. 이 조사는 사용 행태와 성과를 같은 평가 기간에 포착한 횡단면 증거를 제시한다.
따라서 OECD는 챗봇을 여는 행위가 학생의 점수를 직접 낮춘다고 주장하지 않는다. 더 강한 결론은 보다 실용적이다. 접근성만으로는 더 나은 학습을 예측할 수 없다.
이 결론은 교실 AI 도입의 배경에 있는 흔한 가정에 도전한다. 이용 가능 여부는 세기 쉽지만, 이해도는 측정하기 훨씬 어렵다.
더 나은 숙제가 더 약한 학습을 숨길 수 있다
생성형 AI는 완성된 과제의 질을 높일 수 있지만, 학생이 독립적으로 일할 준비를 갖추게 하는 연습을 약화시킬 수 있다.
OECD의 발견은 더 광범위한 실험 연구와 부합한다. 범용 챗봇은 보조를 받는 과제에서 즉각적으로 산출물의 질을 높이는 경우가 많다. 그러나 보조가 사라지면 이러한 이점도 사라질 수 있다.
OECD의 디지털 교육 전망은 이 문제를 수행과 학습 간의 격차로 설명한다. 수행은 학생이 오늘의 과제를 성공적으로 마쳤는지 측정한다. 학습은 학생이 나중에 그 지식을 적용할 수 있는지 측정한다.
학생은 챗봇에게 한 장을 요약해 달라고 요청하고 정확하고 읽기 쉬운 응답을 받을 수 있다. 하지만 그 결과물만으로 학생이 핵심 논지를 파악했는지, 근거를 저울질했는지, 내용을 기억했는지는 알 수 없다.
초안 작성은 더 뚜렷한 충돌을 만든다. 챗봇은 짧은 프롬프트를 몇 초 만에 구조화된 에세이로 바꿀 수 있다. 결과물은 학생이 독립적으로 재현할 수 없는 어휘와 구성을 보여줄 수 있다.
눈에 보이는 결과물은 개선되지만, 보이지 않는 학습 과정은 줄어든다. 학생은 정보를 회상하고, 불확실성을 해소하며, 근거를 선택하고, 약한 추론을 수정하는 데 쓰는 시간이 줄어든다.
이 단계들은 비효율적으로 느껴질 수 있다. 그러나 학습의 상당 부분은 바로 그 과정에서 일어난다.
이 메커니즘은 PISA 데이터에서 나타난 이례적인 사용 빈도 곡선을 설명하는 데 도움이 된다. 적정 사용은 능동적 학습 과정을 보완할 수 있다. 집중적 사용은 그 과정을 대체할 기회를 더 많이 만든다.
가끔 사용하는 학생 역시 여러 이유로 더 낮은 점수를 받을 수 있다. 일부 학생은 혼란스럽거나 뒤처졌을 때만 챗봇을 열 수 있다. 이 경우 사용 빈도는 원인이 아니라 이미 존재한 어려움을 반영한다.
OECD Digital Education Outlook은 Türkiye의 고등학생을 대상으로 한 통제된 수학 연구를 검토했다. 학생들은 연습 과정에서 일반 GPT-4 인터페이스 또는 특별히 설계된 튜터링 버전을 제공받았다.
튜터링 시스템은 AI 접근 권한이 없는 학생과 비교해 연습 성과를 127% 향상시켰다. 일반 챗봇은 이를 48% 향상시켰다.
그러나 일반 챗봇으로 연습한 학생들은 AI 접근 권한을 전혀 받지 않은 학생보다 폐쇄형 시험에서 17% 낮은 점수를 받았다. 튜터링 그룹은 그 불이익의 대부분을 피했다.
기반이 된 통제 수학 연구는 중요한 비교를 제공한다. 두 시스템은 동일한 기반 모델 계열을 사용했지만, 학생에게 서로 다른 행동을 유도했다.
일반 인터페이스는 답을 쉽게 제공했다. 튜터는 학생이 즉시 과제를 끝내지 않고 문제를 풀어가도록 이끄기 위한 안전장치를 포함했다.
이 차이는 논의를 모델 정확도를 넘어선 곳으로 옮긴다. 정답이라도 학생이 독립적 접근법을 세우고 검증하기 전에 도착한다면 학습을 저해할 수 있다.
따라서 교육용 AI에는 또 다른 품질 지표가 필요하다. 개발자는 보통 모델이 정확히 답하는지, 지시를 따르는지, 사용자를 만족시키는지 평가한다. 학습 시스템은 생산적인 노력도 보존해야 한다.
생산적인 노력은 모든 답을 숨기는 것을 의미하지 않는다. 회상을 유도하고, 설명을 요청하고, 오개념을 찾아내며, 학습자가 문제를 시도한 뒤에 지원을 제공하는 것을 뜻한다.
일반적인 챗봇은 즉각적인 유용성을 최적화한다. 교육용 튜터는 때때로 그러한 충동을 억제해야 한다.
이는 불편한 제품상의 갈등을 만든다. 학생들은 흔히 일을 줄여주는 도구를 선호하지만, 학교에는 독립적 역량을 높이는 도구가 필요하다.
사용량, 과제 완료 속도, 만족도는 잘못된 설계를 보상할 수 있다. 과제를 손쉽게 만드는 시스템은 시험 성과를 약화시키면서도 대시보드에서는 성공적으로 보일 수 있다.
PISA의 AI 학생 점수는 이러한 측정 문제를 전 세계적 규모에서 드러낸다. 학교는 도입률이나 과제의 질만으로 교육 기술을 판단할 수 없다.
챗봇이 없거나, 사용이 제한되거나, 즉시 사용할 수 있는 답을 제공할 수 없는 상황에서도 역량이 이전된다는 증거가 필요하다.
AI 리터러시가 결과를 바꾼다
학교가 빈번한 AI 사용과 AI가 생성한 정보를 의심하고 평가하는 명시적 연습을 결합했을 때 학생들은 가장 큰 혜택을 얻었다.
OECD 국가 전체에서 학생 약 10명 중 6명은 AI가 생성한 정보를 평가하는 내용이 포함된 교실 과제를 받은 적이 있다고 답했다. 국가별 비율은 31%에서 80% 이상까지 나타났다.
이들 학생 가운데 46%는 그러한 활동을 가끔 수행한다고 답했다. 약 33%는 자주 수행했으며, 22%는 매우 자주 한다고 응답했다.
학생들은 일반적인 온라인 정보를 평가하는 연습을 더 많이 받았다. 약 10명 중 8명은 수업에서 인터넷에서 찾은 정보의 질을 평가하도록 요구받은 적이 있다고 답했다.
이 차이는 중요하다. 챗봇의 결과물은 추론이나 근거가 불완전할 때도 유창한 언어를 만들어낸다.
이를 평가하려면 일반적인 읽기 능력과 생성형 시스템이 응답을 구성하는 방식에 대한 어느 정도의 이해가 필요하다. 학생들은 주장을 검토하고, 출처를 추적하며, 불확실성을 인식하고, 신뢰할 수 있는 자료와 답변을 비교해야 한다.
PISA는 이러한 기회를 받은 학생들 사이에서 작지만 주목할 만한 역전을 발견했다. AI 정보를 평가하는 법을 배운 빈번한 사용자는 비사용자와 월 2회 이하로 AI를 사용한 학생보다 약간 높은 성과를 보였다.
이 결과가 평가 수업이 성과 향상을 일으켰다는 점을 입증하지는 않는다. 더 강한 AI 교육을 제공하는 학교는 더 나은 교사, 자원 또는 폭넓은 학업 지원도 갖추고 있을 수 있다.
그러나 이는 AI 사용이 일률적으로 해롭다는 생각을 약화한다. 교육 환경과 학생의 행동이 결과를 형성하는 것으로 보인다.
OECD의 AI 리터러시 조사 결과는 수동적 소비보다 해석을 강조한다. 이러한 초점은 효과적인 챗봇 사용의 중심에 읽기 능력을 둔다.
유용한 교실 활동은 정확한 진술, 근거 없는 가정, 허위 인용 하나가 포함된 AI 생성 설명을 학생들에게 제시하는 방식일 수 있다. 학생들은 이후 각 주장을 주석 처리하고 검증한다.
또 다른 과제는 학습자가 AI 없이 첫 번째 답변을 작성하도록 요구할 수 있다. 이후 챗봇에 비평을 요청하고, 어떤 제안을 받아들이거나 거부했는지 설명할 수 있다.
이러한 활동은 학생의 주도권을 유지한다. 모델은 자동 답변 기계가 아니라 분석의 대상이나 피드백의 원천이 된다.
또한 교사가 검토할 수 있는 증거도 만든다. 최종 에세이만으로는 학생의 추론이 얼마나 반영됐는지 감출 수 있다. 초안, 프롬프트, 출처 메모, 서면 판단은 그 과정을 드러낸다.
바로 이 지점에서 개인 지식 관리 방식이 책임 있는 사용을 지원할 수 있다. 출처와 자신의 메모를 보존하는 학생은 AI 응답을 근거 기록과 비교할 수 있다.
구조화된 학생 워크스페이스는 읽기 자료, 노트, 질문을 서로 연결된 상태로 유지하는 데 도움이 될 수 있습니다. 다만 학습 효과는 여전히 학생이 그 자료를 어떻게 활용하느냐에 달려 있습니다.
비판적 평가는 일회성 AI 안전 교육에 그쳐서는 안 됩니다. 이는 일상적인 과학, 역사, 글쓰기, 연구 과제 안에 포함되어야 합니다.
학생들에게는 유창한 답변에 이의를 제기할 권한도 필요합니다. 챗봇은 자신감 있게 소통하며, 어린 사용자는 매끄러운 문장을 권위로 오인할 수 있습니다.
교사는 검증과 수정을 장려함으로써 이러한 영향을 상쇄할 수 있습니다. 모델의 근거 없는 주장을 찾아낸 학생은 예상된 정답에 도달한 것뿐 아니라 추론 과정 자체를 인정받아야 합니다.
목표는 불신 그 자체가 아닙니다. 증거, 과제 유형, 불확실성에 기반한 적절한 신뢰입니다.
이 접근은 학습에 대한 실제 AI 영향을 더 잘 반영합니다. 같은 모델도 사고를 단축할 수 있고, 사고를 확장하는 피드백을 제공할 수도 있습니다.
점수 격차가 AI가 하락을 초래했다는 증거는 아니다
OECD 데이터는 경고 신호를 포착하지만, 학생 성취에 영향을 미치는 수많은 요인 가운데 챗봇의 영향을 분리해낼 수는 없습니다.
AI 사용자의 점수가 더 낮다는 헤드라인은 쉽게 증거를 앞서갈 수 있습니다. PISA는 수십만 명의 학생을 무작위로 챗봇 사용 또는 비사용 집단에 배정하지 않았습니다.
학생들은 자신의 행동을 직접 보고했습니다. 자기보고식 빈도는 부정확할 수 있으며, 응답자마다 “학습에 도움이 된다”는 표현을 다르게 해석할 수 있습니다.
어떤 학생은 AI를 이용해 완성된 답안을 생성할 수 있습니다. 다른 학생은 연습 문제, 피드백, 또는 다른 방식의 설명을 요청할 수 있습니다. 두 경우 모두 같은 광범위한 사용 범주에 포함될 수 있습니다.
과학 점수는 2025년에 수행한 활동만이 아니라 축적된 지식을 반영합니다. 학생들은 서로 다른 학교, 교사, 가족의 지원, 동기, 이전 성취 수준을 지닌 채 평가에 참여했습니다.
역인과관계 역시 충분히 가능합니다. 성취도가 낮은 학생은 추가 도움이 필요하기 때문에 챗봇에 더 자주 의존할 수 있습니다. 이 패턴은 AI가 격차를 만들었다는 증거 없이도 사용자 집단의 낮은 점수를 만들어낼 수 있습니다.
OECD도 이 한계를 공개적으로 인정합니다. 이러한 관계가 AI가 과학 성취에 부정적 영향을 준다는 뜻은 아닐 수 있다고 설명합니다.
더 폭넓은 성취도 추세 역시 생성형 AI가 널리 도입되기 전부터 시작됐습니다. OECD 국가 전반에서 읽기 점수는 2015년부터 2025년까지 28점 하락했습니다. 수학 점수는 22점 떨어졌습니다.
OECD는 이러한 변화를 읽기에서 약 1년 반, 수학에서 1년을 조금 넘는 학습량에 해당하는 것으로 봅니다.
ChatGPT가 공개적으로 이용 가능해진 것은 2022년 말입니다. 그것만으로 10년에 걸친 하락을 설명할 수는 없습니다.
팬데믹으로 인한 혼란, 출석, 가족의 학습 참여, 디지털 산만함, 교육과정 변화, 학습 여건 모두 분석에 포함돼야 합니다. PISA 결과는 하락분 가운데 각 요인이 차지하는 정확한 비중을 배정하지 않습니다.
OECD 평균 기준 과학 성취는 2022년과 2025년 사이에 안정적으로 유지됐습니다. 이러한 안정성은 챗봇 도입이 즉각적인 전반적 붕괴를 초래했다는 주장도 더욱 복잡하게 만듭니다.
동시에 인과관계의 증거가 없다는 사실이 경고를 지워서는 안 됩니다. 관찰된 패턴은 집중적이고 통제되지 않은 지원보다 비사용, 적정 사용, 또는 지도된 사용에 반복적으로 유리하게 나타납니다.
통제 연구 역시 학습 저하가 그럴듯한 이유를 제시합니다. 학생들이 회상과 추론을 시도하기 전에 답을 받으면, 이후 도움 없이 측정되는 기술을 연습할 기회가 줄어듭니다.
따라서 가장 타당한 입장은 공황과 안일함 사이에 있습니다. PISA는 AI가 학생을 덜 지능적으로 만든다는 것을 입증하지 않습니다. 다만 일반적인 도입이 전반적인 학업상 이점을 제공하지 못했음을 보여줍니다.
이 발견은 입증 책임을 바꿔야 합니다. 학교는 학생들이 학교 과제에 챗봇을 사용한다는 이유만으로 그것이 교육적이라고 가정해서는 안 됩니다.
AI 개발자에게도 참여도 이상의 증거가 필요합니다. 기업이 학습 제품을 마케팅한다면, 시간차를 둔 독립 평가를 통해 지속적인 향상을 입증해야 합니다.
이러한 시험은 일반 챗봇, 제약된 튜터링 도구, 교사 지도형 사용, AI 없는 연습을 비교해야 합니다. 또한 이점이 과목과 학생 집단 전반에서 지속되는지도 추적해야 합니다.
형평성은 또 다른 불확실성을 더합니다. 불리한 환경의 학생들은 AI 생성 정보를 평가하는 수업 과제를 받을 가능성이 더 낮았습니다.
이들은 접근성 제한 때문일 가능성을 포함해 비사용자일 가능성도 더 높았습니다. 지침을 확대하지 않은 채 접근성만 넓히면 하나의 격차를 다른 격차로 대체할 수 있습니다.
핵심 위험은 단지 일부 학생이 더 좋은 모델을 갖는다는 데 있지 않습니다. 일부 학생은 모델을 검증하는 법을 배우는 반면, 다른 학생은 즉각적인 답변만 받는다는 데 있습니다.
학교는 챗봇을 단속하는 데 그치지 말고 과제를 재설계해야 한다
이 결과는 일괄적인 접근 허용 여부보다 과제, 평가, AI 제품의 설계에 더 큰 압력을 가합니다.
학교는 처음에 생성형 AI를 주로 학업 윤리 문제로 다뤘습니다. 이 우려는 여전히 상당합니다.
별도의 OECD 교사 설문조사에서 중등학교 저학년 교사의 72%는 AI가 학생들이 생성된 결과물을 자신의 것으로 제출하게 함으로써 학업 윤리를 해칠 수 있다고 답했습니다.
탐지만으로는 약한 대응에 그칩니다. AI 탐지기는 텍스트가 기계 지원 글쓰기와 유사한지를 추정하지만, 학생이 과제를 어떻게 만들었는지를 신뢰성 있게 재구성하지는 못합니다.
학생은 브레인스토밍, 문법 피드백, 근거 없는 초안 작성, 또는 전면 대체를 위해 AI를 사용할 수 있습니다. 최종 텍스트만으로는 이러한 차이를 명확하게 드러내기 어렵습니다.
평가 설계는 더 유용한 증거를 포착할 수 있습니다. 교사는 개요, 출처 주석, 중간 초안, 구두 설명, 또는 짧은 감독형 후속 과제를 요청할 수 있습니다.
이 방법들은 추론을 눈에 보이게 합니다. 또한 학교가 일부 형태의 AI 지원을 허용할 때에도 유용합니다.
교재나 자료를 보지 않는 시험은 독립적 역량을 측정하는 하나의 방법입니다. 하지만 학습에는 연구, 협업, 수정, 도구 활용도 포함되므로 이것만이 유일한 답이 되어서는 안 됩니다.
균형 잡힌 시스템은 두 가지 방식을 모두 평가할 수 있습니다. 학생들은 AI 없이 기초 지식을 보여주고, AI를 활용한 책임 있는 적용 능력도 입증해야 합니다.
OECD의 글로벌 발표는 목적의식 있고 적정한 기술 사용을 주장합니다. 또한 주의력, 노력, 이해를 대체하는 것에 대해서는 경고합니다.
이 원칙은 학교에 실행 가능한 기준을 제공합니다. 과제는 어떤 인지 작업이 학생의 몫인지, AI가 어디에서 기여할 수 있는지를 명시해야 합니다.
예를 들어 교사는 초기 문제 해결 단계에서는 AI를 금지하되, 수정 단계에서는 허용할 수 있습니다. 그러면 학생들은 자신의 접근법을 모델의 응답과 비교할 수 있습니다.
역사 과제는 주제 탐색을 허용하되, 모든 사실 주장이 승인된 출처와 연결되도록 요구할 수 있습니다. 학생들은 거부한 AI 제안에 대한 짧은 설명을 제출하게 됩니다.
글쓰기 수업은 챗봇을 저자가 아니라 비평가로 활용할 수 있습니다. 모델은 불명확한 구절을 지적할 수 있지만, 이를 어떻게 수정할지는 학생이 결정합니다.
이러한 설계는 답안을 복사하는 것보다 AI 사용을 더 느리게 만듭니다. 학습자가 자신의 사고를 점검하도록 강제할 때, 이러한 마찰은 가치가 있습니다.
개발자 역시 병행되는 설계 과제에 직면합니다. 교육 모드에는 친근한 어조, 단순화된 설명, 연령별 인터페이스 제어 이상의 것이 필요합니다.
신뢰할 수 있는 튜터는 오개념을 진단하고, 학생에게 답을 먼저 제시하도록 요구하며, 힌트를 점진적으로 조정해야 합니다. 핵심적인 지적 과제를 너무 일찍 완성해 주는 일은 피해야 합니다.
교사에게는 상호작용에 대한 가시성도 필요합니다. 유용한 교실 시스템은 불필요한 개인 데이터를 노출하지 않으면서도 시도한 개념, 요청한 힌트, 수정한 오류를 요약할 수 있습니다.
특히 미성년자에게는 개인정보 보호와 안전이 여전히 중요합니다. 학교에는 데이터 보존, 모델 학습, 연령 적합성, 학생 대화 접근을 다루는 명확한 규칙이 필요합니다.
교사 준비도 또 다른 압박 지점입니다. OECD에 따르면 2024년 중등학교 저학년 교사의 37%가 업무에 AI를 사용했습니다.
교사는 정책 문서만으로 학생 행동을 지도할 수 없습니다. AI가 학습을 지원하는 경우와 필수 연습을 제거하는 경우를 보여주는 과목별 사례가 필요합니다.
올바른 접근은 학문 분야에 따라 달라집니다. 계산기와 유사한 지원은 수학 개념을 익힌 뒤에는 적절할 수 있지만, 처음 소개하는 단계에서는 해로울 수 있습니다.
언어 학습자는 대화형 연습의 이점을 얻을 수 있습니다. 그렇더라도 자동 완성 없이 어휘를 회상하고 문장을 구성할 기회는 필요합니다.
따라서 문제는 모든 교실이 AI를 도입하거나 금지해야 하는지가 아닙니다. 각각의 사용이 수업이 기르고자 하는 정신적 활동을 보존하는지 여부입니다.
교육용 AI가 개선되고 있는지를 보여줄 세 가지 신호
다음 단계는 단순한 챗봇 도입률이 아니라 독립적 학습, 지도형 사용 접근성, 제품 행동을 통해 평가해야 합니다.
첫 번째 신호는 지원 없이 수행하는 성과입니다. 학교와 연구자는 학생들이 AI를 사용한 뒤에도 기술을 유지하고 전이하는지를 시험하는 시간차 평가가 필요합니다.
즉각적인 과제 품질만으로는 충분하지 않습니다. 유용한 시스템은 도구를 사용할 수 없을 때와 질문이 연습 사례와 다를 때에도 결과를 향상시켜야 합니다.
향후 무작위 연구가 과목 전반에서 지속적인 향상을 보여준다면 OECD의 경고는 약해질 것입니다. 매끄러운 숙제가 계속해서 더 약한 시험 성적에 앞선다면, 그 경고는 더 강해질 것입니다.
두 번째 신호는 명시적인 AI 평가 교육에 대한 접근성입니다. PISA는 학생 약 10명 중 6명이 AI 생성 정보를 평가하는 수업 활동을 일부 경험했다고 밝혔습니다.
이 비율은 높아져야 하지만, 참여만으로는 충분하지 않습니다. 연구자는 그러한 수업의 질, 빈도, 과목 통합 수준을 측정해야 합니다.
사회경제적 격차도 살펴봐야 합니다. 불리한 환경의 학생들은 현재 학교 수업에서 AI 결과물을 평가할 기회를 더 적게 보고합니다.
그 격차가 줄어드는 동시에 지도받은 사용자의 성과가 향상된다면, AI 리터러시는 의미 있는 개입으로 보일 것입니다. 독립적 성과 향상 없이 접근성만 확대된다면 학교에는 더 깊은 교수 방식의 변화가 필요합니다.
세 번째 신호는 교육 제품이 답안 대체를 막는지 여부입니다. 개발자는 튜터링 모드가 어떻게 학생의 추론을 보존하는지, 지원이 끝난 뒤 학습을 어떻게 측정하는지를 설명해야 합니다.
유용한 증거에는 독립적 평가, 투명한 연구 설계, 일반 챗봇과의 비교가 포함됩니다. 참여도 수치는 교육적 질문에 답할 수 없습니다.
일상적 사용 중 제품의 행동도 중요합니다. 튜터는 해법을 제공하기 전에 학생에게 시도를 요구하는가? 증거를 요청하고 불확실성을 드러내는가?
교사는 과제별로 제공 가능한 도움의 유형을 설정할 수 있는가? 학생들은 완성된 응답만 받는 대신 자신의 추론이 어떻게 달라졌는지 검토할 수 있는가?
이러한 선택은 AI가 지름길, 튜터, 또는 둘의 불균등한 혼합물이 될지를 결정할 것입니다.
OECD AI 교육 보고서는 챗봇이 학교에서 사라질 것처럼 행동할 근거를 제공하지 않습니다. 설문에 참여한 대부분의 학생은 이미 챗봇을 사용했으며, 단속으로 그 현실을 되돌릴 수는 없습니다.
다만 더 높은 기준은 정당화합니다. 학생들은 AI 지원 과제를 마친 뒤 단지 더 나은 텍스트를 갖는 것이 아니라, 이전보다 더 많이 알고 있어야 합니다.
학부모와 학습자도 같은 기준을 즉시 적용할 수 있습니다. 챗봇을 사용한 뒤 창을 닫고 아이디어를 설명하거나, 관련 문제를 풀거나, 출처를 통해 답을 옹호해 보십시오.
채팅 창이 닫히면 이해도 사라진다면, 그 도구는 과제를 완성했을 뿐 학습을 지원하지는 못한 것입니다. 다음 질문은 학교와 개발자가 그 차이를 고려해 설계할 것인지입니다.



