프로그램의 성취도 개선은 확인됐다. AI만의 기여는 분리하지 못했다.

테네시 중학교 18곳의 53개 학교·학년 집단에서 2개 학년도에 걸쳐 진행한 실험이다. 사전등록 주분석은 5개 평가기간의 학생·기간 관측 6,902건을 사용했다. TCAP 결과는 미포함이다.

무엇을 비교했나

학교·학년 집단 무작위 배정

칸아카데미 + 칸미고

기존 보충수업

배정 효과 추정치

+1.26

MAP 수학 전국 백분위 순위 포인트 / 평가기간

표준오차 0.60

012

선: ±1 표준오차. 신뢰구간이 아님.

0: 차이 없음

학교 실험

숫자를 읽는 방법부터 짚자. 전국 백분위 순위는 다른 학생들과 비교한 위치다. 시험 점수가 몇 퍼센트 올랐다는 뜻으로 바꿔 쓰면 안 된다. ‘학생·기간’은 학생 수와도 다르다. 한 학생이 여러 평가기간에 관측되면 여러 건이 된다. 표준오차는 추정의 불확실성을 보여주는 수치다. 효과의 방향만 읽고 모든 학생에게 같은 개선이 생겼다고 결론 내릴 수는 없다.

개발팀은 무엇을 측정하는가

칸미고 개발팀의 별도 AIED 논문은 평가의 중간 단계를 보여준다. 연습 기능의 핵심 지표는 AI 도움을 받은 뒤 같은 세션·같은 연습문제 묶음에서 다음 문항을 도움 없이 맞히는 비율이다. 자유로운 튜터 대화에서는 학생이 설명하고 추론하는 인지적 참여를 본다. 대화당 발화수는 별도의 보조 지표다. 팀은 새 기능을 실제 이용 환경에서 보통 1~2주 실험한다고 설명한다. 이 자료는 제품 개발 과정의 보고이지, 앞선 학교 실험의 학습 효과를 재검증한 독립 연구는 아니다. 개발팀의 평가 논문

이 두 종류의 평가를 연결하려면 질문을 더 잘게 나눠야 한다. 도입 담당자는 전체 수업 방식이 기존 예산과 시간보다 나은 결과를 내는지 알고 싶다. 개발자는 한 번의 설명을 고쳤을 때 다음 풀이가 달라지는지 알고 싶다. 둘 다 필요한 질문이지만, 한쪽의 성공으로 다른 쪽의 답을 대신할 수는 없다. 바로 다음 문제를 맞힌 학생이 일주일 뒤에도 풀 수 있는지는 별도로 확인해야 한다.

평가 계획에는 보고서를 읽고 내릴 결정도 적어둘 만하다. 다음 문항의 정답률이 높아져도 한 달 뒤 검사에서 차이가 없다면 도입을 계속할 것인가. 특정 교사의 지도 아래에서만 결과가 좋다면 다른 교실로 확대하기 전에 무엇을 바꿀 것인가. 이런 판단 기준을 먼저 정해야 제품이 보여주기 쉬운 숫자에 결정을 끌려가지 않는다.

새 기능에도 같은 질문이 남는다

실험 종료는 2026년 5월이다. 그 뒤 구글은 8월 27일 칸미고에 Gemini 기반의 상호작용형 도표가 추가됐다고 발표했다. 학생이 도형의 꼭짓점이나 선분을 움직이면 설명도 반응하는 방식이다. 앞선 실험으로 이 기능의 효과를 입증할 수는 없다. 발표에는 참여와 다음 답변에 관한 초기 개선 징후가 담겼지만, 장기 학습 효과의 수치나 비교 설계는 제시하지 않았다. 구글의 제품 발표

V의 관점

내가 학교의 구매 검토를 맡는다면, 시연에서 설명이 매끄러운지를 보는 데서 멈추지 않겠다. 도입 전에 평가 계획부터 요구하겠다. 기존 수업을 계속하는 비교 집단을 두고, 같은 문제은행과 수업 시간에서 AI 지원만 달리하는 비교도 가능하게 설계할 것이다. 학생이 어려워할 때 누가 개입하는지, 교사가 추가로 쓰는 시간은 얼마인지도 함께 기록하겠다.

마지막 확인은 채팅창 밖에서 해야 한다. 도움을 끈 새 문제와 시간을 두고 다시 푸는 문제를 준비하고, 처음 정한 학생 집단 전체의 결과를 보겠다. 적극적으로 사용한 학생의 성공 사례만 골라 보여주는 보고서는 구매 판단에 부족하다. 내가 요구할 성적표는 ‘얼마나 대화했나’에서 끝나지 않고, ‘어떤 수업 조건에서 누가 무엇을 혼자 할 수 있게 됐나’까지 이어져야 한다.