코팩포커스_교육 데이터의 수집과 활용 사례 분석
이북 원문에서 글자만 옮긴 전체 텍스트입니다. 표·그림·사진과 원래 모양은 이북에서 확인하세요.
한국과학창의재단 SWAI인재양성팀 김종범 연구원
KOFAC FOCUS
교육 데이터의 수집과 활용 사례 분석
요약
실증 데이터 분석 사례
생체 데이터 분석 사례
교육 데이터의 수집과 활용 사례 분석
목차
… 3
… 4
… 7
패널 데이터를 활용한 딥러닝 분석 사례
… 10
작성 배경
요약
◦ 코로나 팬더믹 이후 교육의 모습이 급격하게 전환되었으며, 온라인 교육 및 에듀테크 활용에 대한 관심이 높아졌음 ◦ AI 보조교사 등 교육 현장에서 인공지능을 본격적으로 도입하려는 움직임이 나타나고 있으나 인공지능의 재료가 되는 데이터를 교육 현장에서 효과적으로 모으고 있지는 못하는 상황임
◦ 국내·외에서 최근 진행된 교육 데이터 마이닝 사례 분석을 통해, 우리 교육 현장에서 도입할 수 있는 데이터 수집 방안에 대해서 알아보고 데이터를 활용한 분석 결과를 통해 교육에서 데이터를 활용하는 방안에 대한 아이디어를 얻을 수 있음
주요내용
◦ (실증 데이터 분석) 코로나 상황에서 등교일 수 및 지역 차이에 따른 학력 저하 원인을 실측 분석함. 학력 저하 현상을 등급별 학생의 이동이나 등교 일수를 집단별로 구분하여 처리하고, 공시자료와 같은 외부자료와의 연동을 통해 분석하는 방법을 활용하였음 ◦ (패널 데이터를 활용한 딥러닝 분석) 교육 데이터 분석 방법 간 성능 평가 연구로서, 학생들의 진로성숙도 예측의 정확도를 비교측정하였음. 일반적인 교육 현장에서 수집되는 데이터 규모의 한계를 패널 데이터와 같은 대량 데이터의 분석을 통해 보완하였고, 딥러닝 분석을 실시, 전통적 통계 분석에 비해 더 높은 정확도를 확인하였음
◦ (생체 데이터 분석) 자기응답식 설문조사로부터 추출한 데이터를 기반으로 분석하는 전통적 방법과는 달리 이 연구에서는 안구 운동을 물리적으로 측정하고 이를 분석하는 방법을 사용하였는 데 이 방법은 생리 활동을 측정기를 통해 직접 측정하므로 응답자의 성향이나 데이터의 편향이 생길 가능성이 낮음. 생체 데이터 수집 방법과 관련된 기술이 발전되고 있으며, 이전에 비해 측정 기구의 가격도 상대적으로 낮아지고 있으므로, 방향성 탐색이나 설문조사 기반 연구의 보완적인 연구로서 생체 데이터 수집과 관련된 연구가 추진될 필요가 있음
KOFAC FOCUS 3
한국과학창의재단 SWAI인재양성팀 김종범 연구원
교육 데이터의 수집과 활용 사례 분석
◉ 실증 데이터 분석 사례 (등교일수 및 지역 차이에 따른 학력 저하 분석)
아래 내용은 신철균, 위은주, 안영은(2021) 코로나19 상황에서의 중학교 교육격차 분석: 등교일 수 및 도농간 차이를 중심으로 연구의 요약임
분석 배경 : 코로나19 상황에서 발생한 교육격차의 이유는 무엇인가?
◦ 코로나19를 거치면서 실제적으로 드러난 학생들 간의 학습 격차는 극복의 대상인 동시에 분석의 대상이 되었음
◦ 이 연구에서는 강원도 학생들의 교육격차에 대한 상황을 실증적으로 분석하고 데이터 기반으로 양상을 밝히려고 함
◦ 코로나19로 인하여 학생들의 학력이 떨어진다는 언론의 보도나 연구 결과는 특정한 상황이나 사고가 발생했을 때 그로 인한 차이를 드러내는 것에 불과하였으나, 이 연구는 인과관계를 분석할 수 있는 요인을 찾아내고 그에 대한 데이터 기반의 분석을 활용했다는 점에 의의가 있음
분석 방법
◦ 분석의 대상(표본): 강원도 소재 중학교 학생 전체(성취자료가 모두 존재하는 157개교)
◦ 수집 데이터 및 수집 방법: 학교 알리미 공시자료를 활용한 모든 중학교의 학업성취도 등급 자료, 학교별 소재지 (도시, 읍·면), 등교일
분석 결과
◦ 157개 대상교를 비교해 본 결과 조사 대상인 국어, 수학, 영어 과목에서 비교 시점에 비해 코로나 유행이 있었던 2019~20년 사이에 A등급이 감소하고, E등급이 증가하는 학력 저하 현상이 나타남
KOFAC FOCUS 4
이 쪽은 글자로 옮기지 못했습니다. 이북에서 보기
◦ 이 연구는 강원도 중학생을 대상으로 한 연구로 지역적인 특색을 드러내고 있는데, 사교육에 의존도가 높은 수도권 학생들과는 달리 코로나로 인하여 학력의 양극화가 나타나지는 않았지만, 반대로 전반적인 학력 저하 현상이 나타난 것으로 보임 ◦ 학력 저하 현상을 전체 학생의 평균의 저하로 보지 않고 등급별 학생의 이동이나 등교 일수를 집단별로 구분하여 처리하고, 공시자료와 같은 외부자료와의 연동을 통해 분석하는 방법을 활용하였음
◦ 이런 분석 데이터가 지역별, 학교급별로 지속적으로 쌓인다면 딥러닝 등 인공지능 분석 방법을 활용하여 대면 활동 일수를 늘리거나 필요한 교육 활동을 추전해 주는 등 학력 저하를 예방할 수 있는 방법으로 활용될 수 있을 것임
KOFAC FOCUS 6
◉ 패널 데이터를 활용한 딥러닝 분석 사례 (분석 방법의 성능 비교)
아래 내용은 윤혜경, 최승배, 김태영. (2022)딥러닝 모형을 활용한 교육 빅데이터 분석 논의 연구의 요약임
분석 배경 : 교육 현장에서 수집되는 빅데이터를 어떻게 분석할 수 있을까?
◦ 데이터의 중요성이 강조되면서 교육 현장에서도 다양한 종류의 빅데이터가 수집되고 있음 ◦ 교육 분야의 빅데이터는 합리적 의사결정의 원재료로 활용될 수 있고, 교육 효과성의 제고와도 관련이 있음 ◦ 빅데이터를 분석하는 방법은 여러 가지가 있으며 특히 많은 연구가 특정 분야에 기여하는 변수를 찾는데 초점을 맞추고 있었으나, 교육 데이터 분석에 있어서도 성능 평가, 즉, 딥러닝을 통해서 분석한 결과가 얼마나 정확성을 갖게 되는지에 대해서도 관심을 가질 필요가 있음
분석 방법
◦ 분석의 대상(표본): 한국직업능력개발원 한국교육고용패널 두 번째 조사주기(Korean Education & Employment Panel Wave Ⅱ, 약칭 KEP Ⅱ)의 1차년도 조사자료 활용 - 학생, 가구, 교사, 학교행정, 학교 알리미 데이터 등으로 구성하고 2016년 기준 고2학생이며 표본 크기는 10,225임 ◦ 수집 데이터
구분 학교생활 가정생활 학습 및 사교육 여가 생활 개인적 특성
내용 담임 선생님, 수업, 학교 시설 만족도 등 학생의 학교생활 전반 부모님(혹은 남성, 여성 보호자)과 함께하는 활동 및 대화 주제 등 그들과의 친밀도 학습 방법, 공부를 하는 이유, 사교육 경험 및 정도 평균 여가시간, 여가 활동의 종류 및 빈도, 한 달 평균 용돈 등 여가 활동 행복하다고 느끼는 정도, 문화적 배경이 다른 사람에 대한 인식 등
◦ 데이터 수집 방법 : 140개 설명변수(1~5점 척도, 필요시 역코딩 실시 혹은 10점 척도나 수치형 자료 포함)를 활용하고 이를 분석하여 진로 성숙도를 예측하는 것으로 모델을 만듦
◦ 데이터 분석 방법 : 수집한 데이터를 기반으로 진로성숙도 예측 정확도를 측정하는 것이 연구의 목적으로 딥러닝과 다항 로지스틱 회귀모형을 사용하였음. 분석 데이터의 종류가 많기 때문에 딥러닝 과정에서 발생할 수 있는 과적합 문제*를 해결하기 위해서 정형화 기법 중 드롭아웃(Dropout)이 적용된 딥러닝 모형도 함께 분석함(일반 딥러닝- 모형 1, 다항 로지스틱 회귀-모형 2, 드롭아웃이 적용된 딥러닝-모형 3)
KOFAC FOCUS 7
[참고] 과적합과 드롭아웃
◦ 과적합은 머신러닝에서 분석 항목을 과도하게 학습하는 것을 의미함 ◦ 분석을 위해 선택한 데이터는 전체 데이터가 될 수 없으므로 일부만을 사용하게 되는데, 이때 선택된 표본 데이터를 과하게 분석하게 되면 해당 표본 데이터에만 적용할 수 있는 모델이 생성될 수 있음 ◦ 우측 그림에서 초록색 선은 과적합 학습된 모델임 ◦ 드롭아웃은 과적합으로 학습된 모델을 해결하기 위한 학습법 중 하나로 일부 노드를 제거함으로써 학습 모형을 일반화 시키는 방법임(아래 그림에서 좌측은 표준 신경망 모델이고, 우측은 일부 노드가 제거된 드롭 아웃이 적용된 모델임)
분석 결과
◦ 딥러닝을 이용한 ◦ 과적합 해결을 위해 드롭아웃을 적용한
과
Model 1 Model 3
Model 3 Model 1 보아 드롭아웃 방식은 적용했다고 보기 어려움
◦ 30회의 학습 후(30 epoch) 수 있음
Accuracy
By Chabacano - 자작, CC BY-SA 4.0, https://commons. wikimedia.org/w/index. php?curid=3610704
이 다항 로지스틱 회귀모델에 비해서 더 높은 정확도를 나타내고 있음 은
의 정확성이 70%에 육박하였으므로, 이 모델의 정확도는 비교적 높음을 알
Model 1
Accuracy across epochs by different models
에 비해서 정확도가 높지 않고 오히려 낮은 것으로
Model 2 Model 3 Model 1
Epoch
<그림 1> Evolution of accuracy by epochs for three models (for validation datasets)
KOFAC FOCUS 8
<표 4> Accuracy of three models based on validation datasets (in terms of the last epoch)
Model
Accuracy
(neural network without dropout)
(multinomial logistic regression)
3 (neural network with dropout) 0.6375 *[참고] epoch : 인공신경망이 해당 데이터셋에 대해서 한번 학습을 완료한 것을 의미함(엄밀하게는 역전파 알고리즘을 쓰는 경우, 순방향으로 학습하는 것과 역방향으로 가면서 가중치를 수정하는 과정을 한번 거치는 것을 의미함)
시사점
◦ 여러 항목을 포함한 데이터셋의 분석에서 주로 활용되었던 로지스틱 회귀 분석에 비해서 딥러닝이 20%P 가깝게 정확도가 높았는데, 이는 교육 데이터 분석에 딥러닝과 같은 새로운 분석 방법의 도입을 고려할 필요가 있다는 것을 의미함 ◦ 클라우드, 인공지능 플랫폼 등의 발달로 기존의 전통적인 통계 패키지를 통해서 분석할 수 없었던 인공지능 기반 분석 방법을 교육 데이터의 분석에도 사용할 수 있게 됨
KOFAC FOCUS 9
◉ 생체 데이터 분석 사례 (안구운동 추적을 통한 학습자 분석)
아래 내용은 김가림(2022) 우리글 읽기에서 초등 고학년의 읽기이해수준에 따른 단어 빈도 효과: 안구운동 추적 연구의 요약임
분석 배경 : 안구운동 데이터를 통해서 학습자의 수준을 판단할 수 있을까?
◦ 글을 읽는 것은 정보 습득의 가장 쉬운 방법이나, 학생들 중 글을 읽는 것에 어려움을 겪는 경우가 적지 않음 ◦ 또래에 비해서 읽는 능력이 부족한 읽기이해 부진 학생이 어떤 과정에서 어려움을 겪고 있는지에 대해서 분석할 필요가 있음
◦ 특히 이 연구에서는 단어의 빈도가 다른 글에 대해서 읽기 능력이 다른 학생 집단이 어떤 안구 운동 성향을 나타내는 지에 대해서 안구 운동 측정을 통해서 확인하였음
분석 방법
◦ 분석의 대상(표본): 서울, 경기 지역 초등학교 재학 5, 6학년 학생 44명 - 읽기이해 부진 16명, 읽기이해 중위 13명, 읽기이해 상위 15명 ◦ 수집 데이터와 수집 방법: 안구운동 검사실에서 안구 운동 추적을 위한 비디오 장치로 동공의 위치 파악 ◦ 데이터 분석방법: 읽기이해 수준에 따라 단어의 빈도 효과를 보기 위해 첫 고정시간, 단일고정시간, 주시시간, 전체 읽기 시간, 고정수 등을 측정
<그림 2> 안구운동 측정치 예시
KOFAC FOCUS 10
분석 결과
◦ 첫 고정시간과 단일고정시간은 집단 간 차이가 유의미하지 않았으나, 주시시간, 전체 읽기시간과 고정수는 집단 간 차이가 나타남 ◦ 읽기 수준과는 상관없이 단어의 빈도는 고정시간과 고정 수에 영향을 주고, 모든 집단에서 저빈도일 때 더 오래 응시하고, 더 많이 고정하였음
◦ 읽기이해부진 그룹의 빈도 효과는 일반적인 읽기 능력 발달과는 다른 양상이었음, 첫 고정시간과 단일고정시간은 상위 집단의 단어 빈도 효과가 가장 크고, 주시시간과 전체읽기시간은 부진 집단의 빈도 효과가 가장 크게 나타남
<표 5> 안구운동 측정치에 나타난 세 집단의 단어 빈도 효과
고빈도 M 228.25
첫 고정시간 (ms)
SD 31.80 M 233.63
단일고정시간 (ms)
SD 38.34 M 313.94
주시시간 (ms)
SD
M
전체읽기시간 (ms)
SD 154.32 M
고정 수 (회)
SD
<그림 3> 주요 고정시간 측정치에 나타난 집단별 빈도 효과 크기
(ms) 300 250 200 150 100 50 0
첫 고정시간
읽기이해부진 (n=16)
읽기이해중위 (n=13)
저빈도
고빈도
저빈도
단일고정시간
주시시간
읽기이해상위 (n=15) 고빈도
저빈도
읽기이해부진 읽기이해중위 읽기이해상위
전체읽기시간
KOFAC FOCUS 11
◦ 일반적인 교육 효과 분석 방법은 자기응답식 설문조사로부터 추출한 데이터를 기반으로 분석하는 경우가 많은데, 이 연구에서는 안구 운동을 물리적으로 측정하고 이를 분석하는 방법을 사용하였음 ◦ 자기응답식 설문조사의 경우, 조사 방법은 간편하고 다수의 표본에 대한 데이터를 쉽게 얻을 수 있는 장점이 있으나, 응답자가 자신의 상태를 직접 기입해야 하므로 평가지의 편향이나, 응답자의 성향에 의해 의미가 달라질 수 있음
◦ 그에 비해, 생체 데이터를 활용한 방법은 생리 활동을 측정기를 통해 직접 측정하므로 응답자의 성향이나 데이터의 편향이 생길 가능성이 낮음. 다만 고가의 측정기를 활용해야 하므로 많은 수의 데이트를 모으기 어렵고, 데이터 수집 비용이 높음 ◦ 생체 데이터 수집 방법과 관련된 기술이 발전되고 있으며, 이전에 비해 측정 기구의 가격도 상대적으로 낮아지고 있으므로, 방향성 탐색이나 설문조사 기반 연구의 보완적인 연구로서 생체 데이터 수집과 관련된 연구가 추진될 필요가 있음
관련 자료
1) Elite Data Science(2022). Overfitting in Machine Learning: What It Is and How to Prevent It(July, 6. 2022) https://elitedatascience.com/overfitting-in-machine-learning 2) Srivastava, N., Hinton, G., Krizhevsky, A., Sutskever, I., & Salakhutdinov, R. (2014). Dropout: a simple way to prevent neural networks from overfitting. The journal of machine learning research, 15(1), 1929-1958
3) 김가림.(2022).우리글 읽기에서 초등 고학년의 읽기이해수준에 따른 단어 빈도 효과: 안구운동 추적 연구. 특수교육 논총,38(1),1-18. 4) 신철균, 위은주, 안영은. (2021). 코로나19 상황에서의 중학교 교육격차 분석: 등교일수 및 도농간 차이를 중심으로. 열린교육 연구, 29(5), 47-71
5) 윤혜경, 최승배, 김태영. (2022). 딥러닝 모형을 활용한 교육 빅데이터 분석 논의. Journal of The Korean Data Analysis Society(JKDAS), 24(3), 1149-1157
KOFAC FOCUS 12
글이 없거나 같은 내용이 반복되는 쪽은 뺐습니다. 이북으로 보기