RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    소규모 학습자의 물리 교과 지식 상태 추정을 위한 데이터 증강 방법 탐색 = An Investigation of Data Augmentation Methods for Physics Knowledge-State Estimation with Small-Sample Learner Data

    한글로보기

    https://www.riss.kr/link?id=T17452224

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수

    부가정보

    다국어 초록 (Multilingual Abstract) kakao i 다국어 번역

    Deep learning–based knowledge tracing (DLKT) models infer and predict learners’ knowledge states from item-response data, but their reliance on large-scale training datasets limits use in small-class contexts where formative assessments yield only small-sample data. This study examined the feasibility of applying DLKT in such settings through class-level item-response data augmentation and identified an optimal augmentation approach.
    Four IRT simulation–based augmentation methods were developed by combining two small-sample item-parameter estimation approaches—IRT–Bayesian Covariance Structure Modeling (IRT-BCSM) and a Q-matrix–constrained neural estimator, ANN(M2PL-Q)—with two response-generation models: a conventional two-parameter logistic IRT model (2PL) and an IRT–knowledge tracing (IRT-KT) hybrid model reflecting dynamic knowledge-state change. This produced NN, BCSM, NN-KT, and BCSM-KT, with bootstrap resampling as a baseline. The methods were evaluated using simulated data generated under a 2PL model and an empirical dataset of 300 eighth-grade students’ responses to a 22-item Ohm’s law formative assessment.
    Across sample-size conditions (N_{small}), augmentation quality was assessed by discrepancies between original and augmented datasets in response-pattern distributions (Jensen–Shannon divergence; JSD), total-score distributions (Kolmogorov–Smirnov statistic; KS), inter-item correlation structure (Frobenius norm), and item-level difficulty and discrimination indices (mean squared error; MSE). Method differences were tested using the Friedman test with Holm-adjusted Wilcoxon post hoc comparisons. Training utility was evaluated via DLKT performance (AUC, Accuracy, F1-score) when trained on augmented datasets.
    In simulations, model-based augmentation improved response-pattern and correlation-structure fidelity relative to bootstrap (Holm-adjusted p<0.001), and NN most consistently improved total-score distribution fidelity (KS). In the empirical evaluation, method differences were significant across most indicators (Friedman, p<0.001), and NN-KT showed the most consistent improvements in reproducing response patterns and correlation structure. Under the extreme small-sample condition (N_{small}=20), NN-KT substantially reduced response-pattern divergence relative to bootstrap and yielded clear gains in DLKT training performance (AUC = 0.793). Overall, augmentation effects were most pronounced in the small-sample range N_{small}=20~80, while advantages diminished as sample size increased and bootstrap performance improved.
    Taken together, NN-KT most effectively improved both the fidelity of augmented item-response data and DLKT predictive performance under small-sample formative assessment conditions. The results suggest that accurate small-sample item-parameter estimation via ANN(M2PL-Q) and KT-informed response generation jointly strengthen response-pattern diversity while maintaining structural consistency. Applying DLKT trained with NN-KT further supported interpretable knowledge-component–level diagnosis in small-class data, distinguishing mastery patterns by achievement level and revealing heterogeneous KC profiles among students with identical total scores. Future research should extend the framework to diverse item formats and subject domains and examine robustness across additional DLKT architectures.
    번역하기

    Deep learning–based knowledge tracing (DLKT) models infer and predict learners’ knowledge states from item-response data, but their reliance on large-scale training datasets limits use in small-class contexts where formative assessments yield only...

    Deep learning–based knowledge tracing (DLKT) models infer and predict learners’ knowledge states from item-response data, but their reliance on large-scale training datasets limits use in small-class contexts where formative assessments yield only small-sample data. This study examined the feasibility of applying DLKT in such settings through class-level item-response data augmentation and identified an optimal augmentation approach.
    Four IRT simulation–based augmentation methods were developed by combining two small-sample item-parameter estimation approaches—IRT–Bayesian Covariance Structure Modeling (IRT-BCSM) and a Q-matrix–constrained neural estimator, ANN(M2PL-Q)—with two response-generation models: a conventional two-parameter logistic IRT model (2PL) and an IRT–knowledge tracing (IRT-KT) hybrid model reflecting dynamic knowledge-state change. This produced NN, BCSM, NN-KT, and BCSM-KT, with bootstrap resampling as a baseline. The methods were evaluated using simulated data generated under a 2PL model and an empirical dataset of 300 eighth-grade students’ responses to a 22-item Ohm’s law formative assessment.
    Across sample-size conditions (N_{small}), augmentation quality was assessed by discrepancies between original and augmented datasets in response-pattern distributions (Jensen–Shannon divergence; JSD), total-score distributions (Kolmogorov–Smirnov statistic; KS), inter-item correlation structure (Frobenius norm), and item-level difficulty and discrimination indices (mean squared error; MSE). Method differences were tested using the Friedman test with Holm-adjusted Wilcoxon post hoc comparisons. Training utility was evaluated via DLKT performance (AUC, Accuracy, F1-score) when trained on augmented datasets.
    In simulations, model-based augmentation improved response-pattern and correlation-structure fidelity relative to bootstrap (Holm-adjusted p<0.001), and NN most consistently improved total-score distribution fidelity (KS). In the empirical evaluation, method differences were significant across most indicators (Friedman, p<0.001), and NN-KT showed the most consistent improvements in reproducing response patterns and correlation structure. Under the extreme small-sample condition (N_{small}=20), NN-KT substantially reduced response-pattern divergence relative to bootstrap and yielded clear gains in DLKT training performance (AUC = 0.793). Overall, augmentation effects were most pronounced in the small-sample range N_{small}=20~80, while advantages diminished as sample size increased and bootstrap performance improved.
    Taken together, NN-KT most effectively improved both the fidelity of augmented item-response data and DLKT predictive performance under small-sample formative assessment conditions. The results suggest that accurate small-sample item-parameter estimation via ANN(M2PL-Q) and KT-informed response generation jointly strengthen response-pattern diversity while maintaining structural consistency. Applying DLKT trained with NN-KT further supported interpretable knowledge-component–level diagnosis in small-class data, distinguishing mastery patterns by achievement level and revealing heterogeneous KC profiles among students with identical total scores. Future research should extend the framework to diverse item formats and subject domains and examine robustness across additional DLKT architectures.

    더보기

    국문 초록 (Abstract) kakao i 다국어 번역

    학습자의 지식 상태 분석과 예측을 위한 딥러닝 기반 지식 추적(Deep Learning based Knowledge Tracing, DLKT) 모델은 대규모 훈련 데이터를 요구하기 때문에 데이터 확보가 어려운 소규모 환경에서 적용이 제한되어 왔다. 이에 본 연구는 학급 단위의 소규모 문항응답 데이터 증강을 통하여 DLKT 적용 가능성을 탐색하고자 하였다.
    이를 위하여 문항반응이론 시뮬레이션 기반의 증강 방법을 4종으로 설계하였고, 모의실험과 실제 형성평가 자료에서 각 증강 방법의 교육통계적 재현성과 DLKT 일반화 성능 기여도를 평가·비교하여, 최적의 증강 방법을 제안하였다. 증강 방법 평가에 사용된 모의실험 자료는 선행연구에 근거해 설정한 문항모수와 능력 분포를 바탕으로, IRT 2모수(2PL) 로지스틱 모형에서 생성하였다. 실제 형성평가 자료는 중학교 2학년 학생 대상으로 수집된 옴의 법칙 단원의 형성평가 응답으로, 총 300명의 22문항 응답 자료이다.
    본 연구의 증강 방법은 일반적인 IRT 시뮬레이션 절차를 기반으로 하되, 물리 교과·소규모 학급 맥락에서 다음과 같은 세 가지 핵심 차별점을 반영하여 구성하였다. 첫째, 정규분포 가정에서 벗어나 물리 교과용 학습자 능력분포(CSAT)를 설정하였다. 둘째, 소규모 표본 환경에서 문항모수 추정 불안정성을 해결하기 위해, IRT-BCSM 기반 추정과 Q행렬 제약을 반영한 신경망 기반 추정 ANN(M2PL-Q)을 사용하였다. 셋째, 응답 생성 단계에서 IRT-2PL 문항반응모형과, 지식 상태의 동적 변화를 고려하는 IRT-KT 결합 문항반응모형을 구분하여 설계하였다. 최종적으로 모수 추정 방법과 문항반응모형의 조합으로 NN, BCSM, NN-KT, BCSM-KT 등 4종의 증강 방법을 설계하였고, 비교 기준(베이스라인)으로 단순재표집(bootstrap) 방법을 추가하였다.
    각 증강 방법의 교육통계적 재현성과 DLKT 모델의 일반화 성능 기여도는 모의실험과 실제 형성평가 자료에서 표본 크기(N_{small}) 조건별로, 원자료 대비 증강 자료의 차이를 응답 패턴 분포(JSD), 총점 분포(KS), 문항 간 상관구조(Frobenius norm), 문항 난이도·변별도(MSE) 등의 지표로 정량화하여 평가하였다. 방법 간 차이의 통계적 유의성은 Friedman 검정과 Holm 보정 Wilcoxon 사후검정으로 확인하였다. 또한 증강 자료로 훈련한 DLKT의 AUC, Accuracy, F1-score를 비교하여 각 증강 방법의 일반화 성능 기여도를 평가하였다.
    모의실험 결과, NN과 BCSM 방법은 문항응답 분포 재현과 문항 간 상관구조 보존에서 단순재표집 대비 통계적으로 유의한 개선을 소표본 크기 조건과 무관하게 확인할 수 있었다(p_{adj}<0.001). 반면, 총점 분포 차이 지표(KS)에서는 NN 방법만이 모든 N_{small}에서 기준보다 우수한 성능을 보였다. 이러한 양상은 DLKT 모델의 일반화 성능 결과와도 연결되어, 통계 지표에서의 원본 재현성이 높을수록 AUC, Accuracy가 함께 개선되는 양상을 확인하였다.
    실제 형성평가 자료에 각 증강 방법을 적용한 결과, 방법 간 차이는 대부분의 지표에서 유의했다(Friedman, p<0.001). 특히 사후검정에서 NN-KT는 응답 패턴 및 상관구조 재현에서 기준 대비 일관된 개선을 보였다. 극소표본 N_{small}=20 조건에서 NN-KT는 단순재표집 대비 JSD 91.8%, Frobenius 66.7%, 변별도 MSE 87.0% 감소하였다(p_{adj}<0.001). KS와 난이도 MSE 또한 NN-KT가 기준 대비 각각 44.6%, 50.0% 감소하며 통계적으로 유의하게 개선되었으나, N_{small}\geq80 조건에서는 단순재표집의 성능이 우세하였다(p_{adj}<0.001).
    이러한 결과는 DLKT 모델의 일반화 성능과도 상응하였으며, 설계한 증강 방법의 실질적 효과는 소표본 구간(N_{\mathrm{small}}=20\sim80)에서 뚜렷하게 나타났다. 대표적으로 극소표본 N_{small}=20 조건에서 NN-KT는 AUC(0.793) 21.6%, Accuracy(0.734) 17.3%, F1-score(0.735) 14.8%으로 기준 대비 우세하였다. 한편 N_{small}=100 조건에서 NN-KT의 AUC(0.806)가 기준(0.788) 대비 2.3% 개선되었으나, N_{\mathrm{small}}=120 조건에서는 비교 기준인 단순재표집의 성능이 크게 개선되며(AUC 0.788→0.811) 설계한 증강 방법의 기여도를 관찰할 수 없었다.
    결과적으로, 본 연구에서 설계한 방법 중 NN-KT 방법이 소표본(N_{\mathrm{small}}=20\sim80)에서 문항응답 분포 및 교육통계적 재현과 DLKT 예측 성능을 동시에 개선하여, 증강 효과가 가장 뚜렷한 방법으로 확인되었다. 이는 ANN(M2PL-Q) 기반 문항모수 추정의 정확도가 응답 생성 품질을 좌우하고, KT 결합 문항반응모형이 응답 패턴의 다양성과 구조적 일관성을 함께 강화한 결과로 해석할 수 있었다.
    한편, NN-KT 증강 방법으로 훈련된 DLKT의 실제 소규모 형성평가 자료 분석 결과, 학습자의 성취 수준에 따라 옴의 법칙 관련 지식 요소(KC)의 숙달 양상이 구분되었고, 동일 총점내에서도 응답 패턴 차이로 인하여 KC별 숙달 조합이 상이했다. 이는 선행연구에서 보고된 학습 양상과도 일관되었으며, DLKT 분석을 통한 소규모 학급에서의 진단적 정보 제공 가능성을 확인하였다.
    본 연구에서는 물리 교과의 맥락에서 데이터 증강을 통한 소규모 학급 단위 DLKT 모델의 적용 가능성을 확인하였다. 향후 다양한 문항 형식과 교과로의 확장, 추가 DLKT 아키텍처에서의 재현 검증을 비롯한 후속 연구가 요구된다.
    번역하기

    학습자의 지식 상태 분석과 예측을 위한 딥러닝 기반 지식 추적(Deep Learning based Knowledge Tracing, DLKT) 모델은 대규모 훈련 데이터를 요구하기 때문에 데이터 확보가 어려운 소규모 환경에서 적...

    학습자의 지식 상태 분석과 예측을 위한 딥러닝 기반 지식 추적(Deep Learning based Knowledge Tracing, DLKT) 모델은 대규모 훈련 데이터를 요구하기 때문에 데이터 확보가 어려운 소규모 환경에서 적용이 제한되어 왔다. 이에 본 연구는 학급 단위의 소규모 문항응답 데이터 증강을 통하여 DLKT 적용 가능성을 탐색하고자 하였다.
    이를 위하여 문항반응이론 시뮬레이션 기반의 증강 방법을 4종으로 설계하였고, 모의실험과 실제 형성평가 자료에서 각 증강 방법의 교육통계적 재현성과 DLKT 일반화 성능 기여도를 평가·비교하여, 최적의 증강 방법을 제안하였다. 증강 방법 평가에 사용된 모의실험 자료는 선행연구에 근거해 설정한 문항모수와 능력 분포를 바탕으로, IRT 2모수(2PL) 로지스틱 모형에서 생성하였다. 실제 형성평가 자료는 중학교 2학년 학생 대상으로 수집된 옴의 법칙 단원의 형성평가 응답으로, 총 300명의 22문항 응답 자료이다.
    본 연구의 증강 방법은 일반적인 IRT 시뮬레이션 절차를 기반으로 하되, 물리 교과·소규모 학급 맥락에서 다음과 같은 세 가지 핵심 차별점을 반영하여 구성하였다. 첫째, 정규분포 가정에서 벗어나 물리 교과용 학습자 능력분포(CSAT)를 설정하였다. 둘째, 소규모 표본 환경에서 문항모수 추정 불안정성을 해결하기 위해, IRT-BCSM 기반 추정과 Q행렬 제약을 반영한 신경망 기반 추정 ANN(M2PL-Q)을 사용하였다. 셋째, 응답 생성 단계에서 IRT-2PL 문항반응모형과, 지식 상태의 동적 변화를 고려하는 IRT-KT 결합 문항반응모형을 구분하여 설계하였다. 최종적으로 모수 추정 방법과 문항반응모형의 조합으로 NN, BCSM, NN-KT, BCSM-KT 등 4종의 증강 방법을 설계하였고, 비교 기준(베이스라인)으로 단순재표집(bootstrap) 방법을 추가하였다.
    각 증강 방법의 교육통계적 재현성과 DLKT 모델의 일반화 성능 기여도는 모의실험과 실제 형성평가 자료에서 표본 크기(N_{small}) 조건별로, 원자료 대비 증강 자료의 차이를 응답 패턴 분포(JSD), 총점 분포(KS), 문항 간 상관구조(Frobenius norm), 문항 난이도·변별도(MSE) 등의 지표로 정량화하여 평가하였다. 방법 간 차이의 통계적 유의성은 Friedman 검정과 Holm 보정 Wilcoxon 사후검정으로 확인하였다. 또한 증강 자료로 훈련한 DLKT의 AUC, Accuracy, F1-score를 비교하여 각 증강 방법의 일반화 성능 기여도를 평가하였다.
    모의실험 결과, NN과 BCSM 방법은 문항응답 분포 재현과 문항 간 상관구조 보존에서 단순재표집 대비 통계적으로 유의한 개선을 소표본 크기 조건과 무관하게 확인할 수 있었다(p_{adj}<0.001). 반면, 총점 분포 차이 지표(KS)에서는 NN 방법만이 모든 N_{small}에서 기준보다 우수한 성능을 보였다. 이러한 양상은 DLKT 모델의 일반화 성능 결과와도 연결되어, 통계 지표에서의 원본 재현성이 높을수록 AUC, Accuracy가 함께 개선되는 양상을 확인하였다.
    실제 형성평가 자료에 각 증강 방법을 적용한 결과, 방법 간 차이는 대부분의 지표에서 유의했다(Friedman, p<0.001). 특히 사후검정에서 NN-KT는 응답 패턴 및 상관구조 재현에서 기준 대비 일관된 개선을 보였다. 극소표본 N_{small}=20 조건에서 NN-KT는 단순재표집 대비 JSD 91.8%, Frobenius 66.7%, 변별도 MSE 87.0% 감소하였다(p_{adj}<0.001). KS와 난이도 MSE 또한 NN-KT가 기준 대비 각각 44.6%, 50.0% 감소하며 통계적으로 유의하게 개선되었으나, N_{small}\geq80 조건에서는 단순재표집의 성능이 우세하였다(p_{adj}<0.001).
    이러한 결과는 DLKT 모델의 일반화 성능과도 상응하였으며, 설계한 증강 방법의 실질적 효과는 소표본 구간(N_{\mathrm{small}}=20\sim80)에서 뚜렷하게 나타났다. 대표적으로 극소표본 N_{small}=20 조건에서 NN-KT는 AUC(0.793) 21.6%, Accuracy(0.734) 17.3%, F1-score(0.735) 14.8%으로 기준 대비 우세하였다. 한편 N_{small}=100 조건에서 NN-KT의 AUC(0.806)가 기준(0.788) 대비 2.3% 개선되었으나, N_{\mathrm{small}}=120 조건에서는 비교 기준인 단순재표집의 성능이 크게 개선되며(AUC 0.788→0.811) 설계한 증강 방법의 기여도를 관찰할 수 없었다.
    결과적으로, 본 연구에서 설계한 방법 중 NN-KT 방법이 소표본(N_{\mathrm{small}}=20\sim80)에서 문항응답 분포 및 교육통계적 재현과 DLKT 예측 성능을 동시에 개선하여, 증강 효과가 가장 뚜렷한 방법으로 확인되었다. 이는 ANN(M2PL-Q) 기반 문항모수 추정의 정확도가 응답 생성 품질을 좌우하고, KT 결합 문항반응모형이 응답 패턴의 다양성과 구조적 일관성을 함께 강화한 결과로 해석할 수 있었다.
    한편, NN-KT 증강 방법으로 훈련된 DLKT의 실제 소규모 형성평가 자료 분석 결과, 학습자의 성취 수준에 따라 옴의 법칙 관련 지식 요소(KC)의 숙달 양상이 구분되었고, 동일 총점내에서도 응답 패턴 차이로 인하여 KC별 숙달 조합이 상이했다. 이는 선행연구에서 보고된 학습 양상과도 일관되었으며, DLKT 분석을 통한 소규모 학급에서의 진단적 정보 제공 가능성을 확인하였다.
    본 연구에서는 물리 교과의 맥락에서 데이터 증강을 통한 소규모 학급 단위 DLKT 모델의 적용 가능성을 확인하였다. 향후 다양한 문항 형식과 교과로의 확장, 추가 DLKT 아키텍처에서의 재현 검증을 비롯한 후속 연구가 요구된다.

    더보기

    목차 (Table of Contents)

    • I. 서 론 1
    • 1.1 연구의 배경 1
    • 1.2 연구의 목적 5
    • 1.3 연구 과정의 개요 6
    • 1.4 용어의 정의 8
    • I. 서 론 1
    • 1.1 연구의 배경 1
    • 1.2 연구의 목적 5
    • 1.3 연구 과정의 개요 6
    • 1.4 용어의 정의 8
    • II. 이론적 배경 10
    • 2.1 지식 추적 10
    • 2.1.1 베이지안 지식 추적 10
    • 2.1.2 딥러닝 기반 지식 추적 13
    • 2.2 문항반응이론 16
    • 2.2.1 문항반응모형과 문항특성곡선 16
    • 2.2.2 문항모수 추정 22
    • 2.2.3 소규모 표본에서의 문항모수 추정 25
    • 2.2.4 문항반응이론 시뮬레이션 28
    • 2.3 문항반응이론과 지식 추적의 관계 31
    • 2.4 데이터 증강 35
    • III. 연구 방법 37
    • 3.1 소규모 문항응답 데이터 증강 방법 설계 37
    • 3.1.1 학습자 능력 분포 설정 38
    • 3.1.2 문항모수 추정 방법 설정 42
    • 3.1.3 지식 추적 모수 추정 방법 62
    • 3.1.4 문항반응모형 설정 및 문항응답 생성 64
    • 3.1.5 증강 방법 구성 및 베이스라인 정의 76
    • 3.2 증강 방법 비교 및 평가 지표 78
    • 3.2.1 문항응답 분포 재현성 및 교육통계적 특성 보존 78
    • 3.2.2 딥러닝 기반 지식 추적 모델 일반화 성능 80
    • 3.3 모의실험 86
    • 3.3.1 모의실험 자료 86
    • 3.3.2 모의실험 수행절차 89
    • 3.4 물리 형성평가 자료 기반 검증 94
    • 3.4.1 증강 대상 자료 94
    • 3.4.2 지식 요소 정의 및 Q행렬 구성 95
    • 3.4.3 증강 및 딥러닝 기반 지식 추적 수행절차 101
    • IV. 결과 및 논의 110
    • 4.1 모의실험 결과 110
    • 4.1.1 문항응답 분포 재현성 및 교육통계적 특성 보존 110
    • 4.1.2 딥러닝 기반 지식 추적 모델 일반화 성능 129
    • 4.2 물리 형성평가 자료 적용 결과 136
    • 4.2.1 문항응답 분포 재현성 및 교육통계적 특성 보존 136
    • 4.2.2 딥러닝 기반 지식 추적 모델 일반화 성능 158
    • 4.2.3 소규모 학습자의 딥러닝 기반 지식 상태 추정 164
    • V. 결론 및 제언 169
    • 5.1 연구 요약 169
    • 5.2 결론 및 제언 170
    • 5.2.1 연구 결론 170
    • 5.2.2 연구의 한계 및 제언 173
    • 참고문헌 176
    • 부록 183
    • Abstract 189
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼