RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    교육 지식 그래프 구축을 위한 ACE 피드백 루프의 LLM 기반 평가

    한글로보기

    https://www.riss.kr/link?id=T17387649

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
      • URL 복사
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    교육 지식 그래프(Educational Knowledge Graph, EKG)는 학습 개념 간 선수학습(prerequisite) 관계를 구조화하여 개인화 학습 경로 추천, 커리큘럼 설계, 적응형 학습 시스템 등에 활용된다. 그러나 고품질 EKG 구축은 도메인 전문가의 수작업에 의존하여 비용과 확장성 문제가 존재한다. ACE(AI-Assisted Construction of EKG)는 CSR(Cumulative Semantic Reference) 기반 순위화와 전문가 피드백 루프를 통해 이 문제를 완화하였으나, 여전히 인간 전문가의 개입이 필수적이다.
    본 연구는 ACE의 전문가 피드백 루프를 대규모 언어 모델(LLM, gpt-4o-mini)로 대체하는 가능성을 검토한다. 연구는 두 가지 관점에서 LLM의 성능을 평가하였다. 첫째는 분류기로서의 성능(UCD 데이터셋 대상 실험), 둘째는 MEKG(Minimal Educational Knowledge Graph) 생성기로서의 성능(DSA, Metacademy 데이터셋 대상 실험)이다. ACE 연구에서 제시한 2단계 Chain-of-Thought 프롬프트를 사용하여 재현성을 확보하는 한편 N=5 다수결 투표를 적용하여 응답의 안정성을 확보하였으며, 공개되지 않은 개념 설명 텍스트는 직접 확보하여 재현 실험과 본 실험을 진행하였다.
    실험 결과, LLM의 제로샷 분류 F1(0.818)은 CSR_bin(0.649)보다 0.169 높아 분류기로서 우수한 성능을 보였다. 소규모 그래프(DSA, 29개 정점)에서는 F1 0.661로 제한적으로 유효한 MEKG 구축이 가능함을 확인하였다. 그러나 대규모 그래프(Metacademy, 141개 정점)에서는 LLM의 거짓 양성(False Positive) 응답이 폭증하여 F1이 0.307로 저하되었으며, 합의율(0.990)이 높음에도 오답이 많은 확신 있는 오답 현상이 관찰되었다. 결론적으로 ACE 프로세스는 준수한 재현 가능성을 보여주었으나, 논문과 달리 F1을 최대화하는 임곗값에서의 CSR 분류 재현율이 1에 미달하여 다소 불안정하게 재현되었다. 이에 따라 2단계인 전문가 판단에서 정밀도만이 아닌 재현율까지도 다시 고려해야 하는 상황이 되어, ACE 프로세스의 강점 중 하나가 희석됨을 확인하였다. 또한, LLM으로 전문가 판단을 대체하려 할 경우, 선수학습 관계가 상대적으로 뚜렷한 분야에서의 소규모 밀집 그래프에서 제한적으로 유효하게 사용될 수 있음을 확인하였다. 반면 대규모 희소 그래프에서 전문가 역할을 LLM으로 대신 수행하기 위해서는 추가적인 전략이 필요함을 확인하였다. 추후 도메인에 최적화된 프롬프트 엔지니어링, 양방향 판단 상황에서의 인간 협업 방식 등을 도입하여 개선할 수 있을 것으로 기대된다.
    번역하기

    교육 지식 그래프(Educational Knowledge Graph, EKG)는 학습 개념 간 선수학습(prerequisite) 관계를 구조화하여 개인화 학습 경로 추천, 커리큘럼 설계, 적응형 학습 시스템 등에 활용된다. 그러나 고품...

    교육 지식 그래프(Educational Knowledge Graph, EKG)는 학습 개념 간 선수학습(prerequisite) 관계를 구조화하여 개인화 학습 경로 추천, 커리큘럼 설계, 적응형 학습 시스템 등에 활용된다. 그러나 고품질 EKG 구축은 도메인 전문가의 수작업에 의존하여 비용과 확장성 문제가 존재한다. ACE(AI-Assisted Construction of EKG)는 CSR(Cumulative Semantic Reference) 기반 순위화와 전문가 피드백 루프를 통해 이 문제를 완화하였으나, 여전히 인간 전문가의 개입이 필수적이다.
    본 연구는 ACE의 전문가 피드백 루프를 대규모 언어 모델(LLM, gpt-4o-mini)로 대체하는 가능성을 검토한다. 연구는 두 가지 관점에서 LLM의 성능을 평가하였다. 첫째는 분류기로서의 성능(UCD 데이터셋 대상 실험), 둘째는 MEKG(Minimal Educational Knowledge Graph) 생성기로서의 성능(DSA, Metacademy 데이터셋 대상 실험)이다. ACE 연구에서 제시한 2단계 Chain-of-Thought 프롬프트를 사용하여 재현성을 확보하는 한편 N=5 다수결 투표를 적용하여 응답의 안정성을 확보하였으며, 공개되지 않은 개념 설명 텍스트는 직접 확보하여 재현 실험과 본 실험을 진행하였다.
    실험 결과, LLM의 제로샷 분류 F1(0.818)은 CSR_bin(0.649)보다 0.169 높아 분류기로서 우수한 성능을 보였다. 소규모 그래프(DSA, 29개 정점)에서는 F1 0.661로 제한적으로 유효한 MEKG 구축이 가능함을 확인하였다. 그러나 대규모 그래프(Metacademy, 141개 정점)에서는 LLM의 거짓 양성(False Positive) 응답이 폭증하여 F1이 0.307로 저하되었으며, 합의율(0.990)이 높음에도 오답이 많은 확신 있는 오답 현상이 관찰되었다. 결론적으로 ACE 프로세스는 준수한 재현 가능성을 보여주었으나, 논문과 달리 F1을 최대화하는 임곗값에서의 CSR 분류 재현율이 1에 미달하여 다소 불안정하게 재현되었다. 이에 따라 2단계인 전문가 판단에서 정밀도만이 아닌 재현율까지도 다시 고려해야 하는 상황이 되어, ACE 프로세스의 강점 중 하나가 희석됨을 확인하였다. 또한, LLM으로 전문가 판단을 대체하려 할 경우, 선수학습 관계가 상대적으로 뚜렷한 분야에서의 소규모 밀집 그래프에서 제한적으로 유효하게 사용될 수 있음을 확인하였다. 반면 대규모 희소 그래프에서 전문가 역할을 LLM으로 대신 수행하기 위해서는 추가적인 전략이 필요함을 확인하였다. 추후 도메인에 최적화된 프롬프트 엔지니어링, 양방향 판단 상황에서의 인간 협업 방식 등을 도입하여 개선할 수 있을 것으로 기대된다.

    더보기

    다국어 초록 (Multilingual Abstract) kakao i 다국어 번역

    Educational Knowledge Graphs (EKGs) structure prerequisite relationships among learning concepts to support personalized learning path recommendations, curriculum design, and adaptive learning systems. However, constructing high-quality EKGs relies on manual efforts by domain experts, posing challenges in terms of cost and scalability. ACE (AI-Assisted Construction of EKG) mitigates these issues through CSR (Cumulative Semantic Reference)-based ranking and expert feedback loops, yet human expert involvement remains essential.
    This study investigates the feasibility of replacing ACE's expert feedback loop with a Large Language Model (LLM, gpt-4o-mini). LLM performance was evaluated from two perspectives: first, as a classifier (experiments on the UCD dataset), and second, as a generator of MEKGs (Minimal Educational Knowledge Graphs) (experiments on DSA and Metacademy datasets). Reproducibility was ensured by employing the two-stage Chain-of-Thought prompts presented in the ACE study, while response stability was achieved through N=5 majority voting. Concept description texts that were not publicly available were independently obtained to conduct both replication and main experiments.
    Experimental results showed that the LLM's zero-shot classification F1 (0.818) exceeded CSR_bin (0.649) by 0.169, demonstrating superior classifier performance. For small-scale graphs (DSA, 29 vertices), limited but valid MEKG construction was confirmed with an F1 of 0.661. However, for large-scale graphs (Metacademy, 141 vertices), LLM false positive responses surged, causing F1 to drop to 0.307. Despite high agreement rates (0.990), a phenomenon of confident errors—frequent incorrect answers with high certainty—was observed. In conclusion, the ACE process demonstrated reasonable reproducibility; however, unlike the original paper, CSR classification recall at the F1-maximizing threshold fell below 1, resulting in somewhat unstable replication. Consequently, the second stage of expert judgment required reconsidering not only precision but also recall, thereby diluting one of ACE's key strengths. Furthermore, when attempting to replace expert judgment with LLMs, effectiveness was confirmed to be limited to small, dense graphs in domains where prerequisite relationships are relatively well-defined. In contrast, additional strategies are required for LLMs to assume expert roles in large, sparse graphs. Future improvements may be achieved through domain-optimized prompt engineering and human-AI collaboration approaches for bidirectional judgment scenarios.
    번역하기

    Educational Knowledge Graphs (EKGs) structure prerequisite relationships among learning concepts to support personalized learning path recommendations, curriculum design, and adaptive learning systems. However, constructing high-quality EKGs relies on...

    Educational Knowledge Graphs (EKGs) structure prerequisite relationships among learning concepts to support personalized learning path recommendations, curriculum design, and adaptive learning systems. However, constructing high-quality EKGs relies on manual efforts by domain experts, posing challenges in terms of cost and scalability. ACE (AI-Assisted Construction of EKG) mitigates these issues through CSR (Cumulative Semantic Reference)-based ranking and expert feedback loops, yet human expert involvement remains essential.
    This study investigates the feasibility of replacing ACE's expert feedback loop with a Large Language Model (LLM, gpt-4o-mini). LLM performance was evaluated from two perspectives: first, as a classifier (experiments on the UCD dataset), and second, as a generator of MEKGs (Minimal Educational Knowledge Graphs) (experiments on DSA and Metacademy datasets). Reproducibility was ensured by employing the two-stage Chain-of-Thought prompts presented in the ACE study, while response stability was achieved through N=5 majority voting. Concept description texts that were not publicly available were independently obtained to conduct both replication and main experiments.
    Experimental results showed that the LLM's zero-shot classification F1 (0.818) exceeded CSR_bin (0.649) by 0.169, demonstrating superior classifier performance. For small-scale graphs (DSA, 29 vertices), limited but valid MEKG construction was confirmed with an F1 of 0.661. However, for large-scale graphs (Metacademy, 141 vertices), LLM false positive responses surged, causing F1 to drop to 0.307. Despite high agreement rates (0.990), a phenomenon of confident errors—frequent incorrect answers with high certainty—was observed. In conclusion, the ACE process demonstrated reasonable reproducibility; however, unlike the original paper, CSR classification recall at the F1-maximizing threshold fell below 1, resulting in somewhat unstable replication. Consequently, the second stage of expert judgment required reconsidering not only precision but also recall, thereby diluting one of ACE's key strengths. Furthermore, when attempting to replace expert judgment with LLMs, effectiveness was confirmed to be limited to small, dense graphs in domains where prerequisite relationships are relatively well-defined. In contrast, additional strategies are required for LLMs to assume expert roles in large, sparse graphs. Future improvements may be achieved through domain-optimized prompt engineering and human-AI collaboration approaches for bidirectional judgment scenarios.

    더보기

    목차 (Table of Contents)

    • 제1장 서론 1
    • 1. 연구의 필요성 및 기대 효과 1
    • 가. 교육 환경의 변화와 새로운 과제 1
    • 나. 교육 지식 그래프의 필요성 2
    • 다. 수동 구축의 한계와 확장성 문제 2
    • 제1장 서론 1
    • 1. 연구의 필요성 및 기대 효과 1
    • 가. 교육 환경의 변화와 새로운 과제 1
    • 나. 교육 지식 그래프의 필요성 2
    • 다. 수동 구축의 한계와 확장성 문제 2
    • 라. ACE 접근법과 LLM을 이용한 대체 가능성 탐색 3
    • 2. 연구 문제 4
    • 가. ACE 재현 실험의 필요성과 어려움 4
    • 나. LLM의 전문가 대체 가능성 검토 5
    • 3. 용어의 정의 6
    • 가. MEKG (Minimal Educational Knowledge Graph) 6
    • 나. 추이적 축소 (Transitive Reduction) 6
    • 다. 추이적 폐포 (Transitive Closure) 7
    • 라. CSR (Cumulative Semantic Reference) 7
    • 마. PRS (Prerequisite Rank Scoring) 7
    • 4. 논문 구성 7
    • 제2장 이론적 배경 9
    • 1. 선수학습 관계 학습 9
    • 2. 교육 지식 그래프 구축 11
    • 3. 대규모 언어 모델과 지식 그래프 13
    • 4. ACE 연구의 실험 상세 13
    • 가. ACE 실험 1: CSR 기반 선수학습 관계 분류 13
    • 나. ACE 실험 3: MEKG 구축 및 전문가 노력 절감 14
    • 5. 본 연구의 위치 및 기존 연구와의 차별점 16
    • 제3장 연구 방법 및 절차 17
    • 1. 문제 정의 17
    • 가. 교육 지식 그래프(EKG) 17
    • 나. 최소 교육용 지식 그래프(MEKG) 18
    • 다. 연구 목표 18
    • 2. 데이터셋 및 전처리 19
    • 가. ACE 원본 데이터 재현의 어려움 19
    • 나. 데이터 수집 21
    • 다. 개념 설명 텍스트 전처리 23
    • 라. 각 데이터셋별 구성 및 추가 처리 23
    • 3. CSR 및 PRS 계산 23
    • 가. CSR (Cumulative Semantic Reference) 23
    • 나. PRS (Prerequisite Rank Scoring) 24
    • 다. CSR_bin 분류기 (실험 1 재현) 25
    • 4. LLM을 이용한 선수학습 관계 판단 25
    • 가. 모델 및 설정 25
    • 나. Temperature=0의 비결정성과 N=5 다수결의 필요성 26
    • 다. 제로샷 프롬프트 26
    • 라. 다수결 및 합의율 27
    • 마. 양방향 처리 27
    • 바. 사이클 방지 및 추이적 축소 28
    • 사. LLM을 이용한 선수학습 관계 판단 수행 28
    • 5. 평가 지표 30
    • 가. 평가 지표 30
    • 나. 전 방향 전수 평가 30
    • 6. 실험 구성 요약 31
    • 제4장 실험 및 결과 해석 32
    • 1. 실험 환경 32
    • 가. 하드웨어 및 소프트웨어 32
    • 나. random seed: 42 32
    • 다. 코드 작성 도구 32
    • 2. 실험 1: CSR 및 LLM 제로샷 분류 재현 실험 (UCD) 33
    • 가. 실험 목적 33
    • 나. CSR_bin 재현 결과 33
    • 다. LLM 제로샷 분류(재현 실험) 및 결과 해석을 위한 비교 34
    • 3. 실험 2: LLM 기반 MEKG 구축 35
    • 가. 실험 목적 35
    • 나. MEKG 구축 재현 결과 36
    • 다. LLM을 이용한 선수학습 관계 판단 결과 38
    • 라. 양방향 전수 평가 39
    • 4. 결과 해석 40
    • 가. Metacademy FP 폭증 원인 분석 40
    • 나. 그래프 규모에 따른 성능 차이 40
    • 다. 연구 문제에 대한 결론 41
    • 5. 실험 결과 요약 42
    • 제5장 결론 및 논의 43
    • 1. 연구 요약 43
    • 가. 실험 1: 분류기 성능 평가 (UCD) 43
    • 나. 실험 2: MEKG 생성기 성능 평가 (DSA, Metacademy) 43
    • 2. 연구 기여 44
    • 3. 한계 및 향후 연구 방향 45
    • 4. 결론 45
    • <부록 1 > Wikipedia 설명 텍스트 수집을 위한 의사코드 51
    • <부록 2 > CSR_bin 분류 수행 의사코드 53
    • <부록 3 > N=5 다수결 투표 54
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼