RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    한국어 쓰기 평가를 위한 생성형 인공지능 활용 방안 = Strategies for Utilizing Generative Artificial Intelligence in Korean Writing Assessment

    한글로보기

    https://www.riss.kr/link?id=T17372064

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    전 세계적 K-콘텐츠 인기와 함께 한국어 학습 수요가 폭발적으로 증가한다. 특히 한국어능력시험(이하 TOPIK) 응시자 수는 지난 10년간 110% 급증하여 41만 명에 육박하지만, 아시아 지역에 집중된 교육 시설 및 교원 수급 불균형 문제에 직면한다. 이는 효율적이고 확장 가능한 교육 평가 시스템의 필요성을 절실하게 시사한다. 언어 구사력의 핵심인 쓰기 평가는 학습자의 종합적 능력을 측정하나, 전통적인 인간 평가는 주관성 개입, 막대한 시간 및 비용 부담, 피드백 지연으로 인한 교육적 효과 반감이라는 고질적 한계를 안고 있다.

    이러한 문제 해결의 대안으로, 대규모 언어 모델(LLM) 기반의 생성형 AI가 주목받고 있다. 생성형 AI는 단순한 문법 오류를 넘어 내용의 논리성 및 구조의 일관성과 같은 심층적 영역까지 분석하는 잠재력을 보이며, 쓰기 교육의 패러다임을 전환할 혁신 기술로 평가된다.

    본 연구는 생성형 AI를 한국어 쓰기 평가에 활용하는 방안을 탐구하며, 특히 TOPIK의 맥락에서의 실증적으로 검증하는 것을 목표로 한다. 이를 위해 (1) 인간 전문가 단독 평가, (2) 생성형 AI 단독 평가, (3) 인간과 AI의 협력 평가라는 세 가지 모델을 설정하고, 각 방식의 신뢰도, 교육적 효과성, 시간 효율성을 비교 분석하여 최적의 활용 방안을 모색한다.

    본 연구는 한국어를 학습하는 외국인 학생 30명을 대상으로 모의 TOPIK II 쓰기 시험(53번, 54번)을 실시하여 총 60개의 답안을 확보했다. 평가 도구는 한국어 교육 경력 9년 이상의 전문가 3인과 일관성이 가장 높았던 Gemini 2.5 Pro 모델을 선정했다.

    연구 절차는 인간 단독 평가(1차), AI 단독 평가(2차), AI-인간 협력 평가(3차)의 순서로 진행되며, 각 평가 과정에서 점수, 질적 피드백, 소요 시간을 측정하였다. 특히 AI 평가의 정확성 확보를 위해 루브릭 기반 복합 작업 지시형(Rubric-based Complex Task) 프롬프트를 사용했다. 최종적으로 학생들에게 세 가지 피드백을 모두 제공한 후 만족도 설문조사를 통해 교육 효과성을 검증했다. 신뢰도 분석에는 급내상관계수(ICC)를 활용하였다.

    연구 결과 먼저 ‘신뢰도 및 시간 효율성’에서는 AI(Gemini)는 54번 문항의 '글의 전개 구조' 등 일부 항목에서 인간과 '상당한' 수준의 일치도(ICC 0.5 이상)를 보이며 보조 도구로서의 가능성을 입증했다. 그러나 내용의 깊이나 논리적 오류 판단에서 한계를 보여 AI를 단독 평가자로 활용하는 것은 시기상조로 판단된다.

    다음으로 ‘교육 효과성 및 학생 만족도’에서는 질적 분석 결과, AI 단독 피드백은 문법/어법 오류에 대한 구체적인 수정 예시와 체계성이 높았으며, 긍정적 요소를 세분화하여 학습 동기를 부여하는 데 효과적이었다. 반면, 인간 단독 피드백은 글의 넓은 맥락과 내용의 정확성에 대한 심도 있는 비판(예: 핵심 데이터 누락 지적, 부자연스러운 표현 수정)에 강점을 보였다.

    AI-인간 협력 평가는 AI의 체계적인 분석력과 인간의 심층적인 맥락 판단 및 섬세한 언어적 보완이 결합되어 가장 정밀하고 학습자 적용성이 높은 피드백을 제공하는 것으로 나타난다. 학생 만족도 조사 결과, 학생들은 향후 피드백 방식으로 AI-인간 협력 평가(68.2%)를 압도적으로 선호했으며, 이를 객관적인 평가와 깊이 있는 조언을 동시에 제공하는 유용한 방식으로 평가한다.

    시간 효율성 측면에서, AI 단독 평가는 인간 단독 평가 대비 약 96.15%의 압도적인 시간 절감 효과를 보였다. 가장 주목할 만한 AI-인간 협력 평가 방식은 평가의 질을 유지하면서도 인간 단독 평가 대비 약 21.04%의 시간을 절약하여, 효율과 효과를 동시에 달성할 수 있는 최적의 균형점임을 입증한다.

    본 연구의 한계점도 분명히 존재한다. 수집된 학생의 데이터가 적고, 사용된 생성형 AI의 종류도 한 가지로만 실험을 하였기에 결과를 일반화하는 것은 무리가 있다. 하지만, 본 연구는 생성형 AI가 인간 평가자를 대체하는 존재가 아니라, 인간의 전문성을 강화하고 보완하는 강력한 '협력적 파트너'가 될 때 그 가치가 극대화됨을 실증적으로 확인하였다. 따라서 'AI 보조-인간 주도형 협력 모델'이 한국어 쓰기 평가가 나아가야 할 현실적인 방향임을 제시한다.

    교육 현장에서는 이 협력 시스템을 단계적으로 도입해야 할 때, 연구에서 제시된 가이드라인을 활용하여 평가자를 대상으로 AI의 평가 결과를 비판적으로 수용하고 활용하는‘비판적 AI 리터러시’연수를 기획할 수 있다. 후속 연구로는 대규모 데이터를 활용하여 결과의 일반화 가능성을 검증하고, 다양한 생성형 AI를 활용하여 각각의 툴이 가진 평가의 강점을 세분화하여 AI를 활용한 쓰기 평가의 질을 고도화하는 것을 제언한다.

    ※ 핵심어 : 생성형 AI, 한국어 쓰기 평가, TOPIK, AI-인간 협력, 글쓰기 피드백, 채점 신뢰도, 평가 효율성, 교육적 효과성, LLM 평가, AI-인간 협력 모델, 비판적 AI 리터러시, 프롬프트 엔지니어링
    번역하기

    전 세계적 K-콘텐츠 인기와 함께 한국어 학습 수요가 폭발적으로 증가한다. 특히 한국어능력시험(이하 TOPIK) 응시자 수는 지난 10년간 110% 급증하여 41만 명에 육박하지만, 아시아 지역에 집중...

    전 세계적 K-콘텐츠 인기와 함께 한국어 학습 수요가 폭발적으로 증가한다. 특히 한국어능력시험(이하 TOPIK) 응시자 수는 지난 10년간 110% 급증하여 41만 명에 육박하지만, 아시아 지역에 집중된 교육 시설 및 교원 수급 불균형 문제에 직면한다. 이는 효율적이고 확장 가능한 교육 평가 시스템의 필요성을 절실하게 시사한다. 언어 구사력의 핵심인 쓰기 평가는 학습자의 종합적 능력을 측정하나, 전통적인 인간 평가는 주관성 개입, 막대한 시간 및 비용 부담, 피드백 지연으로 인한 교육적 효과 반감이라는 고질적 한계를 안고 있다.

    이러한 문제 해결의 대안으로, 대규모 언어 모델(LLM) 기반의 생성형 AI가 주목받고 있다. 생성형 AI는 단순한 문법 오류를 넘어 내용의 논리성 및 구조의 일관성과 같은 심층적 영역까지 분석하는 잠재력을 보이며, 쓰기 교육의 패러다임을 전환할 혁신 기술로 평가된다.

    본 연구는 생성형 AI를 한국어 쓰기 평가에 활용하는 방안을 탐구하며, 특히 TOPIK의 맥락에서의 실증적으로 검증하는 것을 목표로 한다. 이를 위해 (1) 인간 전문가 단독 평가, (2) 생성형 AI 단독 평가, (3) 인간과 AI의 협력 평가라는 세 가지 모델을 설정하고, 각 방식의 신뢰도, 교육적 효과성, 시간 효율성을 비교 분석하여 최적의 활용 방안을 모색한다.

    본 연구는 한국어를 학습하는 외국인 학생 30명을 대상으로 모의 TOPIK II 쓰기 시험(53번, 54번)을 실시하여 총 60개의 답안을 확보했다. 평가 도구는 한국어 교육 경력 9년 이상의 전문가 3인과 일관성이 가장 높았던 Gemini 2.5 Pro 모델을 선정했다.

    연구 절차는 인간 단독 평가(1차), AI 단독 평가(2차), AI-인간 협력 평가(3차)의 순서로 진행되며, 각 평가 과정에서 점수, 질적 피드백, 소요 시간을 측정하였다. 특히 AI 평가의 정확성 확보를 위해 루브릭 기반 복합 작업 지시형(Rubric-based Complex Task) 프롬프트를 사용했다. 최종적으로 학생들에게 세 가지 피드백을 모두 제공한 후 만족도 설문조사를 통해 교육 효과성을 검증했다. 신뢰도 분석에는 급내상관계수(ICC)를 활용하였다.

    연구 결과 먼저 ‘신뢰도 및 시간 효율성’에서는 AI(Gemini)는 54번 문항의 '글의 전개 구조' 등 일부 항목에서 인간과 '상당한' 수준의 일치도(ICC 0.5 이상)를 보이며 보조 도구로서의 가능성을 입증했다. 그러나 내용의 깊이나 논리적 오류 판단에서 한계를 보여 AI를 단독 평가자로 활용하는 것은 시기상조로 판단된다.

    다음으로 ‘교육 효과성 및 학생 만족도’에서는 질적 분석 결과, AI 단독 피드백은 문법/어법 오류에 대한 구체적인 수정 예시와 체계성이 높았으며, 긍정적 요소를 세분화하여 학습 동기를 부여하는 데 효과적이었다. 반면, 인간 단독 피드백은 글의 넓은 맥락과 내용의 정확성에 대한 심도 있는 비판(예: 핵심 데이터 누락 지적, 부자연스러운 표현 수정)에 강점을 보였다.

    AI-인간 협력 평가는 AI의 체계적인 분석력과 인간의 심층적인 맥락 판단 및 섬세한 언어적 보완이 결합되어 가장 정밀하고 학습자 적용성이 높은 피드백을 제공하는 것으로 나타난다. 학생 만족도 조사 결과, 학생들은 향후 피드백 방식으로 AI-인간 협력 평가(68.2%)를 압도적으로 선호했으며, 이를 객관적인 평가와 깊이 있는 조언을 동시에 제공하는 유용한 방식으로 평가한다.

    시간 효율성 측면에서, AI 단독 평가는 인간 단독 평가 대비 약 96.15%의 압도적인 시간 절감 효과를 보였다. 가장 주목할 만한 AI-인간 협력 평가 방식은 평가의 질을 유지하면서도 인간 단독 평가 대비 약 21.04%의 시간을 절약하여, 효율과 효과를 동시에 달성할 수 있는 최적의 균형점임을 입증한다.

    본 연구의 한계점도 분명히 존재한다. 수집된 학생의 데이터가 적고, 사용된 생성형 AI의 종류도 한 가지로만 실험을 하였기에 결과를 일반화하는 것은 무리가 있다. 하지만, 본 연구는 생성형 AI가 인간 평가자를 대체하는 존재가 아니라, 인간의 전문성을 강화하고 보완하는 강력한 '협력적 파트너'가 될 때 그 가치가 극대화됨을 실증적으로 확인하였다. 따라서 'AI 보조-인간 주도형 협력 모델'이 한국어 쓰기 평가가 나아가야 할 현실적인 방향임을 제시한다.

    교육 현장에서는 이 협력 시스템을 단계적으로 도입해야 할 때, 연구에서 제시된 가이드라인을 활용하여 평가자를 대상으로 AI의 평가 결과를 비판적으로 수용하고 활용하는‘비판적 AI 리터러시’연수를 기획할 수 있다. 후속 연구로는 대규모 데이터를 활용하여 결과의 일반화 가능성을 검증하고, 다양한 생성형 AI를 활용하여 각각의 툴이 가진 평가의 강점을 세분화하여 AI를 활용한 쓰기 평가의 질을 고도화하는 것을 제언한다.

    ※ 핵심어 : 생성형 AI, 한국어 쓰기 평가, TOPIK, AI-인간 협력, 글쓰기 피드백, 채점 신뢰도, 평가 효율성, 교육적 효과성, LLM 평가, AI-인간 협력 모델, 비판적 AI 리터러시, 프롬프트 엔지니어링

    더보기

    목차 (Table of Contents)

    • 논문 요약 ⅰ
    • Ⅰ. 서론 1
    • Ⅱ. 관련 연구 4
    • 논문 요약 ⅰ
    • Ⅰ. 서론 1
    • Ⅱ. 관련 연구 4
    • 1. 한국어 쓰기 평가 4
    • 2. 자동 쓰기 평가 5
    • 3. 생성형 AI 기반 언어평가 연구 6
    • Ⅲ. 연구 방법 11
    • 1. 연구 대상 11
    • 가. 분석 대상: 학생 답안, 시험 문항, 평가 기준 11
    • 나. 평가 도구: 인간 전문가 및 생성형 AI 14
    • 2. 연구 절차 16
    • 가. 연구 대상 선정 및 자료 수집 17
    • 나. 평가 도구 설계 및 준비 17
    • 다. 단계별 평가 절차 및 데이터 측정 22
    • 라. 데이터 분석 방법 24
    • Ⅳ. 연구 결과 25
    • 1. 채점 신뢰도 25
    • 2. 교육 효과성 41
    • 가. 인간 단독 평가 피드백: 사례와 특징 41
    • 나. AI 단독 평가 피드백: 사례와 특징 45
    • 다. AI-인간 협력 평가 피드백: 사례와 특징 53
    • 라. 3가지 방식에 대한 학생들의 만족도 65
    • 3. 시간 효율성 72
    • 4. 쓰기평가에서 생성형AI 적용 가이드라인 75
    • V. 결론 및 제언 82
    • 참고 문헌 85
    • 부록 89
    • 영문 초록 111
    • 감사의 글 115
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼