RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    BERT를 이용한 한국어 기계독해와 질문생성모델 = Machine Reading Comphrehensionand Question Generating Model for Korean Using BERT

    한글로보기

    https://www.riss.kr/link?id=T15772443

    • 저자
    • 발행사항

      춘천 : 강원대학교 대학원, 2021

    • 학위논문사항

      학위논문(석사) -- 강원대학교 대학원 , 빅데이터메디컬융합학과 , 2021. 2

    • 발행연도

      2021

    • 작성언어

      한국어

    • 주제어
    • KDC

      004.735 판사항(6)

    • 발행국(도시)

      강원특별자치도

    • 형태사항

      v. 34 L. : 삽도 ; 30 cm

    • 일반주기명

      강원대학교 논문은 저작권에 의해 보호받습니다
      지도교수:이창기
      참고문헌 : L.31-32

    • UCI식별코드

      I804:42002-000000031859

    • 소장기관
      • 강원대학교 도서관 소장기관정보
    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수

    부가정보

    다국어 초록 (Multilingual Abstract) kakao i 다국어 번역

    Machine Reading Comprehension(MRC) is to analyzing and inferring a paragraph received as input by a machine. Ushing machine reading comphrehension to understand given questions and paragraphs and outputting appropriate answers is question and answer using machine reading comprehension. Building machine reading learning data is difficult task, and you have to manually create the correct answers and questions that can derive the correct answers that appear in the document. In order to solve this problem research on automatic question generation has been actively studied. As opposed to machine reading comprehension, question generation is a task of generating question that can derive correct answers by looking at documents and correct answers. BERT is a language model showing excellent performance in various natural language processing tasks in recent years, and it learns a language model with a transformer with bedirectionality for a large-scale corpus. The pre-trained BERT can be applied to natural language processing tasks by adding an output layer. In this paper, we use KorQuAD 1.0 and KorQuAD 2.0 which are Korean question and answer datasets for machine reading comprehension learning. We propose machine reading comprehension model that adds a SRU(Simaple Recurrent Unit) on pre-trained BERT model and features suitable each dataset and BERT-based Sequence-to-sequence model that adds copying mechanism to then model that automatically generates a question from the document to which the correct answer belongs. As a result of the experiment, when the proposed in this paper was applied to KorQuAD 1.0 data, EM 85.35%, F1 93.24% were shown in the development set, and when was applied to KorQuAD 2.0 data, EM 49.2%, F1 71.21% were shown. In addition, the performance of the BERT-based Transformer decoder model was better than that of the exising model and the BERT + GRU decoder model.
    번역하기

    Machine Reading Comprehension(MRC) is to analyzing and inferring a paragraph received as input by a machine. Ushing machine reading comphrehension to understand given questions and paragraphs and outputting appropriate answers is question and answer u...

    Machine Reading Comprehension(MRC) is to analyzing and inferring a paragraph received as input by a machine. Ushing machine reading comphrehension to understand given questions and paragraphs and outputting appropriate answers is question and answer using machine reading comprehension. Building machine reading learning data is difficult task, and you have to manually create the correct answers and questions that can derive the correct answers that appear in the document. In order to solve this problem research on automatic question generation has been actively studied. As opposed to machine reading comprehension, question generation is a task of generating question that can derive correct answers by looking at documents and correct answers. BERT is a language model showing excellent performance in various natural language processing tasks in recent years, and it learns a language model with a transformer with bedirectionality for a large-scale corpus. The pre-trained BERT can be applied to natural language processing tasks by adding an output layer. In this paper, we use KorQuAD 1.0 and KorQuAD 2.0 which are Korean question and answer datasets for machine reading comprehension learning. We propose machine reading comprehension model that adds a SRU(Simaple Recurrent Unit) on pre-trained BERT model and features suitable each dataset and BERT-based Sequence-to-sequence model that adds copying mechanism to then model that automatically generates a question from the document to which the correct answer belongs. As a result of the experiment, when the proposed in this paper was applied to KorQuAD 1.0 data, EM 85.35%, F1 93.24% were shown in the development set, and when was applied to KorQuAD 2.0 data, EM 49.2%, F1 71.21% were shown. In addition, the performance of the BERT-based Transformer decoder model was better than that of the exising model and the BERT + GRU decoder model.

    더보기

    국문 초록 (Abstract) kakao i 다국어 번역

    기계 독해는 기계가 입력으로 받은 문단을 분석하고 추론하는 것을 말한다. 기계 독해를 이용하여 주어진 질문과 문단을 이해하고 이에 알맞은 답을 출력하는 것을 기계 독해를 이용한 질의 응답이라 한다. 기계 독해 학습 데이터 구축은 어려운 작업으로, 문서에서 등장하는 정답과 정답을 도출할 수 있는 질문을 수작업으로 만들어야 한다. 이를 해결하기 위하여 최근 질문 자동 생성 연구가 활발히 연구되고 있다. 질문 생성은 기계 독해와 반대로, 문서와 정답을 보고 정답을 도출할 수 있는 질문을 생성하는 태스크이다. BERT는 최근 다양한 자연어 처리 태스크에서 뛰어난 성능을 보이고 있는 언어 모델로 대용량 코퍼스에 대하여 양방향성을 가진 트랜스포머(transformer)로 언어 모델을 학습한다. 사전 학습 된 BERT는 출력 층(layer)을 추가하여 자연어 처리 태스크에 적용할 수 있다. 본 논문에서는 기계 독해 학습을 위해 한국어 질의 응답 데이터 셋인 KorQuAD 1.0과 KorQuAD 2.0을 이용하며, 사전 학습 된 BERT 모델 위에 SRU(Simple Recurrent Unit)와 각 데이터에 적합한 자질을 추가한 모델과 정답이 속한 문서로부터 질문을 자동으로 생성해주는 모델에 복사 메커니즘을 추가한 BERT 기반의 Sequence-to-sequence 모델을 제안한다. 실험 결과, 본 논문에서 제안한 방법을 KorQuAD 1.0 데이터에 적용한 경우, 개발 셋에서 EM 85.35%, F1 93.24%의 성능을 보였으며, KorQuAD 2.0 데이터에 적용하였을 때는 EM 49.2%, F1 71.21%의 성능을 보였다. 또한, BERT 기반의 Transformer 디코더 모델의 성능이 기존 모델과 BERT + GRU 디코더 모델보다 좋았다.
    번역하기

    기계 독해는 기계가 입력으로 받은 문단을 분석하고 추론하는 것을 말한다. 기계 독해를 이용하여 주어진 질문과 문단을 이해하고 이에 알맞은 답을 출력하는 것을 기계 독해를 이용한 질의...

    기계 독해는 기계가 입력으로 받은 문단을 분석하고 추론하는 것을 말한다. 기계 독해를 이용하여 주어진 질문과 문단을 이해하고 이에 알맞은 답을 출력하는 것을 기계 독해를 이용한 질의 응답이라 한다. 기계 독해 학습 데이터 구축은 어려운 작업으로, 문서에서 등장하는 정답과 정답을 도출할 수 있는 질문을 수작업으로 만들어야 한다. 이를 해결하기 위하여 최근 질문 자동 생성 연구가 활발히 연구되고 있다. 질문 생성은 기계 독해와 반대로, 문서와 정답을 보고 정답을 도출할 수 있는 질문을 생성하는 태스크이다. BERT는 최근 다양한 자연어 처리 태스크에서 뛰어난 성능을 보이고 있는 언어 모델로 대용량 코퍼스에 대하여 양방향성을 가진 트랜스포머(transformer)로 언어 모델을 학습한다. 사전 학습 된 BERT는 출력 층(layer)을 추가하여 자연어 처리 태스크에 적용할 수 있다. 본 논문에서는 기계 독해 학습을 위해 한국어 질의 응답 데이터 셋인 KorQuAD 1.0과 KorQuAD 2.0을 이용하며, 사전 학습 된 BERT 모델 위에 SRU(Simple Recurrent Unit)와 각 데이터에 적합한 자질을 추가한 모델과 정답이 속한 문서로부터 질문을 자동으로 생성해주는 모델에 복사 메커니즘을 추가한 BERT 기반의 Sequence-to-sequence 모델을 제안한다. 실험 결과, 본 논문에서 제안한 방법을 KorQuAD 1.0 데이터에 적용한 경우, 개발 셋에서 EM 85.35%, F1 93.24%의 성능을 보였으며, KorQuAD 2.0 데이터에 적용하였을 때는 EM 49.2%, F1 71.21%의 성능을 보였다. 또한, BERT 기반의 Transformer 디코더 모델의 성능이 기존 모델과 BERT + GRU 디코더 모델보다 좋았다.

    더보기

    목차 (Table of Contents)

    • 목 차 iii
    • I. 서 론 1
    • II. 관련 연구 4
    • 1. BERT 4
    • 2. SRU(Simple Recurrent Unit) 5
    • 목 차 iii
    • I. 서 론 1
    • II. 관련 연구 4
    • 1. BERT 4
    • 2. SRU(Simple Recurrent Unit) 5
    • 3. 기계독해 5
    • 4. 질문생성 6
    • III. 전처리 및 자질 추출 7
    • 1. KorQuAD 2.0 7
    • 2. 질문 생성 데이터 9
    • IV. 학습 모델 10
    • 1. BERT와 SRU를 이용한 한국어 기계 독해 10
    • 5. BERT-SRU와 HTML Tag 자질을 이용한 한국어 기계 독해 12
    • 6. BERT 기반 한국어 질문 생성 모델 14
    • V. 실험 및 결과 16
    • 1. 실험 데이터 및 환경 16
    • 1) KorQuAD 1.0 17
    • 2) KorQuAD 2.0 17
    • 3) 질문 생성 18
    • 2. 실험 및 결과 19
    • 1) KorQuAD 1.0 실험 및 결과 19
    • 2) KorQuAD 2.0 실험 및 결과 20
    • 3) 질문 생성 실험 및 결과 22
    • VI. 결 론 29
    • VII. 참고 문헌 31
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼