RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    오류어와 대치어의 재현율 향상과 정확도 제어를 통한 ‘사용자 적응형 문맥 기반 한국어 맞춤법 검사기’ 개발

    한글로보기

    https://www.riss.kr/link?id=G3698646

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    최근 정보의 소비자가 동시에 생산자가 되는 변화에 힘입어 엄청난 양의 문서가 작성되고 있으며, 스마트폰과 SNS는 이런 흐름을 가속하고 있다. 특히 대용량 문서에서 다양한 지식을 추출하는 마이닝 기술이 주목을 받으면서, 자동으로 대용량 언어자원을 정제하는 기술에 관한 관심이 커지고 있다. 또 기계번역 기술이 발전하면서 원문서의 오류가 오번역의 중요한 원인이 되므로 이를 사전에 제거하려는 필요성이 강력하게 대두하고 있다. 이에 따라 맞춤법/문법 검사기에 관한 관심도 따라 급증하고 있다.
    맞춤법/문법 검사기의 기능은 ① 오류어를 검색하고, ② 이를 교정할 적합한 대치어를 제시하는 것인데, 이러한 기능을 구현하는 기술적 난도는 언어의 특성이나 텍스트를 입력하는 자판의 특성에 따라 다르다. 한국어는 입력 오류율이 아주 높으며, 그중에서도 오류 검색과 교정이 어려운 ‘문맥상 철자오류’(문맥을 분석하지 않으면 오류로 볼 수 없는 유형) 비율이 영어에 비해 4-5배 가량 높아, 맞춤법/문법 검사기를 구현하기 아주 어렵다.
    맞춤법/문법 검사기의 성능은 주로 오류어 검색과 대치어 제시의 정확도(precision)와 재현율(recall)로 평가한다. 이론적으로 두 평가 지표는 반대로 움직인다. 그런데 맞춤법/문법 검사기의 성능에 대한 요구는 사용자나 응용 목적에 따라 아주 다양하다. 물론 맞춤법 검사기가 모든 오류어를 찾아서 항상 올바른 대치어를 제시해주면 좋겠지만, 기술적 한계로 이런 시스템을 만들기는 불가능하다. 따라서 범용 맞춤법/문법 검사기는 일반인이 일상생활에서 사용하는 환경을 대상으로 개발한다. 즉, 어떤 어절이 오류어일 가능성이 아주 높더라도 그 정확도가 100%가 아니라면 이를 바르다고 본다는 것이다. 따라서 현재 사용하는 범용 한국어 맞춤법/문법 검사기는 높은 정확도를 목표로 구현되었고, 재현율이 낮아 다양한 사용자 요구를 충족하지 못하는 근본적인 한계를 갖는다.
    이 연구에서는 이러한 한계를 극복하여 ‘사용자에 따라 재현율과 정확도를 조정할 수 있는 한국어 맞춤법/문법 검사기를 개발’하며, 다음과 같은 내용을 중심으로 이루어진다.
    첫째, 오류 교정규칙을 일반화하여 재현율을 높이는 방법을 연구한다. 기존 범용 한국어 맞춤법/문법 검사기에 사용되는 ‘다중어절 오류 교정패턴’ 약 4만 개와 ‘문맥상 철자오류 교정 규칙’ 약 1만 7천 개가 그 대상이 된다. 우선 어휘 단위에서 연어 관계를 기술한 오류 교정패턴을 규칙으로 전환한다. 다음, 전환된 규칙과 기존 규칙을 일반화하는데, ① 각 규칙의 문맥제약 조건을 약화하고, ② 규칙의 적용 대상이 되는 문맥 관여적 어휘를 한국어 어휘의미망을 이용하여 확장하는 방식을 이용한다.
    둘째, 규칙 일반화에 따라 재현율은 높아지나 정확도가 급격히 떨어질 수 있다 이를 방지하기 위해, 말뭉치 분석을 통해 정확도와 재현율을 평가하고 제어할 수 있는 통계적 방법론을 개발한다. ① 정제된 평가 말뭉치를 이용해 정확도와 재현율의 변화를 통계적으로 계량화하는 방법론을 개발하고, 이 방법론으로 정확도와 재현율의 변화를 단계화함으로써 사용자가 목적에 맞게 성능을 조정할 수 있게 한다. ② 대용량 말뭉치에서 문맥 분석을 통해 구축한 통계적 언어모형을 활용하여 한국어 맞춤법/문법 검사기의 결과를 정제할 수 있는 후처리시스템을 개발한다. 후처리시스템은 맞춤법/문법 검사기의 결과에서 통계적으로 유의미한 대치어만 뽑아서 순서화하여 제공하는 기능을 한다.
    그 결과, 오류어를 검색하고 및 대치어를 제시하는 맞춤법 규칙의 일반화를 통해 재현율을 높이고, 재현율 증가에 동반되는 정확도 감소를 통계적 언어모형으로 최소화함으로써, 정확도와 재현율을 사용 목적에 따라 조정할 수 있는 새로운 개념의 ‘사용자 적응형 문맥 기반 한국어 맞춤법 검사기’ 개발이 이 연구의 최종 목표이다.
    번역하기

    최근 정보의 소비자가 동시에 생산자가 되는 변화에 힘입어 엄청난 양의 문서가 작성되고 있으며, 스마트폰과 SNS는 이런 흐름을 가속하고 있다. 특히 대용량 문서에서 다양한 지식을 추출하...

    최근 정보의 소비자가 동시에 생산자가 되는 변화에 힘입어 엄청난 양의 문서가 작성되고 있으며, 스마트폰과 SNS는 이런 흐름을 가속하고 있다. 특히 대용량 문서에서 다양한 지식을 추출하는 마이닝 기술이 주목을 받으면서, 자동으로 대용량 언어자원을 정제하는 기술에 관한 관심이 커지고 있다. 또 기계번역 기술이 발전하면서 원문서의 오류가 오번역의 중요한 원인이 되므로 이를 사전에 제거하려는 필요성이 강력하게 대두하고 있다. 이에 따라 맞춤법/문법 검사기에 관한 관심도 따라 급증하고 있다.
    맞춤법/문법 검사기의 기능은 ① 오류어를 검색하고, ② 이를 교정할 적합한 대치어를 제시하는 것인데, 이러한 기능을 구현하는 기술적 난도는 언어의 특성이나 텍스트를 입력하는 자판의 특성에 따라 다르다. 한국어는 입력 오류율이 아주 높으며, 그중에서도 오류 검색과 교정이 어려운 ‘문맥상 철자오류’(문맥을 분석하지 않으면 오류로 볼 수 없는 유형) 비율이 영어에 비해 4-5배 가량 높아, 맞춤법/문법 검사기를 구현하기 아주 어렵다.
    맞춤법/문법 검사기의 성능은 주로 오류어 검색과 대치어 제시의 정확도(precision)와 재현율(recall)로 평가한다. 이론적으로 두 평가 지표는 반대로 움직인다. 그런데 맞춤법/문법 검사기의 성능에 대한 요구는 사용자나 응용 목적에 따라 아주 다양하다. 물론 맞춤법 검사기가 모든 오류어를 찾아서 항상 올바른 대치어를 제시해주면 좋겠지만, 기술적 한계로 이런 시스템을 만들기는 불가능하다. 따라서 범용 맞춤법/문법 검사기는 일반인이 일상생활에서 사용하는 환경을 대상으로 개발한다. 즉, 어떤 어절이 오류어일 가능성이 아주 높더라도 그 정확도가 100%가 아니라면 이를 바르다고 본다는 것이다. 따라서 현재 사용하는 범용 한국어 맞춤법/문법 검사기는 높은 정확도를 목표로 구현되었고, 재현율이 낮아 다양한 사용자 요구를 충족하지 못하는 근본적인 한계를 갖는다.
    이 연구에서는 이러한 한계를 극복하여 ‘사용자에 따라 재현율과 정확도를 조정할 수 있는 한국어 맞춤법/문법 검사기를 개발’하며, 다음과 같은 내용을 중심으로 이루어진다.
    첫째, 오류 교정규칙을 일반화하여 재현율을 높이는 방법을 연구한다. 기존 범용 한국어 맞춤법/문법 검사기에 사용되는 ‘다중어절 오류 교정패턴’ 약 4만 개와 ‘문맥상 철자오류 교정 규칙’ 약 1만 7천 개가 그 대상이 된다. 우선 어휘 단위에서 연어 관계를 기술한 오류 교정패턴을 규칙으로 전환한다. 다음, 전환된 규칙과 기존 규칙을 일반화하는데, ① 각 규칙의 문맥제약 조건을 약화하고, ② 규칙의 적용 대상이 되는 문맥 관여적 어휘를 한국어 어휘의미망을 이용하여 확장하는 방식을 이용한다.
    둘째, 규칙 일반화에 따라 재현율은 높아지나 정확도가 급격히 떨어질 수 있다 이를 방지하기 위해, 말뭉치 분석을 통해 정확도와 재현율을 평가하고 제어할 수 있는 통계적 방법론을 개발한다. ① 정제된 평가 말뭉치를 이용해 정확도와 재현율의 변화를 통계적으로 계량화하는 방법론을 개발하고, 이 방법론으로 정확도와 재현율의 변화를 단계화함으로써 사용자가 목적에 맞게 성능을 조정할 수 있게 한다. ② 대용량 말뭉치에서 문맥 분석을 통해 구축한 통계적 언어모형을 활용하여 한국어 맞춤법/문법 검사기의 결과를 정제할 수 있는 후처리시스템을 개발한다. 후처리시스템은 맞춤법/문법 검사기의 결과에서 통계적으로 유의미한 대치어만 뽑아서 순서화하여 제공하는 기능을 한다.
    그 결과, 오류어를 검색하고 및 대치어를 제시하는 맞춤법 규칙의 일반화를 통해 재현율을 높이고, 재현율 증가에 동반되는 정확도 감소를 통계적 언어모형으로 최소화함으로써, 정확도와 재현율을 사용 목적에 따라 조정할 수 있는 새로운 개념의 ‘사용자 적응형 문맥 기반 한국어 맞춤법 검사기’ 개발이 이 연구의 최종 목표이다.

    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼