RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    인공신경망을 이용한 영어 음향-조음 역변환 모델 연구

    한글로보기

    https://www.riss.kr/link?id=T14704473

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
      • URL 복사
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    음향-조음 역변환(acoustic-to-articulatory inversion)이란 음향 정보(acoustic features)를 통해 조음점(articulators)을 역추적하는 방법으로 이론적, 실용적 측면에서 다양하게 활용될 수 있는 중요한 연구임에도 불구하고, 문제 자체의 비고유성(non-uniqueness)과 비선형성(non-linearity)으로 인해 해결하기 어렵다는 단점을 갖는다. 본 연구에서는 이러한 음향-조음 역변환 문제를 해결하기 위해 선행연구에서 제시한 다양한 기계학습(machine learning) 방식을 참고하여 1개의 네트워크로 구성된 단일 기계학습 모델과, 2개의 네트워크로 구성된 복합 기계학습 모델을 제시하여 음향-조음 역변환 문제 해결에 가장 적합한 기계학습 모델을 알아보고자 한다.

    본 실험에서는 단일 기계학습 모델을 DNN(Deep Neural Network), CNN(Convolutional Neural Network), RNN(Recurrent Neural Network), BRNN(Bidirectional RNN) 모델로 구성하여 음향 데이터를 가장 정확하게 학습하는 모델을 파악하고, 복합 기계학습 모델은 DRNN(DNN-RNN), DBRNN(DNN-BRNN), CBRNN(CNN-BRNN) 모델로 구성함으로써 앞 단 모델에서 음향 데이터의 특징을 가장 잘 추출하는 모델을 알아보고자 한다. 모델의 학습을 위해 mngu0 코퍼스의 음향 정보를 입력값(input)으로 삼고, EMA(electromagnetic articulo-graphy) 조음 정보를 목표값(target)으로 이용하여 전체 모델을 학습하였다.

    훈련이 완료된 모델에 mngu0 코퍼스에서 제공하는 테스트 음향 정보를 넣어 조음점을 예측하였으며 그에 대한 RMSE(Root Mean Square Error)를 계산하였다. 단일 기계학습에서는 음향 데이터의 시간정보를 양방향으로 동시에 훈련하는 BRNN 모델(RMSE: 1.022mm)이 단방향 만으로 훈련하는 RNN 모델(RMSE: 1.126mm)보다 우수한 성능을 거두었으며, RNN 모델은 DNN 모델(RMSE: 1.140mm)보다 DNN 모델은 CNN 모델(RMSE: 1.194mm)보다 더 나은 성능을 보여주었다. 이는 음향-조음 역변환 문제를 다룰 때, 시간 정보의 학습이 매우 중요하다는 것을 의미한다. 복합 기계학습 모델에서는 CBRNN 모델(RMSE: 0.975mm)이 DBRNN 모델(RMSE: 1.011mm)보다 더 나은 성능을 보였는데 이는 CNN 모델의 음향 데이터 특징 추출 능력이 DNN 모델보다 탁월하다는 것을 의미하며, CNN 모델 자체의 부족한 시계열 음향 특징(temporal acoustic features)의 학습능력을 시계열 정보 학습에 뛰어난 BRNN 모델을 통해 극복하였다고 볼 수 있다.
    번역하기

    음향-조음 역변환(acoustic-to-articulatory inversion)이란 음향 정보(acoustic features)를 통해 조음점(articulators)을 역추적하는 방법으로 이론적, 실용적 측면에서 다양하게 활용될 수 있는 중요한 연구...

    음향-조음 역변환(acoustic-to-articulatory inversion)이란 음향 정보(acoustic features)를 통해 조음점(articulators)을 역추적하는 방법으로 이론적, 실용적 측면에서 다양하게 활용될 수 있는 중요한 연구임에도 불구하고, 문제 자체의 비고유성(non-uniqueness)과 비선형성(non-linearity)으로 인해 해결하기 어렵다는 단점을 갖는다. 본 연구에서는 이러한 음향-조음 역변환 문제를 해결하기 위해 선행연구에서 제시한 다양한 기계학습(machine learning) 방식을 참고하여 1개의 네트워크로 구성된 단일 기계학습 모델과, 2개의 네트워크로 구성된 복합 기계학습 모델을 제시하여 음향-조음 역변환 문제 해결에 가장 적합한 기계학습 모델을 알아보고자 한다.

    본 실험에서는 단일 기계학습 모델을 DNN(Deep Neural Network), CNN(Convolutional Neural Network), RNN(Recurrent Neural Network), BRNN(Bidirectional RNN) 모델로 구성하여 음향 데이터를 가장 정확하게 학습하는 모델을 파악하고, 복합 기계학습 모델은 DRNN(DNN-RNN), DBRNN(DNN-BRNN), CBRNN(CNN-BRNN) 모델로 구성함으로써 앞 단 모델에서 음향 데이터의 특징을 가장 잘 추출하는 모델을 알아보고자 한다. 모델의 학습을 위해 mngu0 코퍼스의 음향 정보를 입력값(input)으로 삼고, EMA(electromagnetic articulo-graphy) 조음 정보를 목표값(target)으로 이용하여 전체 모델을 학습하였다.

    훈련이 완료된 모델에 mngu0 코퍼스에서 제공하는 테스트 음향 정보를 넣어 조음점을 예측하였으며 그에 대한 RMSE(Root Mean Square Error)를 계산하였다. 단일 기계학습에서는 음향 데이터의 시간정보를 양방향으로 동시에 훈련하는 BRNN 모델(RMSE: 1.022mm)이 단방향 만으로 훈련하는 RNN 모델(RMSE: 1.126mm)보다 우수한 성능을 거두었으며, RNN 모델은 DNN 모델(RMSE: 1.140mm)보다 DNN 모델은 CNN 모델(RMSE: 1.194mm)보다 더 나은 성능을 보여주었다. 이는 음향-조음 역변환 문제를 다룰 때, 시간 정보의 학습이 매우 중요하다는 것을 의미한다. 복합 기계학습 모델에서는 CBRNN 모델(RMSE: 0.975mm)이 DBRNN 모델(RMSE: 1.011mm)보다 더 나은 성능을 보였는데 이는 CNN 모델의 음향 데이터 특징 추출 능력이 DNN 모델보다 탁월하다는 것을 의미하며, CNN 모델 자체의 부족한 시계열 음향 특징(temporal acoustic features)의 학습능력을 시계열 정보 학습에 뛰어난 BRNN 모델을 통해 극복하였다고 볼 수 있다.

    더보기

    목차 (Table of Contents)

    • 목차
    • 표 목차 .............................................................................................................................. II
    • 그림 목차........................................................................................................................... II
    • 국문 요약.......................................................................................................................... IV
    • 1 서론 ........................................................................................................................... 1
    • 목차
    • 표 목차 .............................................................................................................................. II
    • 그림 목차........................................................................................................................... II
    • 국문 요약.......................................................................................................................... IV
    • 1 서론 ........................................................................................................................... 1
    • 1.1 음향-조음 역변환(speech inversion)이란 무엇인가? .......................... 1
    • 1.2 조음 형태 재구성의 난점 ............................................................................... 2
    • 1.2.1 조음 형태의 설명 방법 ........................................................................... 2
    • 1.2.2 비선형성(non-linearity)과 비고유성(non-uniqueness)의 문제 ................................................................................................................... 4
    • 1.3 음향-조음 역변환 연구의 흐름 .................................................................... 7
    • 1.4 speech inversion 연구를 통한 응용 분야 ................................................... 13
    • 1.5 본 연구의 목적 .............................................................................................. 15
    • 2 연구 방법 ................................................................................................................ 17
    • 2.1 훈련을 위한 데이터 선정 ............................................................................. 17
    • 2.2 실험을 위한 다양한 기계학습 구조 설명................................................... 21
    • 2.2.1 단일 기계학습 모델 생성 ..................................................................... 22
    • 2.2.2 복합 기계학습 모델 생성 ..................................................................... 41
    • 3 연구 결과 ................................................................................................................ 47
    • 3.1 각 기계학습 별 성능결과 ............................................................................. 47
    • 3.1.1 단일 기계학습 모델의 세대별 RMSE 변화....................................... 49
    • 3.1.2 복합 기계학습 모델의 세대별 RMSE 변화....................................... 56
    • 3.2 모델을 통한 예측값 추이 비교 .................................................................... 57
    • 4 결론 ......................................................................................................................... 61
    • 4.1 시계열 정보 훈련 .......................................................................................... 61
    • 4.2 특징 추출 ........................................................................................................ 63
    • 참고문헌 ........................................................................................................................... 65
    • Abstract ............................................................................................................................. 72
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼