본 논문은 얼굴 기반 화자 정보를 활용한 다중모달 음성 합성의 새로운 접근 방식을 탐구하며, 특히 음고(pitch)의 일관성 향상과 표현력 있고 개인화된 음성 생성을 목표로 한다. 이를 위해 ...
본 논문은 얼굴 기반 화자 정보를 활용한 다중모달 음성 합성의 새로운 접근 방식을 탐구하며, 특히 음고(pitch)의 일관성 향상과 표현력 있고 개인화된 음성 생성을 목표로 한다. 이를 위해 얼굴 이미지로부터 음성을 생성하는 기법을 제안하고, 이를 근전도(EMG) 기반 음성 합성 및 입술 영상 기반 음성 합성이라는 두 가지 대표적인 과제에 적용하였다.
먼저, 얼굴 이미지로부터 화자의 평균 기본 주파수($F_0$)를 추정하여 전역 음고 일관성을 향상시키는 얼굴 기반 음성 변환 프레임워크를 제안한다. 본 방법은 시각적 얼굴 정보와 음성 특성 간의 내재된 상관관계를 학습함으로써, 대상 화자의 음성을 요구하지 않고도 일관된 음고 특성과 화자 고유의 음색을 반영한 음성 생성을 가능하게 한다. 또한, 기존 화자 구분 모델에 의존한 목소리 평가의 해석력 한계를 극복하기 위해 해석 가능한 화자 평가 벡터를 새롭게 제안하였으며, 이를 통해 합성 음성의 화자 분석에 효과적으로 활용할 수 있음을 보였다.
다음으로, 얼굴 이미지를 활용한 다화자 무음성 생체신호 기반 음성 합성 프레임워크를 소개한다. 제안하는 구조에서는 EMG 신호를 통해 언어적 콘텐츠 정보를 추출하고, 얼굴 이미지를 통해 화자 정보를 부여한다. 특히, EMG와 음성 간의 모달리티 불일치를 해소하기 위해 음고 평탄화 모듈을 도입하여, 언어 표현력과 콘텐츠 기반의 지역 음고 일관성을 개선하였으며, 이를 통해 기존에 없던 다화자 무음성 음성 합성이 가능함을 입증하였다.
마지막으로, 운율 일관성을 향상시킨 입술 영상 기반 음성 합성 프레임워크를 제안한다. 최신 확산 기반 모델을 기반으로, 학습 단계에서는 음고 및 에너지 정보를 지도 학습하고, 추론 단계에서는 무음성 영상 입력으로부터 해당 운율 정보를 추정한다. 제안된 방법은 음고와 에너지의 시간적 변화를 효과적으로 포착함으로써 운율 표현력을 크게 향상시키면서도 높은 명료도의 음성을 생성할 수 있음을 보였다.
이러한 일련의 연구를 통해, 본 논문은 얼굴 이미지 기반 다중모달 음성 합성 분야에서 전역 음고의 일관성을 확보함과 동시에 화자 개인화 및 표현력 있는 음성 생성을 실현할 수 있음을 실증하였다. 제안된 방법은 무음성 생체신호 및 시각 정보만으로도 화자의 정체성을 보존한 음성 합성이 가능함을 보여주며, 향후 발화에 어려움을 겪는 사용자에게 자연스럽고 개인화된 음성 전달 수단으로 활용될 수 있을 것으로 기대된다.