현대의 화자인증 시스템은 보안, 사용자 인증, 음성 기반 인터페이스 등 다양한 분야에서 활용되며, 이에 따라 신뢰도 높은 화자 표현 기술의 중요성이 커지고 있다. 최근 딥러닝 기반의 종...
현대의 화자인증 시스템은 보안, 사용자 인증, 음성 기반 인터페이스 등 다양한 분야에서 활용되며, 이에 따라 신뢰도 높은 화자 표현 기술의 중요성이 커지고 있다. 최근 딥러닝 기반의 종단 간 학습 방식은 임베딩 추출과 스코어링을 통합하여 전반적인 화자인증 성능을 크게 향상시키고 있다. 이와 같은 배경에서, 본 논문은 딥러닝 기반의 화자인증 시스템의 강인성, 정확도, 결정 신뢰도를 향상시키기 위한 세 가지 새로운 기법을 제안한다.
우선, 프레임 수준과 문장 수준 간의 상호 정보를 최대화하는 정보 보존 풀링 기법을 통해, 일반적인 풀링 과정에서 발생할 수 있는 정보 손실 문제를 완화하고 보다 정밀한 화자 표현을 가능하게 한다.
둘째, 검증 목적에 최적화된 일반화된 점수 비교 학습 목적(GSC loss)을 도입하여, 동일/비동일 화자 음성 간 점수 분리를 효과적으로 학습한다.
셋째, 예측 불확실성을 정량화할 수 있는 증거 기반 스코어링 네트워크(ESN)를 제안하여 OOD(분포 바깥) 환경에서도 신뢰도 높은 판단을 가능하게 한다.
제안된 기법들은 ECAPA-TDNN, MFA-Conformer 등 다양한 모델과 결합하여, VoxCeleb 및 CN-Celeb 데이터셋에서 수행된 다양한 실험을 통해 일관된 성능 향상과 시스템의 신뢰도 개선을 보였다. 본 연구는 기존 화자 임베딩 시스템에 유연하게 통합될 수 있으며, 향후 불확실성 인식 및 검증 중심 학습 방식 연구의 기반을 제공한다.