RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    제로샷 TTS 모델을 활용한 음성 딥페이크 공격 예방을 위한 적대적 음성 활용 기술 연구 = A Study on Adversarial Voice-based Prevention Method against Audio Deepfake Attacks using Zero-shot Text-To-Speech Models

    한글로보기

    https://www.riss.kr/link?id=T17374434

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    음성 딥페이크 공격(Audio Deepfake Attack)은 특정 화자의 음성 특징을 모델 링하여 실제 발화처럼 모방/합성하는 딥러닝 기술 기반의 보안 위협이다. 공격자 는 TTS(Text-To-Speech) 모델에 특정 화자의 목소리를 학습시키는 형태로 공 격에 활용하는데, 제로샷(Zero-shot) TTS 모델의 등장으로 몇 초 분량의 화자 목소리만으로도 화자 특성을 재현할 수 있어 공격의 문턱이 크게 낮아졌다. 이러한 위협에 대응하기 위해 최근 연구에는 음성 워터마크(audio watermar k)를 활용하거나 머신러닝 기반으로 탐지하는 기법과 적대적 음성(adversarial voice example)을 활용한 사전 예방기법이 제안되었다. 특히, 적대적 음성을 활용한 사전 예방기법은 공격자의 TTS 모델이 특정 화자의 목소리를 제대로 모방/합성하지 못하도록 적대적 음성을 활용하는 기법을 말한다. 이는 잠재적 공격자가 원본 음성을 수집하여 악용하기 전, 적대적 잡음이 포함된 음성을 선제적으로 공개/배포하는 방식으로 작동한다. 적대적 음성을 활용한 대표적인 연구로는 AntiFake와 SafeSpeech가 있다. AntiFake는 제로샷 TTS의 전체 추론 경로 중 참조 음성의 정보를 추출하는 인코딩 단계만을 표적으로 섭동을 최적화하여 적대적 음성(Adversarial Voice) 을 생성하는 기법이나, 전체 추론 경로를 반영하지 못하여 이후 디코딩 단계 등 후속단계에서 희석되거나 무력화 될 수 있는 섭동이 생성되는 제한사항이 있다. SafeSpeech는 인간의 청각 인지 특성을 반영하여 표현한 멜 스펙트로그 램(Mel-Spectrogram)의 L1 Norm 거리를 손실함수로 사용하여 적대적 음성을 생성하는 기법이다. 하지만 멜 스펙트로그램은 음성의 세부 주파수 성분 전체 를 포함하기 때문에 이를 직접 비교하여 최적화 할 경우 불필요한 주파수 영 역까지 교란하여 방어성능을 향상시킬 수 있지만 그와 더불어 청각적 품질이 크게 낮아지는 제한사항이 있다. 이러한 제한사항을 해결하기 위해, 본 연구에서는 TTS 모델의 전체 추론경 로를 고려하고, 멜 스펙트로그램에서 화자 임베딩을 추출하여 비교하는 손실 함수를 활용하여 최적화한 적대적 노이즈를 화자 음성에 삽입함으로써 높은 방어 성능과 청각적 품질을 모두 달성하는 진보된 기법인 Adversarial Voice- based Prevention Method for Zero-shot Text-To-Speech Models(AVPM-Z TTS)를 제안한다. 제안 기법은 다음과 같이 4단계로 동작한다. 우선, 초기 적 대적 음성을 생성하고(1단계), TTS 모델로 출력음성을 생성한다(2단계). 그리 고 손실함수 기반으로 섭동을 최적화한 뒤(3단계), 마지막으로 최적화된 섭동 과 원본음성을 더하여 최종 적대적 음성을 생성한다(4단계). 제안 기법의 성능 검증 및 평가를 위해, 상용으로 지원되는 제로샷 모델인 Chatterbox TTS 모델을 타겟 모델로 재설계하여 적대적 음성을 최적화하여 실험을 수행하였다. 각 실험은 보이스클로닝 성능저하 유도 평가(실험 1), 원 본화자 보존 평가(실험 2), 적대적 음성의 청각적 품질 평가(실험 3)를 목적으 로 진행했다. 실험 1의 결과, 타겟 모델에서 제안 기법은 공격성공률(Attack S uccess Rate: ASR) 66.7% 달성하였으며, 평균 화자 유사도(Speaker Similarit y: SIM)는 0.210까지 떨어뜨렸다. 또한 최적화에 사용되지 않은 비표적 모델 들(XTTS, FishSpeech, OpenVoice)에서 기존기법과 비교했을 때 제안기법이 더 높은 공격 성공률을 달성하고 평균 화자 유사도를 더 떨어뜨렸음을 확인했 다. 실험 2와 3을 통해 적대적 음성의 화자가 원본 화자와 동일한 화자로 인 식되며, 음성 품질 지표에서도 기존기법보다 개선되어 제안 기법이 생성한 적 대적 음성이 기존기법보다 상대적으로 적은 왜곡을 사용했음을 보였다. 결론적으로, 본 연구는 강력한 보이스클로닝 성능 저하 유도 성능과 음질 개선을 동시에 확보하여, 음성 딥페이크 공격으로부터 개인의 음성 데이터를 선제적으로 보호할 수 있는 효과적인 방안을 제시하였다. 주요어 : 음성 딥페이크, 적대적 예제, 딥보이스, TTS 모델, 보이스 클로닝
    번역하기

    음성 딥페이크 공격(Audio Deepfake Attack)은 특정 화자의 음성 특징을 모델 링하여 실제 발화처럼 모방/합성하는 딥러닝 기술 기반의 보안 위협이다. 공격자 는 TTS(Text-To-Speech) 모델에 특정 화자...

    음성 딥페이크 공격(Audio Deepfake Attack)은 특정 화자의 음성 특징을 모델 링하여 실제 발화처럼 모방/합성하는 딥러닝 기술 기반의 보안 위협이다. 공격자 는 TTS(Text-To-Speech) 모델에 특정 화자의 목소리를 학습시키는 형태로 공 격에 활용하는데, 제로샷(Zero-shot) TTS 모델의 등장으로 몇 초 분량의 화자 목소리만으로도 화자 특성을 재현할 수 있어 공격의 문턱이 크게 낮아졌다. 이러한 위협에 대응하기 위해 최근 연구에는 음성 워터마크(audio watermar k)를 활용하거나 머신러닝 기반으로 탐지하는 기법과 적대적 음성(adversarial voice example)을 활용한 사전 예방기법이 제안되었다. 특히, 적대적 음성을 활용한 사전 예방기법은 공격자의 TTS 모델이 특정 화자의 목소리를 제대로 모방/합성하지 못하도록 적대적 음성을 활용하는 기법을 말한다. 이는 잠재적 공격자가 원본 음성을 수집하여 악용하기 전, 적대적 잡음이 포함된 음성을 선제적으로 공개/배포하는 방식으로 작동한다. 적대적 음성을 활용한 대표적인 연구로는 AntiFake와 SafeSpeech가 있다. AntiFake는 제로샷 TTS의 전체 추론 경로 중 참조 음성의 정보를 추출하는 인코딩 단계만을 표적으로 섭동을 최적화하여 적대적 음성(Adversarial Voice) 을 생성하는 기법이나, 전체 추론 경로를 반영하지 못하여 이후 디코딩 단계 등 후속단계에서 희석되거나 무력화 될 수 있는 섭동이 생성되는 제한사항이 있다. SafeSpeech는 인간의 청각 인지 특성을 반영하여 표현한 멜 스펙트로그 램(Mel-Spectrogram)의 L1 Norm 거리를 손실함수로 사용하여 적대적 음성을 생성하는 기법이다. 하지만 멜 스펙트로그램은 음성의 세부 주파수 성분 전체 를 포함하기 때문에 이를 직접 비교하여 최적화 할 경우 불필요한 주파수 영 역까지 교란하여 방어성능을 향상시킬 수 있지만 그와 더불어 청각적 품질이 크게 낮아지는 제한사항이 있다. 이러한 제한사항을 해결하기 위해, 본 연구에서는 TTS 모델의 전체 추론경 로를 고려하고, 멜 스펙트로그램에서 화자 임베딩을 추출하여 비교하는 손실 함수를 활용하여 최적화한 적대적 노이즈를 화자 음성에 삽입함으로써 높은 방어 성능과 청각적 품질을 모두 달성하는 진보된 기법인 Adversarial Voice- based Prevention Method for Zero-shot Text-To-Speech Models(AVPM-Z TTS)를 제안한다. 제안 기법은 다음과 같이 4단계로 동작한다. 우선, 초기 적 대적 음성을 생성하고(1단계), TTS 모델로 출력음성을 생성한다(2단계). 그리 고 손실함수 기반으로 섭동을 최적화한 뒤(3단계), 마지막으로 최적화된 섭동 과 원본음성을 더하여 최종 적대적 음성을 생성한다(4단계). 제안 기법의 성능 검증 및 평가를 위해, 상용으로 지원되는 제로샷 모델인 Chatterbox TTS 모델을 타겟 모델로 재설계하여 적대적 음성을 최적화하여 실험을 수행하였다. 각 실험은 보이스클로닝 성능저하 유도 평가(실험 1), 원 본화자 보존 평가(실험 2), 적대적 음성의 청각적 품질 평가(실험 3)를 목적으 로 진행했다. 실험 1의 결과, 타겟 모델에서 제안 기법은 공격성공률(Attack S uccess Rate: ASR) 66.7% 달성하였으며, 평균 화자 유사도(Speaker Similarit y: SIM)는 0.210까지 떨어뜨렸다. 또한 최적화에 사용되지 않은 비표적 모델 들(XTTS, FishSpeech, OpenVoice)에서 기존기법과 비교했을 때 제안기법이 더 높은 공격 성공률을 달성하고 평균 화자 유사도를 더 떨어뜨렸음을 확인했 다. 실험 2와 3을 통해 적대적 음성의 화자가 원본 화자와 동일한 화자로 인 식되며, 음성 품질 지표에서도 기존기법보다 개선되어 제안 기법이 생성한 적 대적 음성이 기존기법보다 상대적으로 적은 왜곡을 사용했음을 보였다. 결론적으로, 본 연구는 강력한 보이스클로닝 성능 저하 유도 성능과 음질 개선을 동시에 확보하여, 음성 딥페이크 공격으로부터 개인의 음성 데이터를 선제적으로 보호할 수 있는 효과적인 방안을 제시하였다. 주요어 : 음성 딥페이크, 적대적 예제, 딥보이스, TTS 모델, 보이스 클로닝

    더보기

    목차 (Table of Contents)

    • 제1장 서 론
    • 제1절 연구 배경 및 목적1
    • 제2절 연구 범위 및 방법4
    • 제2장 배경지식 및 관련 연구
    • 제1절 음성 딥페이크에 활용되는 TTS 모델 6
    • 제1장 서 론
    • 제1절 연구 배경 및 목적1
    • 제2절 연구 범위 및 방법4
    • 제2장 배경지식 및 관련 연구
    • 제1절 음성 딥페이크에 활용되는 TTS 모델 6
    • 제2절 멜 스펙트로그램(Mel-Spectrogram) 9
    • 제3절 음성 적대적 예제11
    • 제4절 기존 연구 13
    • 제3장 제안 기법: AVPM-ZTTS
    • 제1절 문제 기술 및 개선 아이디어 15
    • 제2절 제안 기법 동작 절차16
    • 제3절 제안 기법 설계 19
    • 제4장 실험 결과
    • 제1절 실험 목적 및 방법 25
    • 제2절 실험 결과 및 분석 30
    • 제5장 결론 및 향후 연구계획 34
    • 참고문헌35
    • ABSTRACT 40
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼