RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    AI 기반 군사 시스템에 적용할 한국어 사전 학습 언어 모델의 백도어 공격 취약성 분석 = An Analysis of Backdoor Attack Vulnerabilities in Korean Pre-trained Language Models for AI-based Military Systems

    한글로보기

    https://www.riss.kr/link?id=T17374331

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    국방부가 인공지능(Artificial Intelligence, AI) 기술을 기반으로 개발을 추진 하고 있는 AI 군사참모가 성공적으로 안착하기 위해서는 체계 구축의 핵심이 되는 사전 학습 언어 모델(Pre-trained Language Model, PLM)에 대한 강건 성이 확보되어야 한다. 언어 모델의 강건성을 저해하는 가장 심각한 위협은 백도어 공격(Backdoor Attack)이다. 백도어 공격은 높은 은닉성을 기반으로 트리거가 아닌 입력에 대해서는 모델이 정상적으로 동작하기 때문에 탐지와 대응이 쉽지 않다. 이에 최근 들어서는 다양한 언어 모델들을 대상으로 백도어 공격에 대한 취약성을 규명하고 그에 대한 대응책을 모색하는 연구가 활발하게 진행되었다. 그러나 기존 연구의 대부분은 영어 기반 PLM을 대상으로 하고 있으며, 한국어 기반 PLM에 대한 연구는 찾아보기 어렵다. 이에 본 연구는 한국어 기반 PLM에 초점을 맞추는 백도어 공격에 대한 고유의 취약성을 실증적으로 규명하였다. 취약성 연구 대상으로는 대표적인 한국어 기반 PLM인 KoBERT(MLM)와 KoELECTRA(RTD) 모델을 선정했으며, 상이한 2종의 데이터세트(KLUE-TC, NSMC)를 대상으로 백도어 공격 실험을 설계하였다. 실험은 두 가지의 공격 시나리오를 통해 진행하였으며, 네 가지 핵심 변수가 취약성에 미치는 영향을 다각도로 검증하였다. 결론적으로 본 연구는 한국어 PLM이 ①사전 학습 방식, ②과업의 복잡성, ③트리거의 유형, ④트리거의 삽입 위치 등 다양한 공격 벡터 전반에 걸쳐 백 도어 공격에 근본적으로 취약함을 입증하였다. 이는 PLM의 확률적 패턴 암기 방식이 지름길 학습이나 위치 정보 악용과 같은 근본적인 보안 결함으로 이어 질 수 있음을 보여준다. 따라서 향후 ‘신뢰할 수 있는 AI기반 군사 시스템’ 확 보를 위하여, 데이터 필터링, 강건성 훈련 등 다층적 방어 전략에 대한 후속 연구가 시급하다.
    번역하기

    국방부가 인공지능(Artificial Intelligence, AI) 기술을 기반으로 개발을 추진 하고 있는 AI 군사참모가 성공적으로 안착하기 위해서는 체계 구축의 핵심이 되는 사전 학습 언어 모델(Pre-trained Languag...

    국방부가 인공지능(Artificial Intelligence, AI) 기술을 기반으로 개발을 추진 하고 있는 AI 군사참모가 성공적으로 안착하기 위해서는 체계 구축의 핵심이 되는 사전 학습 언어 모델(Pre-trained Language Model, PLM)에 대한 강건 성이 확보되어야 한다. 언어 모델의 강건성을 저해하는 가장 심각한 위협은 백도어 공격(Backdoor Attack)이다. 백도어 공격은 높은 은닉성을 기반으로 트리거가 아닌 입력에 대해서는 모델이 정상적으로 동작하기 때문에 탐지와 대응이 쉽지 않다. 이에 최근 들어서는 다양한 언어 모델들을 대상으로 백도어 공격에 대한 취약성을 규명하고 그에 대한 대응책을 모색하는 연구가 활발하게 진행되었다. 그러나 기존 연구의 대부분은 영어 기반 PLM을 대상으로 하고 있으며, 한국어 기반 PLM에 대한 연구는 찾아보기 어렵다. 이에 본 연구는 한국어 기반 PLM에 초점을 맞추는 백도어 공격에 대한 고유의 취약성을 실증적으로 규명하였다. 취약성 연구 대상으로는 대표적인 한국어 기반 PLM인 KoBERT(MLM)와 KoELECTRA(RTD) 모델을 선정했으며, 상이한 2종의 데이터세트(KLUE-TC, NSMC)를 대상으로 백도어 공격 실험을 설계하였다. 실험은 두 가지의 공격 시나리오를 통해 진행하였으며, 네 가지 핵심 변수가 취약성에 미치는 영향을 다각도로 검증하였다. 결론적으로 본 연구는 한국어 PLM이 ①사전 학습 방식, ②과업의 복잡성, ③트리거의 유형, ④트리거의 삽입 위치 등 다양한 공격 벡터 전반에 걸쳐 백 도어 공격에 근본적으로 취약함을 입증하였다. 이는 PLM의 확률적 패턴 암기 방식이 지름길 학습이나 위치 정보 악용과 같은 근본적인 보안 결함으로 이어 질 수 있음을 보여준다. 따라서 향후 ‘신뢰할 수 있는 AI기반 군사 시스템’ 확 보를 위하여, 데이터 필터링, 강건성 훈련 등 다층적 방어 전략에 대한 후속 연구가 시급하다.

    더보기

    목차 (Table of Contents)

    • 제1장 서론
    • 제1절 연구 배경 및 목적
    • 제2절 연구 범위 및 방법
    • 제2장 관련 연구
    • 제1절 사전 학습 언어 모델(PLM)
    • 제1장 서론
    • 제1절 연구 배경 및 목적
    • 제2절 연구 범위 및 방법
    • 제2장 관련 연구
    • 제1절 사전 학습 언어 모델(PLM)
    • 제2절 백도어 공격(Backdoor Attack)
    • 제3절 선행 연구15
    • 제3장 실험설계
    • 제1절 실험 목적 및 방법
    • 제2절 데이터세트
    • 제3절 공격 대상 모델
    • 제4절 백도어 공격 시나리오
    • 제5절 학습 및 평가 환경
    • 제4장 실험 결과 및 분석
    • 제1절 실험 결과 및 분석
    • 제5장 결론 및 향후 연구
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼