RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    인공지능 기반 사이버 침해사고 심층 원인분석 모델 연구 = A Study on an AI-Based Deep Root-Cause Analysis Model for Cybersecurity Incidents

    한글로보기

    https://www.riss.kr/link?id=T17512276

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    사이버 침해사고 대응은 탐지 이후의 조치가 핵심이며, 단순히 “어떤 공격인가”를 분류하는 수준을 넘어 “무엇이 실패했는가(통제 실패 원인)”를 자동으로 도출할 필요가 있다. 본 연구는 보안 통제 실패 관점의 심층 원인 분류 체계인 root10(C01~C10)을 정의하고, 이를 기반으로 공개 IDS/로그 데이터셋 간 이질적인 라벨을 공통 축으로 정규화하여 심층 원인 멀티라벨 자동분석 모델을 설계·평가한다. root10은 접근통제 실패(C01), 보안 설정 오류(C02), 공급망/의존성 실패(C03), 암호·데이터 무결성 실패(C04), 인젝션(C05), 불안전한 설계(C06), 인증 실패(C07), 소프
    트웨어/데이터 무결성 실패(C08), 로깅·모니터링 실패(C09), 예외 처리 실패(C10)로 구성된다.
    실험은 CSE-CIC-IDS2017/2018, UNSW-NB15, LOGHUB HDFS_root10 등 네 개 데이터셋을 대상으로 (1) 데이터셋별 단일 학습, (2) 통합 학습을 통한 도메인 일반화 점검, (3) 공격 유형 단일라벨 모델 대비, (4) XAI 기반 설명 생성의 시나리오로 구성하였다. 본 연구의 멀티 라벨 모델은 데이터셋별로 CIC2017 micro F1 0.94 / macro F1 0.86,CIC2018 micro F1 0.92 / macro F1 0.83, UNSW micro F1 0.91 / macro F1 0.79, HDFS micro F1 0.93 / macro F1 0.85의 성능을 확인하였다.
    또한 통합 학습은 데이터셋에 따라 micro 성능이 미세하게 변동하더라도, 일부 환경에서 macro 성능을 개선(예: CIC2018 macro 0.83→0.84, UNSW macro 0.79→0.81)하여 희소·경계 라벨의 안정화를 지원함을 보였다.
    마지막으로 XAI를 통해 예측의 근거를 전역/국지 수준에서 제시함으로 써, 원인 추정 결과를 운영 조치(정책 보완, 설정 개선, 모니터링 강화 등) 로 연결하는 설명 구조를 제안하였다. 종합하면 본 연구는 “탐지 정확도” 중심의 기존 평가를 넘어, 탐지 이후 “무엇을 고쳐야 하는가”에 직접 답하는 멀티라벨 심층 원인 분석 프레임과 실증 결과를 제시한다.
    번역하기

    사이버 침해사고 대응은 탐지 이후의 조치가 핵심이며, 단순히 “어떤 공격인가”를 분류하는 수준을 넘어 “무엇이 실패했는가(통제 실패 원인)”를 자동으로 도출할 필요가 있다. 본 연구...

    사이버 침해사고 대응은 탐지 이후의 조치가 핵심이며, 단순히 “어떤 공격인가”를 분류하는 수준을 넘어 “무엇이 실패했는가(통제 실패 원인)”를 자동으로 도출할 필요가 있다. 본 연구는 보안 통제 실패 관점의 심층 원인 분류 체계인 root10(C01~C10)을 정의하고, 이를 기반으로 공개 IDS/로그 데이터셋 간 이질적인 라벨을 공통 축으로 정규화하여 심층 원인 멀티라벨 자동분석 모델을 설계·평가한다. root10은 접근통제 실패(C01), 보안 설정 오류(C02), 공급망/의존성 실패(C03), 암호·데이터 무결성 실패(C04), 인젝션(C05), 불안전한 설계(C06), 인증 실패(C07), 소프
    트웨어/데이터 무결성 실패(C08), 로깅·모니터링 실패(C09), 예외 처리 실패(C10)로 구성된다.
    실험은 CSE-CIC-IDS2017/2018, UNSW-NB15, LOGHUB HDFS_root10 등 네 개 데이터셋을 대상으로 (1) 데이터셋별 단일 학습, (2) 통합 학습을 통한 도메인 일반화 점검, (3) 공격 유형 단일라벨 모델 대비, (4) XAI 기반 설명 생성의 시나리오로 구성하였다. 본 연구의 멀티 라벨 모델은 데이터셋별로 CIC2017 micro F1 0.94 / macro F1 0.86,CIC2018 micro F1 0.92 / macro F1 0.83, UNSW micro F1 0.91 / macro F1 0.79, HDFS micro F1 0.93 / macro F1 0.85의 성능을 확인하였다.
    또한 통합 학습은 데이터셋에 따라 micro 성능이 미세하게 변동하더라도, 일부 환경에서 macro 성능을 개선(예: CIC2018 macro 0.83→0.84, UNSW macro 0.79→0.81)하여 희소·경계 라벨의 안정화를 지원함을 보였다.
    마지막으로 XAI를 통해 예측의 근거를 전역/국지 수준에서 제시함으로 써, 원인 추정 결과를 운영 조치(정책 보완, 설정 개선, 모니터링 강화 등) 로 연결하는 설명 구조를 제안하였다. 종합하면 본 연구는 “탐지 정확도” 중심의 기존 평가를 넘어, 탐지 이후 “무엇을 고쳐야 하는가”에 직접 답하는 멀티라벨 심층 원인 분석 프레임과 실증 결과를 제시한다.

    더보기

    목차 (Table of Contents)

    • 국문초록 ⅹ
    • 제 1 장 서 론 1
    • 1.1 연구 배경 및 필요성 1
    • 1.2 연구 목표: 공용 IDS·로그 데이터셋 기반 침해사고 심층 원인 자동분석 3
    • 1.3 연구 범위: CSE-CIC-IDS2017/2018, UNSW-NB15, LOGHUB HDFS_root10를 활용한 네트워크 플로우·로그 중심 분석 6
    • 국문초록 ⅹ
    • 제 1 장 서 론 1
    • 1.1 연구 배경 및 필요성 1
    • 1.2 연구 목표: 공용 IDS·로그 데이터셋 기반 침해사고 심층 원인 자동분석 3
    • 1.3 연구 범위: CSE-CIC-IDS2017/2018, UNSW-NB15, LOGHUB HDFS_root10를 활용한 네트워크 플로우·로그 중심 분석 6
    • 1.4 연구 방법 및 논문 구성 8
    • 1.5 연구의 의의 및 한계 12
    • 제 2 장 이론 및 선행 연구 17
    • 2.1 사이버 침해사고와 심층 원인 분류 체계 17
    • 2.1.1 OWASP Top-10, ATT&CK 등 보안 통제 실패 유형 개요 18
    • 2.1.2 root10 체계 개요 20
    • 2.2 네트워크 기반 침입탐지 및 침해사고 분석 연구 동향 23
    • 2.2.1 시그니처·머신러닝·딥러닝 기반 IDS 연구 23
    • 2.2.2 공격 유형 분류와 원인 분석 연구 비교 25
    • 2.3 공개 IDS/로그 데이터셋 기반 연구 동향 27
    • 2.3.1 CSE-CIC-IDS2017, CSE-CIC-IDS2018 활용 연구 27
    • 2.3.2 UNSW-NB15 활용 연구 29
    • 2.3.3 LogHub HDFS 및 로그 기반 이상 탐지 연구 31
    • 2.4 멀티라벨 분류 및 약지도 기법 32
    • 2.4.1 멀티라벨 분류 문제 정의 및 대표 기법 33
    • 2.4.2 Snorkel LabelModel 등 약지도 기반 라벨링 개념 34
    • 2.4.3 침해사고 원인분석에 약지도 기법을 적용한 선행연구 36
    • 제 3 장 데이터셋 및 전처리 39
    • 3.1 사용 데이터셋 개요 39
    • 3.1.1 CSE-CIC-IDS2017 데이터셋 구조 및 공격 시나리오 41
    • 3.1.2 CSE-CIC-IDS2018 데이터셋 구조 및 공격 시나리오 41
    • 3.1.3 UNSW-NB15_root10 데이터셋 구조 및 특성 42
    • 3.1.4 LOGHUB_HDFS_root10 데이터셋 구조 및 특성 43
    • 3.2 root10 심층 원인 라벨 체계 정의 45
    • 3.2.1 C01~C10 각 원인 정의 및 OWASP·ATT&CK 매핑 45
    • 3.2.2 공격 유형과 원인 관계 정리 49
    • 3.3 데이터셋 별 라벨과 root10 매핑 규칙 설계 52
    • 3.3.1 CSE-CIC-IDS2017: Web Attack/DoS/Heartbleed → root10 매핑 54
    • 3.3.2 CSE-CIC-IDS2018: Benign/각 공격 유형 → root10 매핑 56
    • 3.3.3 UNSW-NB15: attack_cat·label → root10 매핑 및 이미 생성된 UNSW_NB15_root10 설명 57
    • 3.3.4 LOGHUB HDFS: 로그 메시지 패턴 기반 root10 매핑 59
    • 3.4 라벨 정규화 및 다중 원인 조합 처리 60
    • 3.4.1 공격 라벨 문자열 정규화 및 변형 케이스 처리 60
    • 3.4.2 하나의 공격에 대한 복수 원인 표현 방식 61
    • 3.4.3 Root cause 우선순위에 따른 대표 원인 선택 전략 63
    • 3.5 root10_* 파생 데이터셋 구축 절차 64
    • 3.5.1 대용량 CSV 청크 처리 및 root10 라벨 부여 64
    • 3.5.2 데이터셋별 root10_id, root10_name 컬럼 생성 및 저장 형식 65
    • 3.5.3 root10 라벨 분포 점검 및 요약 통계 산출 67
    • 3.6 학습·검증·테스트 데이터 분할 전략 67
    • 3.6.1 데이터셋 내 분할 기준 68
    • 3.6.2 데이터셋 간 분할 전략 68
    • 3.6.3 레이블 불균형 및 샘플링 전략 69
    • 3.7 약지도 기반 라벨 보정 69
    • 3.7.1 CSE-CIC-IDS2018에서의 라벨 함수 설계와 LabelModel 학습 개요 70
    • 3.7.2 라벨 커버리지·정확도 진단 및 root10 라벨 품질 향상 방안 70
    • 제 4 장 심층 원인 멀티라벨 분석 모델 설계 72
    • 4.1 문제 정의 72
    • 4.1.1 플로우/로그 단위 root10 멀티라벨 분류 문제 정의 72
    • 4.1.2 비교 대상: 공격 유형 단일라벨 분류 문제 73
    • 4.2 입력 특징 설계 74
    • 4.2.1 네트워크 플로우 기반 특징 74
    • 4.2.2 로그 텍스트 기반 특징 75
    • 4.2.3 공통·개별 특징 및 정규화 방식 76
    • 4.3 심층 원인 멀티라벨 MLP 모델 구조 77
    • 4.3.1 입력층·은닉층·출력층 구성 78
    • 4.3.2 활성화 함수, 손실 함수 79
    • 4.3.3 정규화, 드롭아웃 등 일반화 기법 80
    • 4.4 공격 유형 단일라벨 분류 모델 설계 81
    • 4.4.1 MLP 기반 단일라벨 분류기 구조 81
    • 4.4.2 전통 머신러닝 모델 비교 82
    • 4.5 학습 및 실험 환경 설정 82
    • 4.5.1 공통 학습 설정 82
    • 4.6 실험 시나리오 설계 83
    • 4.6.1 데이터셋별 단일 학습 84
    • 4.6.2 통합 데이터셋 학습 84
    • 4.6.3 단일라벨 vs 멀티라벨 비교 84
    • 4.6.4 XAI 분석 85
    • 4.7 성능 평가 기준 85
    • 4.7.1 멀티라벨 평가 지표 86
    • 4.7.2 단일라벨 평가 지표 86
    • 4.7.3 root10 라벨별 성능 비교 관점 87
    • 4.8 XAI 기반 심층 원인 설명 기법 설계 87
    • 4.8.1 XAI 적용 목표 및 대상 모델 88
    • 4.8.2 기법 분석 및 선택 88
    • 4.8.3 특징 중요도 기반 root10 원인 설명 전략 88
    • 4.8.4 Local / Global 설명 설계 89
    • 제 5 장 시스템 아키텍처 및 구현 90
    • 5.1 전체 분석 파이프라인 설계 90
    • 5.2 데이터 전처리 및 root10 라벨링 모듈 91
    • 5.2.1 라벨 정규화 및 매핑 코드 구조 92
    • 5.2.2 대용량 데이터 청크 처리 및 병렬 처리 구조 93
    • 5.3 약지도 모듈 94
    • 5.3.1 라벨 함수 구현 구조 94
    • 5.3.2 LabelModel 학습 및 pseudo-label 생성 파이프라인 95
    • 5.3.3 약지도 적용 전·후 라벨 품질 비교 로그 95
    • 5.4 모델 학습·추론 모듈 96
    • 5.4.1 심층 원인 멀티라벨 MLP 학습 스크립트 구조 97
    • 5.4.2 공격 유형 단일라벨 모델 학습 스크립트 구조 97
    • 5.4.3 배치·온라인 추론 처리 로직 97
    • 5.5 결과 리포트 및 시각화 모듈 98
    • 5.6 XAI 모듈 구현 98
    • 5.6.1 라이브러리 및 프레임워크 구성 99
    • 5.6.2 학습된 모델과 XAI 모듈 연동 구조 100
    • 5.6.3 배치 기반 설명 생성 절차 100
    • 5.6.4 결과 저장 포맷 설계 100
    • 5.6.5 결과 리포트/GUI 변환 101
    • 제 6 장 실험 결과 및 분석 102
    • 6.1 데이터셋별 root10 라벨 분포 분석 102
    • 6.1.1 CSE-CIC-IDS2017_root10 분포 102
    • 6.1.2 CSE-CIC-IDS2018_root10 분포 103
    • 6.1.3 UNSW-NB15_root10 분포 104
    • 6.1.4 LOGHUB_HDFS_root10 분포 105
    • 6.2 데이터셋별 심층 원인 멀티라벨 모델 성능 105
    • 6.2.1 CIC2017 기반 성능 106
    • 6.2.2 CIC2018 기반 성능 106
    • 6.2.3 UNSW-NB15_root10 기반 성능 107
    • 6.2.4 LOGHUB_HDFS_root10 기반 성능 107
    • 6.3 통합 학습 시나리오 실험 108
    • 6.3.1 통합 학습 vs 단일 데이터셋 학습 성능 비교 108
    • 6.3.2 도메인 차이에 따른 일반화 성능 분석 109
    • 6.4 공격 유형 단일라벨 모델과의 비교 110
    • 6.5 root10 라벨별 오분류 분석 110
    • 6.6 보안 운영·정책 관점 활용 가능성 111
    • 6.7 XAI 분석 결과 112
    • 제 7 장 결론 및 향후 연구 116
    • 7.1 연구 결과 요약 116
    • 7.2 학술적·실무적 시사점 116
    • 7.3 연구 한계 117
    • 참고문헌 119
    • Abstract 126
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼