RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    대사성 질환 예측을 위한 머신러닝기반 모델 개발 및 비교 분석 = Development and Comparative Analysis of ML Based Model for Predicting Metabolic Diseases

    한글로보기

    https://www.riss.kr/link?id=T17376794

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    대사증후군은 복부비만, 고혈압, 이상지질혈증, 혈당 조절 장애 등 여러 대사 이상이 복합적으로 작용하여 발생하는 대표적인 만성 대사질환 군으로, 심혈관질환 및 제2형 당뇨병의 주요 선행 인자로 알려져 있다. 조 기 발견과 예방적 개입을 통해 질환 진행을 효과적으로 차단할 수 있음에 도 불구하고, 현재 보건의료체계는 질환 발생 이후의 치료 중심으로 운영 되고 있어 예방 중심의 위험 예측 모델 개발이 요구된다. 본 연구는 국민 건강영양조사(Korea National Health and Nutrition Examination Survey, KNHANES) 2019–2023년 데이터를 활용하여 대사증후군의 예방적 조기 예측을 위한 머신러닝 기반 분류 모델을 개발하고, Logistic Regression, Random Forest, XGBoost, LightGBM, Stacking 앙상블 모델의 예측 성능을 다 각도로 비교 분석하였다. 데이터 누수를 철저히 제거한 전처리 과정을 통 해 총 35,009명의 대상자와 488개의 독립 변수를 최종 분석에 포함하였 다. 모델 평가는 ROC-AUC, 정확도(Accuracy), 정밀도(Precision), 민감도 (Recall), F1-score, PR-AUC를 기반으로 수행하였으며, Stratified K-Fold 교차검 증, Bootstrap 기반 95% 신뢰구간, McNemar 검정을 통해 일반화 성능과 통 계적 유의성을 검증하였다. 또한 Brier Score와 Calibration Curve를 통해 예 측 확률의 보정 성능을 평가하고, 임계값(Threshold) 최적화 및 결정곡선분 석(Decision Curve Analysis)을 통해 임상적 활용 가능성을 검토하였다. 분석 결과, 모든 모델은 ROC-AUC 0.88 이상의 안정적인 예측 성능 을 보였으며, 단일 모델 중에서는 LightGBM이 가장 우수한 분류 성능과 가장 낮은 Brier Score를 기록하여 높은 일반화 성능과 예측 확률의 신뢰도 를 확인하였다. Stacking 앙상블 모델은 민감도, F1-score, PR-AUC 측면에서 가장 균형 잡힌 성능을 보였으며, McNemar 검정 결과 XGBoost 및 Random Forest 대비 통계적으로 유의한 성능 개선을 나타내어(p < 0.001) 본 연구의 최적 예방 예측 모델로 선정되었다. 변수 중요도 분석 결과 체질 량지수(BMI), 당화혈색소(HbA1c), 중성지방 및 LDL 콜레스테롤, 혈압 지표, 연령 등이 모든 모델에서 공통적으로 상위에 위치하였으며, 이는 대사증 후군의 알려진 병태생리적 경로와 높은 일치도를 보였다. 또한 상위 20개 주요 기여 변수를 제거한 재학습 실험에서 ROC-AUC와 민감도가 유의하 게 감소하여, 해당 변수들이 예측 성능에 실질적이고 독립적인 기여를 함 을 확인하였다. 결론적으로 본 연구는 데이터 누수가 제거된 대규모 국가 대표 자료 를 기반으로 머신러닝 및 앙상블 기법을 적용하여 대사증후군의 예방적 위험 예측 모델을 체계적으로 비교·검증하였으며, Stacking 앙상블 모델이 예측 성능, 안정성, 통계적 유의성, 해석 가능성 측면에서 가장 우수함을 확인하였다. 본 연구 결과는 향후 임상 및 지역사회 보건 환경에서 대사 증후군 고위험군을 조기에 선별하고 맞춤형 예방 전략을 수립하는 데 실 질적인 근거 자료로 활용될 수 있을 것으로 기대된다.
    번역하기

    대사증후군은 복부비만, 고혈압, 이상지질혈증, 혈당 조절 장애 등 여러 대사 이상이 복합적으로 작용하여 발생하는 대표적인 만성 대사질환 군으로, 심혈관질환 및 제2형 당뇨병의 주요 선...

    대사증후군은 복부비만, 고혈압, 이상지질혈증, 혈당 조절 장애 등 여러 대사 이상이 복합적으로 작용하여 발생하는 대표적인 만성 대사질환 군으로, 심혈관질환 및 제2형 당뇨병의 주요 선행 인자로 알려져 있다. 조 기 발견과 예방적 개입을 통해 질환 진행을 효과적으로 차단할 수 있음에 도 불구하고, 현재 보건의료체계는 질환 발생 이후의 치료 중심으로 운영 되고 있어 예방 중심의 위험 예측 모델 개발이 요구된다. 본 연구는 국민 건강영양조사(Korea National Health and Nutrition Examination Survey, KNHANES) 2019–2023년 데이터를 활용하여 대사증후군의 예방적 조기 예측을 위한 머신러닝 기반 분류 모델을 개발하고, Logistic Regression, Random Forest, XGBoost, LightGBM, Stacking 앙상블 모델의 예측 성능을 다 각도로 비교 분석하였다. 데이터 누수를 철저히 제거한 전처리 과정을 통 해 총 35,009명의 대상자와 488개의 독립 변수를 최종 분석에 포함하였 다. 모델 평가는 ROC-AUC, 정확도(Accuracy), 정밀도(Precision), 민감도 (Recall), F1-score, PR-AUC를 기반으로 수행하였으며, Stratified K-Fold 교차검 증, Bootstrap 기반 95% 신뢰구간, McNemar 검정을 통해 일반화 성능과 통 계적 유의성을 검증하였다. 또한 Brier Score와 Calibration Curve를 통해 예 측 확률의 보정 성능을 평가하고, 임계값(Threshold) 최적화 및 결정곡선분 석(Decision Curve Analysis)을 통해 임상적 활용 가능성을 검토하였다. 분석 결과, 모든 모델은 ROC-AUC 0.88 이상의 안정적인 예측 성능 을 보였으며, 단일 모델 중에서는 LightGBM이 가장 우수한 분류 성능과 가장 낮은 Brier Score를 기록하여 높은 일반화 성능과 예측 확률의 신뢰도 를 확인하였다. Stacking 앙상블 모델은 민감도, F1-score, PR-AUC 측면에서 가장 균형 잡힌 성능을 보였으며, McNemar 검정 결과 XGBoost 및 Random Forest 대비 통계적으로 유의한 성능 개선을 나타내어(p < 0.001) 본 연구의 최적 예방 예측 모델로 선정되었다. 변수 중요도 분석 결과 체질 량지수(BMI), 당화혈색소(HbA1c), 중성지방 및 LDL 콜레스테롤, 혈압 지표, 연령 등이 모든 모델에서 공통적으로 상위에 위치하였으며, 이는 대사증 후군의 알려진 병태생리적 경로와 높은 일치도를 보였다. 또한 상위 20개 주요 기여 변수를 제거한 재학습 실험에서 ROC-AUC와 민감도가 유의하 게 감소하여, 해당 변수들이 예측 성능에 실질적이고 독립적인 기여를 함 을 확인하였다. 결론적으로 본 연구는 데이터 누수가 제거된 대규모 국가 대표 자료 를 기반으로 머신러닝 및 앙상블 기법을 적용하여 대사증후군의 예방적 위험 예측 모델을 체계적으로 비교·검증하였으며, Stacking 앙상블 모델이 예측 성능, 안정성, 통계적 유의성, 해석 가능성 측면에서 가장 우수함을 확인하였다. 본 연구 결과는 향후 임상 및 지역사회 보건 환경에서 대사 증후군 고위험군을 조기에 선별하고 맞춤형 예방 전략을 수립하는 데 실 질적인 근거 자료로 활용될 수 있을 것으로 기대된다.

    더보기

    목차 (Table of Contents)

    • ABSTRACT I
    • Contents IV
    • List of Figures VIII
    • List of Tables X
    • List of Abbreviations XI
    • ABSTRACT I
    • Contents IV
    • List of Figures VIII
    • List of Tables X
    • List of Abbreviations XI
    • Ⅰ. Introduction 1
    • 1. 연구 배경 및 필요성 1
    • 2. 연구 목첮 및 가설 3
    • 2.2 연구 목적 4
    • 2.2 연구 가설 4
    • 3. 연구의 범위 및 학술적/실무적 기여 5
    • 3.1 연구의 범위 5
    • 3.2 학술적 및 실무적 기여 5
    • 4. 논문의 구성 6
    • Ⅱ. Literature Review 7
    • 1. 대사성 증후군 7
    • 1.1 대사성 증후군의 정의 및 병태생리학적 기전 7
    • 1.2 대상성 증후군의 진단 기준 및 지표 8
    • 2. 국민건강영양조사(KNHANES) 데이터 10
    • 2.1 KNHANES의 개요 및 조사 항목 10
    • 2.2 KNHANES 데이터의 특징 및 장단점 11
    • 3. 머신 러닝 11
    • 3.1 Logistic Regression(LR) 12
    • 3.2 Random Forest 13
    • 3.3 XGBoost 14
    • 3.4 LightGBM 15
    • 3.5 Stacking 기반 앙상블 16
    • 4. 국민건강영양조사(KNHANES) 및 머신러닝 을 이용한 대사증후군
    • 예측 관련 선행연구 고찰 17
    • 4.1 국민건강영양조사 자료를 이용한 대사성 증후군 연구 17
    • 4.2 머신 러닝을 이용한 대사증후군 예측 관련 선행연구 18
    • 4.3 선행연구에 대한 고찰 18
    • Ⅲ. Methods 19
    • 1. 데이터 수집 및 통합 20
    • 2. 종속변수(대사성 증후군)의 정의 21
    • 3. 변수 전처리 및 최종 설명변수 선정 21
    • 4. 머신러닝 모델 개요 및 아키텍처 22
    • 4.1 단일 모델 23
    • 4.2 Stacking 아키텍처 24
    • 5. 성능 평가 지표 및 통계적 검증 25
    • 5.1 성능평가 지표 25
    • 5.2 통계적 검증 26
    • Ⅳ. Results 27
    • 1. 모델 성능 27
    • 1.1 Accyracy 28
    • 1.2 Precusion 29
    • 1.3 Recall 30
    • 1.4 F1-score 31
    • 1.5 Confusion Matrix 31
    • 1.6 ROC-AUC 및 Precision Recall-AUC 34
    • 2. 교차검증 35
    • 3. Calibration(Brier Score) 37
    • 3.1 보정 성능 비교 37
    • 3.2 Calibration Curve 38
    • 4. Threshold 최적화 40
    • 5. 부트스트랩 CI (AUC, F1) 42
    • 6. McNemar 검정(McNemar’s Test)을 통한 모델 간 성능 비교 . 44
    • 7. 변수 중요도 46
    • 7.1 Logistic Regression 47
    • 7.2 Random Forest 49
    • 7.3 LightGBM 51
    • 7.4 XGBoost 53
    • 7.5 Stacking 55
    • 7.6 주요 기여 변수(Top 20) 제거에 따른 성능 변화 분석 57
    • 8. Decision Curve Analysis 59
    • Ⅴ. Discussion 60
    • 1. 통계적 성능 우위 모델 60
    • 2. 예측 확률의 신뢰도 및 유연성 61
    • 3. 최적 모델 종합 평가 62
    • 4. 선행 연구와의 비교 및 차별성 63
    • Ⅵ. Conclusion and Recommendations 64
    • 1. 결론 64
    • 2. 제언 67
    • Reference 70
    • 부록 74
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼