RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    스마트 벤트 제어를 위한 단일 RGB 기반 실시간 얼굴 3차원 좌표 추정 딥러닝 모델 = A Real-Time Monocular RGB Deep Learning Model for 3D Facial Landmark Estimation in Smart Vent Control

    한글로보기

    https://www.riss.kr/link?id=T17448920

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    최근 자동차 산업은 Software Defined Vehicle(SDV) 패러다임으로 전환되며 차량 기능이 소프트웨어 중심으로 통합되고, 탑승자의 상태·행동 정보를 활 용하여 차량 내부 환경을 능동적으로 제어하는 인캐빈 지능화 기술이 핵심 요 소로 부상하고 있다. 그중 스마트 벤트(Smart Vent)와 같이 탑승자 얼굴 위치 를 기반으로 바람 방향과 세기를 자동 조절하는 기능에서는, 추가 센서 없이 실시간으로 얼굴의 3차원 위치를 정확하게 추정할 수 있는 경량 공간 인식 기 술이 필수적이다.
    본 논문은 단일 RGB 카메라만을 활용하여 얼굴 주요 랜드마크의 3차원 좌 표를 실시간으로 추정하는 경량 딥러닝 모델을 제안한다. RetinaFace 기반의 경량 Backbone–FPN–SSH 구조 위에 얼굴 검출, 2D 랜드마크 회귀, 3차원 좌표 회귀를 통합한 Multi-Head 네트워크를 구성하였으며, RGB 기반 깊이 모호성 을 완화하기 위해 얼굴 크기 및 랜드마크 기하 정보를 활용한 Auxiliary Feature와 이를 CNN 특징과 결합하는 Fusion 기반 회귀 구조를 설계하였다. 또한 학습 단계에서만 보조 경로를 사용하고 추론 단계에서는 제거하는 Train-only Fusion 전략을 도입하여 정확도와 실시간성 간의 균형을 확보하였 다.
    기아 EV9 실차 환경에서 구축한 146,419쌍의 RGB–Depth 데이터를 학습에 사용하고, 실제 주행 기반 테스트 세트 1,500장으로 성능을 평가한 결과, Full Fusion 모델은 평균 3차원 오차 38.8 mm로 가장 높은 정확도를 달성하였다. Train-only Fusion 모델 역시 약 80 mm 수준의 오차와 32.63 FPS(PyTorch 기 준)의 속도를 보이며 실시간 처리 요구를 충족하였다. 또한 PNNX 기반 NCNN 추론 환경에서 Full Fusion 모델은 100.19 FPS, Train-only Fusion 모델은 121.66 FPS를 기록하여, 차량 ECU와 유사한 임베디드 조건에서도 안정적으로 실시간 동작할 수 있음을 확인하였다.
    종합적으로, 본 연구는 단일 RGB 카메라만으로 스마트 벤트 제어에 필요한 얼굴 3차원 좌표를 정확하고 실시간으로 산출할 수 있는 실용적 모델 구조를 제시하였다. 제안 모델은 추가 센서 없이 차량 내부 지능화를 구현하기 위한 핵심 기술로 활용될 수 있으며, 향후 SDV 기반 스마트 캐빈 제어, 탑승자 모 니터링, 개인화 서비스 등 다양한 인캐빈 AI 응용 분야로 확장될 수 있는 높 은 적용 잠재력을 갖는다.
    번역하기

    최근 자동차 산업은 Software Defined Vehicle(SDV) 패러다임으로 전환되며 차량 기능이 소프트웨어 중심으로 통합되고, 탑승자의 상태·행동 정보를 활 용하여 차량 내부 환경을 능동적으로 제어하�...

    최근 자동차 산업은 Software Defined Vehicle(SDV) 패러다임으로 전환되며 차량 기능이 소프트웨어 중심으로 통합되고, 탑승자의 상태·행동 정보를 활 용하여 차량 내부 환경을 능동적으로 제어하는 인캐빈 지능화 기술이 핵심 요 소로 부상하고 있다. 그중 스마트 벤트(Smart Vent)와 같이 탑승자 얼굴 위치 를 기반으로 바람 방향과 세기를 자동 조절하는 기능에서는, 추가 센서 없이 실시간으로 얼굴의 3차원 위치를 정확하게 추정할 수 있는 경량 공간 인식 기 술이 필수적이다.
    본 논문은 단일 RGB 카메라만을 활용하여 얼굴 주요 랜드마크의 3차원 좌 표를 실시간으로 추정하는 경량 딥러닝 모델을 제안한다. RetinaFace 기반의 경량 Backbone–FPN–SSH 구조 위에 얼굴 검출, 2D 랜드마크 회귀, 3차원 좌표 회귀를 통합한 Multi-Head 네트워크를 구성하였으며, RGB 기반 깊이 모호성 을 완화하기 위해 얼굴 크기 및 랜드마크 기하 정보를 활용한 Auxiliary Feature와 이를 CNN 특징과 결합하는 Fusion 기반 회귀 구조를 설계하였다. 또한 학습 단계에서만 보조 경로를 사용하고 추론 단계에서는 제거하는 Train-only Fusion 전략을 도입하여 정확도와 실시간성 간의 균형을 확보하였 다.
    기아 EV9 실차 환경에서 구축한 146,419쌍의 RGB–Depth 데이터를 학습에 사용하고, 실제 주행 기반 테스트 세트 1,500장으로 성능을 평가한 결과, Full Fusion 모델은 평균 3차원 오차 38.8 mm로 가장 높은 정확도를 달성하였다. Train-only Fusion 모델 역시 약 80 mm 수준의 오차와 32.63 FPS(PyTorch 기 준)의 속도를 보이며 실시간 처리 요구를 충족하였다. 또한 PNNX 기반 NCNN 추론 환경에서 Full Fusion 모델은 100.19 FPS, Train-only Fusion 모델은 121.66 FPS를 기록하여, 차량 ECU와 유사한 임베디드 조건에서도 안정적으로 실시간 동작할 수 있음을 확인하였다.
    종합적으로, 본 연구는 단일 RGB 카메라만으로 스마트 벤트 제어에 필요한 얼굴 3차원 좌표를 정확하고 실시간으로 산출할 수 있는 실용적 모델 구조를 제시하였다. 제안 모델은 추가 센서 없이 차량 내부 지능화를 구현하기 위한 핵심 기술로 활용될 수 있으며, 향후 SDV 기반 스마트 캐빈 제어, 탑승자 모 니터링, 개인화 서비스 등 다양한 인캐빈 AI 응용 분야로 확장될 수 있는 높 은 적용 잠재력을 갖는다.

    더보기

    목차 (Table of Contents)

    • 제1장 서론 1
    • 제1절 연구 배경 1
    • 제2절 연구 필요성 4
    • 제3절 관련 연구 6
    • 1.3.1 얼굴 검출 및 랜드마크 추정 연구 6
    • 제1장 서론 1
    • 제1절 연구 배경 1
    • 제2절 연구 필요성 4
    • 제3절 관련 연구 6
    • 1.3.1 얼굴 검출 및 랜드마크 추정 연구 6
    • 1.3.2 3차원 좌표 추정 연구 7
    • 제4절 연구 목표 및 논문 구성 9
    • 제2장 데이터 취득 12
    • 제1절 데이터 개요 12
    • 제2절 데이터 수집 환경 구성 14
    • 제3절 데이터 취득 및 분석 17
    • 2.3.1 실차 기반 시나리오 구성 17
    • 2.3.2 해상도 정합 및 CLAHE 적용 19
    • 2.3.3 얼굴 복원 및 이미지 전처리 21
    • 제4절 학습 데이터 구성 25
    • 제3장 연구 방법 27
    • 제1절 공통 특징 추출 네트워크 구조 28
    • 3.1.1 경량 Backbone 아키텍처 28
    • 3.1.2 FPN–SSH 기반 다중 스케일 특징 통합 구조 29
    • 제2절 Multi-Head 기반 출력 구조 설계 31
    • 3.2.1 3차원 좌표 추정 모델 헤드 구성 32
    • 제3절 Auxiliary Feature 기반 3차원 좌표 회귀 헤드 35
    • 3.3.1 기하 정보를 활용한 Auxiliary Feature 구성 35
    • 3.3.2 CNN Feature + Auxiliary Feature 결합 구조 37
    • 3.3.3 Train-only Fusion 구조 38
    • 3.3.4 Proposed Network 41
    • 제4절 손실 함수 42
    • 제4장 실험 및 결과 44
    • 제1절 학습 데이터 및 학습 설정 구성 44
    • 4.1.1 학습·평가 데이터 구성 44
    • 4.1.2 학습 환경 구성 45
    • 4.1.3 데이터 증강 기법 45
    • 제2절 성능 지표 47
    • 제3절 연구 결과 48
    • 4.3.1 Ablation Study 48
    • 4.3.2 실차 환경 기반 시각적 평가 53
    • 4.3.3 실시간 처리 성능 평가 54
    • 제5장 결론 59
    • 참고문헌 61
    • APPENDIX 63
    • ABSTRACT 66
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼