RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    멀티 카메라 정합 및 레이더?카메라 융합 기반 인간 행동 인식에 관한 연구 = A Study on Multi-Camera Rectification and Radar?Camera Fusion-Based Human Activity Recognition

    한글로보기

    https://www.riss.kr/link?id=T17503673

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    멀티 카메라 정합은 좌/우 스테레오 카메라와 RGB 카메라로 구성된 삼중 카메라 시스템에서 발생하는 보정 및 정합의 번거로움을 해결하기 위해, 세 카메라를 동시에 보정하고 정합할 수 있는 통합 프레임워크를 제안한다. 기존 방식은 깊이 추정을 위한 좌/우 카메라 정합과 색상 정보 사용을 위한 좌/RGB 카메라 정합을 각각 독립적으로 수행해야 하기 때문에 서로 다른 기준면과 회전 행렬이 생성되고 계산량 또한 증가하는 한계가 있었다.

    제안 방법은 좌측 카메라를 기준으로 설정하고, 우측 및 RGB 카메라의 상대적 회전을 동시에 추정함으로써 단일 보정 및 정합 과정만으로 세 카메라를 하나의 공통 영상 평면에 정렬한다. 또한 정합 과정에서는 좌측 카메라의 회전을 고정하고, 우측 및 RGB 카메라만을 회전 및 스케일링함으로써, 수평 정렬을 유지하면서도 기준 영상의 불필요한 회전을 제거하였다.

    광각 스테레오 카메라 모듈 19세트를 대상으로 제안 방법을 평가하여 좌/우 정렬 오차 0.112와 좌/RGB 정렬 오차 0.085로 기존 방법과 경쟁력 있는 정렬 오차를 달성하였다. 기존 방법이 더 낮은 평균 정렬 오차를 보였으나, 기준 영상에 불규칙한 회전을 유발하여 실제 시각화 및 거리 추정 응용에 부적합한 경우가 확인되었다. 따라서 제안 방법은 단일 촬영 기반의 효율적인 정합 과정, 기준 영상의 시각적 안정성, 그리고 다중 센서 활용의 일관성을 동시에 만족시키는 실용적인 솔루션임이 증명되었다.

    인간 활동 인식은 조명 변화, 개인 식별 위험 등의 문제로 인해 기존 영상 기반 접근법에 한계가 있다. 반면 레이더 기반 인식은 환경 변화에 강인하지만, 유사한 동작 간의 세밀한 구분에는 제약이 존재한다. 레이더-카메라 융합 기반 인간 행동 인식은 FMCW 레이더와 카메라를 동기화하여 데이터를 수집하고, 레이더 신호는 Range-Doppler-Time 형태의 3차원 표현으로 변환하여 시간적 동작 특성을 효과적으로 모델링한다. 카메라 데이터는 개인 식별이 불가능한 수준의 초저해상도로 축소한 후 프레임 간 차분을 적용함으로써, 외형 및 배경 정보는 제거하고 동작 변화 정보만을 유지한다. 이러한 전처리를 통해 프라이버시를 보호하면서도 활동 인식에 필요한 핵심 동작 정보를 확보하였다.
    레이더와 카메라 각각에 대해 LSTM 기반 인코더를 적용하여 시간적 동작 패턴을 압축된 특징 벡터로 추출하고, 이를 결합하여 경량형 완전연결 분류기를 통해 최종 행동을 예측한다.

    15가지 행동을 포함하는 자체 구축 데이터셋을 활용한 실험 결과, 제안된 레이더-카메라 융합 모델은 단일 센서 기반 모델 대비 평균 8\% 이상의 성능 향상을 보였으며, 98.37\%의 높은 인식 정확도를 달성하였다. 특히 미세한 동작 위주의 행동과 빠른 이동을 동반하는 행동 모두에서 안정적인 성능을 보였다. 더불어 전체 모델의 연산량은 약 13 MFLOPs 수준으로, 실시간 엣지 환경에 적합한 효율성을 갖는다.
    번역하기

    멀티 카메라 정합은 좌/우 스테레오 카메라와 RGB 카메라로 구성된 삼중 카메라 시스템에서 발생하는 보정 및 정합의 번거로움을 해결하기 위해, 세 카메라를 동시에 보정하고 정합할 수 있...

    멀티 카메라 정합은 좌/우 스테레오 카메라와 RGB 카메라로 구성된 삼중 카메라 시스템에서 발생하는 보정 및 정합의 번거로움을 해결하기 위해, 세 카메라를 동시에 보정하고 정합할 수 있는 통합 프레임워크를 제안한다. 기존 방식은 깊이 추정을 위한 좌/우 카메라 정합과 색상 정보 사용을 위한 좌/RGB 카메라 정합을 각각 독립적으로 수행해야 하기 때문에 서로 다른 기준면과 회전 행렬이 생성되고 계산량 또한 증가하는 한계가 있었다.

    제안 방법은 좌측 카메라를 기준으로 설정하고, 우측 및 RGB 카메라의 상대적 회전을 동시에 추정함으로써 단일 보정 및 정합 과정만으로 세 카메라를 하나의 공통 영상 평면에 정렬한다. 또한 정합 과정에서는 좌측 카메라의 회전을 고정하고, 우측 및 RGB 카메라만을 회전 및 스케일링함으로써, 수평 정렬을 유지하면서도 기준 영상의 불필요한 회전을 제거하였다.

    광각 스테레오 카메라 모듈 19세트를 대상으로 제안 방법을 평가하여 좌/우 정렬 오차 0.112와 좌/RGB 정렬 오차 0.085로 기존 방법과 경쟁력 있는 정렬 오차를 달성하였다. 기존 방법이 더 낮은 평균 정렬 오차를 보였으나, 기준 영상에 불규칙한 회전을 유발하여 실제 시각화 및 거리 추정 응용에 부적합한 경우가 확인되었다. 따라서 제안 방법은 단일 촬영 기반의 효율적인 정합 과정, 기준 영상의 시각적 안정성, 그리고 다중 센서 활용의 일관성을 동시에 만족시키는 실용적인 솔루션임이 증명되었다.

    인간 활동 인식은 조명 변화, 개인 식별 위험 등의 문제로 인해 기존 영상 기반 접근법에 한계가 있다. 반면 레이더 기반 인식은 환경 변화에 강인하지만, 유사한 동작 간의 세밀한 구분에는 제약이 존재한다. 레이더-카메라 융합 기반 인간 행동 인식은 FMCW 레이더와 카메라를 동기화하여 데이터를 수집하고, 레이더 신호는 Range-Doppler-Time 형태의 3차원 표현으로 변환하여 시간적 동작 특성을 효과적으로 모델링한다. 카메라 데이터는 개인 식별이 불가능한 수준의 초저해상도로 축소한 후 프레임 간 차분을 적용함으로써, 외형 및 배경 정보는 제거하고 동작 변화 정보만을 유지한다. 이러한 전처리를 통해 프라이버시를 보호하면서도 활동 인식에 필요한 핵심 동작 정보를 확보하였다.
    레이더와 카메라 각각에 대해 LSTM 기반 인코더를 적용하여 시간적 동작 패턴을 압축된 특징 벡터로 추출하고, 이를 결합하여 경량형 완전연결 분류기를 통해 최종 행동을 예측한다.

    15가지 행동을 포함하는 자체 구축 데이터셋을 활용한 실험 결과, 제안된 레이더-카메라 융합 모델은 단일 센서 기반 모델 대비 평균 8\% 이상의 성능 향상을 보였으며, 98.37\%의 높은 인식 정확도를 달성하였다. 특히 미세한 동작 위주의 행동과 빠른 이동을 동반하는 행동 모두에서 안정적인 성능을 보였다. 더불어 전체 모델의 연산량은 약 13 MFLOPs 수준으로, 실시간 엣지 환경에 적합한 효율성을 갖는다.

    더보기

    다국어 초록 (Multilingual Abstract) kakao i 다국어 번역

    A triple-camera system (left + right + RGB) often requires separate calibrations, increasing computational cost and producing inconsistent reference frames. We propose an integrated framework that simultaneously calibrates and registers all three cameras using the left camera as the reference. Only the right and RGB cameras are rotated and scaled, maintaining horizontal alignment without unnecessary rotation of the reference image. Evaluated on 19 wide-angle stereo sets, the method achieved competitive alignment errors (left/right: 0.112, left/RGB: 0.085) while preserving visual stability, making it practical for depth estimation and visualization.

    Video-based recognition is sensitive to lighting and privacy concerns, while radar struggles with fine-grained actions. We propose a radar-camera fusion approach: radar signals are converted to Range-Doppler-Time for temporal modeling, and camera data is downsampled and differenced to retain only motion information. LSTM-based encoders extract temporal features from both modalities, which are fused and classified with a lightweight fully-connected network. On a 15-action dataset, the model achieves 98.37\% accuracy, outperforming single-sensor models by over 8\%, while maintaining real-time efficiency (~13 MFLOPs).
    번역하기

    A triple-camera system (left + right + RGB) often requires separate calibrations, increasing computational cost and producing inconsistent reference frames. We propose an integrated framework that simultaneously calibrates and registers all three came...

    A triple-camera system (left + right + RGB) often requires separate calibrations, increasing computational cost and producing inconsistent reference frames. We propose an integrated framework that simultaneously calibrates and registers all three cameras using the left camera as the reference. Only the right and RGB cameras are rotated and scaled, maintaining horizontal alignment without unnecessary rotation of the reference image. Evaluated on 19 wide-angle stereo sets, the method achieved competitive alignment errors (left/right: 0.112, left/RGB: 0.085) while preserving visual stability, making it practical for depth estimation and visualization.

    Video-based recognition is sensitive to lighting and privacy concerns, while radar struggles with fine-grained actions. We propose a radar-camera fusion approach: radar signals are converted to Range-Doppler-Time for temporal modeling, and camera data is downsampled and differenced to retain only motion information. LSTM-based encoders extract temporal features from both modalities, which are fused and classified with a lightweight fully-connected network. On a 15-action dataset, the model achieves 98.37\% accuracy, outperforming single-sensor models by over 8\%, while maintaining real-time efficiency (~13 MFLOPs).

    더보기

    목차 (Table of Contents)

    • 1. 서론 1
    • 1.1. 연구 배경 1
    • 1.2. 연구 목적 2
    • 2. 멀티 카메라 정합 4
    • 2.1. 이론적 배경 4
    • 1. 서론 1
    • 1.1. 연구 배경 1
    • 1.2. 연구 목적 2
    • 2. 멀티 카메라 정합 4
    • 2.1. 이론적 배경 4
    • 2.2. 실험 방법 6
    • 2.2.1. 실험 환경 설계 및 체커보드 코너 검출 7
    • 2.2.2. 단일 카메라 캘리브레이션 8
    • 2.2.3. 삼중 카메라 캘리브레이션 10
    • 2.2.4. 삼중 카메라 정합 12
    • 2.3. 실험 결과 13
    • 3. 레이더-카메라 융합 기반 인간 행동 인식 18
    • 3.1. 이론적 배경 18
    • 3.2. 실험 방법 19
    • 3.2.1. 데이터 수집 환경 및 구성 19
    • 3.2.2. 전처리 22
    • 3.2.3. 멀티모달 융합 딥러닝 구조 27
    • 3.2.4. 레이더 인코더 28
    • 3.2.5. 카메라 인코더 32
    • 3.2.6. 분류 헤드 34
    • 3.3. 실험 결과 35
    • 3.3.1. 정량적 평가 35
    • 3.3.2. 인코더 구조 및 입력 표현 비교 실험 36
    • 4. 결론 39
    • 참고문헌 41
    • Abstract 46
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼