멀티 카메라 정합은 좌/우 스테레오 카메라와 RGB 카메라로 구성된 삼중 카메라 시스템에서 발생하는 보정 및 정합의 번거로움을 해결하기 위해, 세 카메라를 동시에 보정하고 정합할 수 있...

http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
https://www.riss.kr/link?id=T17503673
천안 : 한국기술교육대학교 일반대학원, 2026
학위논문(석사) -- 한국기술교육대학교 일반대학원 , 전기전자통신공학과 정보통신공학전공 , 2026. 2
2026
한국어
정합 ; 캘리브레이션 ; FMCW 레이더 ; 프라이버시 보호 ; 다중 센서 ; Rectification ; Calibration ; FMCW radar ; Privacy-Preserving ; Multi Sensor
충청남도
; 26 cm
지도교수: 우성민
I804:44013-200000971190
0
상세조회0
다운로드멀티 카메라 정합은 좌/우 스테레오 카메라와 RGB 카메라로 구성된 삼중 카메라 시스템에서 발생하는 보정 및 정합의 번거로움을 해결하기 위해, 세 카메라를 동시에 보정하고 정합할 수 있...
멀티 카메라 정합은 좌/우 스테레오 카메라와 RGB 카메라로 구성된 삼중 카메라 시스템에서 발생하는 보정 및 정합의 번거로움을 해결하기 위해, 세 카메라를 동시에 보정하고 정합할 수 있는 통합 프레임워크를 제안한다. 기존 방식은 깊이 추정을 위한 좌/우 카메라 정합과 색상 정보 사용을 위한 좌/RGB 카메라 정합을 각각 독립적으로 수행해야 하기 때문에 서로 다른 기준면과 회전 행렬이 생성되고 계산량 또한 증가하는 한계가 있었다.
제안 방법은 좌측 카메라를 기준으로 설정하고, 우측 및 RGB 카메라의 상대적 회전을 동시에 추정함으로써 단일 보정 및 정합 과정만으로 세 카메라를 하나의 공통 영상 평면에 정렬한다. 또한 정합 과정에서는 좌측 카메라의 회전을 고정하고, 우측 및 RGB 카메라만을 회전 및 스케일링함으로써, 수평 정렬을 유지하면서도 기준 영상의 불필요한 회전을 제거하였다.
광각 스테레오 카메라 모듈 19세트를 대상으로 제안 방법을 평가하여 좌/우 정렬 오차 0.112와 좌/RGB 정렬 오차 0.085로 기존 방법과 경쟁력 있는 정렬 오차를 달성하였다. 기존 방법이 더 낮은 평균 정렬 오차를 보였으나, 기준 영상에 불규칙한 회전을 유발하여 실제 시각화 및 거리 추정 응용에 부적합한 경우가 확인되었다. 따라서 제안 방법은 단일 촬영 기반의 효율적인 정합 과정, 기준 영상의 시각적 안정성, 그리고 다중 센서 활용의 일관성을 동시에 만족시키는 실용적인 솔루션임이 증명되었다.
인간 활동 인식은 조명 변화, 개인 식별 위험 등의 문제로 인해 기존 영상 기반 접근법에 한계가 있다. 반면 레이더 기반 인식은 환경 변화에 강인하지만, 유사한 동작 간의 세밀한 구분에는 제약이 존재한다. 레이더-카메라 융합 기반 인간 행동 인식은 FMCW 레이더와 카메라를 동기화하여 데이터를 수집하고, 레이더 신호는 Range-Doppler-Time 형태의 3차원 표현으로 변환하여 시간적 동작 특성을 효과적으로 모델링한다. 카메라 데이터는 개인 식별이 불가능한 수준의 초저해상도로 축소한 후 프레임 간 차분을 적용함으로써, 외형 및 배경 정보는 제거하고 동작 변화 정보만을 유지한다. 이러한 전처리를 통해 프라이버시를 보호하면서도 활동 인식에 필요한 핵심 동작 정보를 확보하였다.
레이더와 카메라 각각에 대해 LSTM 기반 인코더를 적용하여 시간적 동작 패턴을 압축된 특징 벡터로 추출하고, 이를 결합하여 경량형 완전연결 분류기를 통해 최종 행동을 예측한다.
15가지 행동을 포함하는 자체 구축 데이터셋을 활용한 실험 결과, 제안된 레이더-카메라 융합 모델은 단일 센서 기반 모델 대비 평균 8\% 이상의 성능 향상을 보였으며, 98.37\%의 높은 인식 정확도를 달성하였다. 특히 미세한 동작 위주의 행동과 빠른 이동을 동반하는 행동 모두에서 안정적인 성능을 보였다. 더불어 전체 모델의 연산량은 약 13 MFLOPs 수준으로, 실시간 엣지 환경에 적합한 효율성을 갖는다.
다국어 초록 (Multilingual Abstract)
A triple-camera system (left + right + RGB) often requires separate calibrations, increasing computational cost and producing inconsistent reference frames. We propose an integrated framework that simultaneously calibrates and registers all three came...
A triple-camera system (left + right + RGB) often requires separate calibrations, increasing computational cost and producing inconsistent reference frames. We propose an integrated framework that simultaneously calibrates and registers all three cameras using the left camera as the reference. Only the right and RGB cameras are rotated and scaled, maintaining horizontal alignment without unnecessary rotation of the reference image. Evaluated on 19 wide-angle stereo sets, the method achieved competitive alignment errors (left/right: 0.112, left/RGB: 0.085) while preserving visual stability, making it practical for depth estimation and visualization.
Video-based recognition is sensitive to lighting and privacy concerns, while radar struggles with fine-grained actions. We propose a radar-camera fusion approach: radar signals are converted to Range-Doppler-Time for temporal modeling, and camera data is downsampled and differenced to retain only motion information. LSTM-based encoders extract temporal features from both modalities, which are fused and classified with a lightweight fully-connected network. On a 15-action dataset, the model achieves 98.37\% accuracy, outperforming single-sensor models by over 8\%, while maintaining real-time efficiency (~13 MFLOPs).
목차 (Table of Contents)