최근 메타버스, 디지털 트윈 등 3차원 가상 환경 기술이 발전함에 따라, 현실 공간을 디지털화하고 이해하는 3차원 인스턴스 분할(3D Instance Segmentation) 기술의 중요성이 급증하고 있다. Neural Ra...

http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
https://www.riss.kr/link?id=T17503685
천안 : 한국기술교육대학교 일반대학원, 2026
학위논문(석사) -- 한국기술교육대학교 일반대학원 , 메카트로닉스공학과 메카트로닉스공학전공 , 2026. 2
2026
한국어
충청남도
; 26 cm
지도교수: 이석
I804:44013-200000971191
0
상세조회0
다운로드최근 메타버스, 디지털 트윈 등 3차원 가상 환경 기술이 발전함에 따라, 현실 공간을 디지털화하고 이해하는 3차원 인스턴스 분할(3D Instance Segmentation) 기술의 중요성이 급증하고 있다. Neural Ra...
최근 메타버스, 디지털 트윈 등 3차원 가상 환경 기술이 발전함에 따라, 현실 공간을 디지털화하고 이해하는 3차원 인스턴스 분할(3D Instance Segmentation) 기술의 중요성이 급증하고 있다. Neural Radiance Fields (NeRF)는 다시점 2D 영상만으로 고품질의 3D 장면을 복원하는 획기적인 방법론으로 주목받았으나, 장면 내 객체를 `분할'하는 기능은 부재했다. 이를 해결하기 위해 NeRF와 2D 분할 모델 SAM(Segment Anything Model)을 결합한 SA3D와 같은 연구가 시도되었으나, 이는 (1) 사용자의 `수동 프롬프트(Prompt)'에 절대적으로 의존하여 자동화가 불가능하고, (2) `사람'과 같이 복잡한 객체의 말단 영역 분할이 불안정하며, (3) 여러 인스턴스를 개별적으로 구별하지 못하고, (4) 임의의 학습 순서로 인해 3D 마스크의 일관성이 저해되며, (5) 심각한 `가려짐(Occlusion)' 상황에서 객체 추적에 실패하는 명확한 한계점을 지녔다.
본 논문은 이러한 기존 연구의 한계를 극복하기 위해, 심각한 가려짐 환경에서도 강건하게 작동하는 완전 자동화된 3차원 인스턴스 분할 프롬워크를 제안한다.
첫째, SA3D의 수동 SAM 프롬프트를 프롬프트가 필요 없는(Prompt-free) 자동 2D 인스턴스 분할 모델인 YOLOv8-seg로 대체하여, 사용자 개입 없는 완전 자동화 및 인스턴스 단위 분할을 동시에 실현하였다.
둘째, 자동화 과정에서 발생하는 새로운 문제들을 해결하기 위해 독창적인 `기하학적 학습 전략'을 도입했다. (1) `정보량 기반 초기 시점 선택' 알고리즘은 YOLOv8-seg의 검출 신뢰도(Confidence)와 인스턴스 개수(Count)를 결합하여, 가려짐이 가장 적고 객체 정보가 풍부한 뷰(View)에서 학습을 시작함으로써 초기 객체 누락을 방지했다. (2) `포즈 기반 뷰 순서 정렬' 알고리즘은 3D 공간상 카메라의 SE(3) 포즈(Pose) 간의 기하학적 거리를 계산하고, `히스토리 기반 시점 전환' 로직을 더하여 3D 마스크가 공간적으로 가장 인접한 뷰 순서대로 부드럽게 전파되도록 학습 순서를 최적화하였다. (3) `강건한 인스턴스 추적' 알고리즘은 3D 마스크 투영 IoU와 2D 검출 신뢰도를 결합한 스코어링 방식을 사용하여, 객체가 일시적으로 완전히 가려졌다가 다시 나타나는 상황에서도 동일 인스턴스 ID를 강건하게 유지하였다. 마지막으로, `2단계 반복 최적화'를 통해 1단계에서 부정확하게 학습된 3D 마스크를 각 인스턴스별 최적의 시점에서 다시 학습하도록 하여 말단 영역의 품질까지 극대화하였다.
제안하는 프레임워크의 성능을 검증하기 위해, 심각한 가려짐을 포함하는 자체 제작 `people1', `people2' 데이터셋 및 공개 데이터셋(T\&T-Truck)에서 실험을 수행하였다. 정량적 평가 결과, 제안하는 방법은 0.9003의 mIoU를 달성하여 2D 기반 YOLO(0.8471) 및 3D 기반 SA3D(0.7655)를 큰 폭으로 능가했다. 특히 Ablation Study는 제안하는 세 가지 핵심 모듈(초기 뷰, 뷰 순서, 추적)이 모두 성능 향상에 유기적으로 기여함을 증명했다. 정성적 평가에서는 SA3D가 분할에 실패한 `people2' 데이터셋의 심각하게 가려진 인스턴스(P1, P2)의 전신 마스크를 3D 일관성을 통해 성공적으로 복원해내는 강건함을 시각적으로 입증하였다.
다국어 초록 (Multilingual Abstract)
As technologies for 3D virtual environments like the Metaverse and Digital Twins advance, the importance of 3D Instance Segmentation for digitizing real-world spaces has surged. Neural Radiance Fields (NeRF) reconstruct high-quality 3D scenes from 2D ...
As technologies for 3D virtual environments like the Metaverse and Digital Twins advance, the importance of 3D Instance Segmentation for digitizing real-world spaces has surged. Neural Radiance Fields (NeRF) reconstruct high-quality 3D scenes from 2D images but lack object segmentation functionality. While SA3D combines NeRF with SAM to address this, it suffers from clear limitations: (1) absolute reliance on manual prompts preventing automation; (2) instability in segmenting complex objects; (3) inability to distinguish individual instances; (4) arbitrary processing orders degrading consistency; and (5) failure in object matching under severe occlusion.
This thesis proposes a fully automated 3D instance segmentation framework robust to occlusion-heavy environments. First, SA3D's manual prompting was replaced with YOLOv8-seg, achieving both full automation and instance-level segmentation.
Second, a novel `geometric learning strategy' was introduced to solve automation challenges. (1) An `information-driven initial view selection' algorithm utilizes detection confidence and instance counts to start learning from the most informative view, preventing object omission. (2) A `pose-based view sequence ordering' algorithm optimizes the learning order based on SE(3) geometric distances and history-aware logic, ensuring smooth mask propagation across adjacent views. (3) A `robust instance matching' algorithm combines 3D projection IoU and 2D confidence to maintain instance IDs even during temporary occlusion. Finally, a `two-pass optimization' process refines mask quality by re-learning from optimal viewpoints.
Experiments on custom occlusion-heavy datasets (`people1', `people2') and benchmarks (T\&T-Truck) validated the framework. In quantitative evaluation, the proposed method achieved a mIoU of 0.9003, significantly outperforming 2D-based YOLO (0.8471) and 3D-based SA3D (0.7655). Ablation studies confirmed that the three core modules synergistically contribute to performance improvements. Qualitative results visually demonstrated robustness by successfully reconstructing full-body masks of severely occluded instances (P1, P2) in the `people2' dataset, which SA3D failed to segment.
목차 (Table of Contents)