RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    심한 가려짐 환경에 강인한 3D 인스턴스 분할을 위한 정보량 기반 뷰 선정 및 기하학적 학습 전략 : 2D 이미지로부터 재구성된 3D 공간을 대상으로 = Robust 3D Instance Segmentation under Severe Occlusion via Information-driven View Selection and a Geometric Learning Strategy

    한글로보기

    https://www.riss.kr/link?id=T17503685

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    최근 메타버스, 디지털 트윈 등 3차원 가상 환경 기술이 발전함에 따라, 현실 공간을 디지털화하고 이해하는 3차원 인스턴스 분할(3D Instance Segmentation) 기술의 중요성이 급증하고 있다. Neural Radiance Fields (NeRF)는 다시점 2D 영상만으로 고품질의 3D 장면을 복원하는 획기적인 방법론으로 주목받았으나, 장면 내 객체를 `분할'하는 기능은 부재했다. 이를 해결하기 위해 NeRF와 2D 분할 모델 SAM(Segment Anything Model)을 결합한 SA3D와 같은 연구가 시도되었으나, 이는 (1) 사용자의 `수동 프롬프트(Prompt)'에 절대적으로 의존하여 자동화가 불가능하고, (2) `사람'과 같이 복잡한 객체의 말단 영역 분할이 불안정하며, (3) 여러 인스턴스를 개별적으로 구별하지 못하고, (4) 임의의 학습 순서로 인해 3D 마스크의 일관성이 저해되며, (5) 심각한 `가려짐(Occlusion)' 상황에서 객체 추적에 실패하는 명확한 한계점을 지녔다.

    본 논문은 이러한 기존 연구의 한계를 극복하기 위해, 심각한 가려짐 환경에서도 강건하게 작동하는 완전 자동화된 3차원 인스턴스 분할 프롬워크를 제안한다.

    첫째, SA3D의 수동 SAM 프롬프트를 프롬프트가 필요 없는(Prompt-free) 자동 2D 인스턴스 분할 모델인 YOLOv8-seg로 대체하여, 사용자 개입 없는 완전 자동화 및 인스턴스 단위 분할을 동시에 실현하였다.

    둘째, 자동화 과정에서 발생하는 새로운 문제들을 해결하기 위해 독창적인 `기하학적 학습 전략'을 도입했다. (1) `정보량 기반 초기 시점 선택' 알고리즘은 YOLOv8-seg의 검출 신뢰도(Confidence)와 인스턴스 개수(Count)를 결합하여, 가려짐이 가장 적고 객체 정보가 풍부한 뷰(View)에서 학습을 시작함으로써 초기 객체 누락을 방지했다. (2) `포즈 기반 뷰 순서 정렬' 알고리즘은 3D 공간상 카메라의 SE(3) 포즈(Pose) 간의 기하학적 거리를 계산하고, `히스토리 기반 시점 전환' 로직을 더하여 3D 마스크가 공간적으로 가장 인접한 뷰 순서대로 부드럽게 전파되도록 학습 순서를 최적화하였다. (3) `강건한 인스턴스 추적' 알고리즘은 3D 마스크 투영 IoU와 2D 검출 신뢰도를 결합한 스코어링 방식을 사용하여, 객체가 일시적으로 완전히 가려졌다가 다시 나타나는 상황에서도 동일 인스턴스 ID를 강건하게 유지하였다. 마지막으로, `2단계 반복 최적화'를 통해 1단계에서 부정확하게 학습된 3D 마스크를 각 인스턴스별 최적의 시점에서 다시 학습하도록 하여 말단 영역의 품질까지 극대화하였다.

    제안하는 프레임워크의 성능을 검증하기 위해, 심각한 가려짐을 포함하는 자체 제작 `people1', `people2' 데이터셋 및 공개 데이터셋(T\&T-Truck)에서 실험을 수행하였다. 정량적 평가 결과, 제안하는 방법은 0.9003의 mIoU를 달성하여 2D 기반 YOLO(0.8471) 및 3D 기반 SA3D(0.7655)를 큰 폭으로 능가했다. 특히 Ablation Study는 제안하는 세 가지 핵심 모듈(초기 뷰, 뷰 순서, 추적)이 모두 성능 향상에 유기적으로 기여함을 증명했다. 정성적 평가에서는 SA3D가 분할에 실패한 `people2' 데이터셋의 심각하게 가려진 인스턴스(P1, P2)의 전신 마스크를 3D 일관성을 통해 성공적으로 복원해내는 강건함을 시각적으로 입증하였다.
    번역하기

    최근 메타버스, 디지털 트윈 등 3차원 가상 환경 기술이 발전함에 따라, 현실 공간을 디지털화하고 이해하는 3차원 인스턴스 분할(3D Instance Segmentation) 기술의 중요성이 급증하고 있다. Neural Ra...

    최근 메타버스, 디지털 트윈 등 3차원 가상 환경 기술이 발전함에 따라, 현실 공간을 디지털화하고 이해하는 3차원 인스턴스 분할(3D Instance Segmentation) 기술의 중요성이 급증하고 있다. Neural Radiance Fields (NeRF)는 다시점 2D 영상만으로 고품질의 3D 장면을 복원하는 획기적인 방법론으로 주목받았으나, 장면 내 객체를 `분할'하는 기능은 부재했다. 이를 해결하기 위해 NeRF와 2D 분할 모델 SAM(Segment Anything Model)을 결합한 SA3D와 같은 연구가 시도되었으나, 이는 (1) 사용자의 `수동 프롬프트(Prompt)'에 절대적으로 의존하여 자동화가 불가능하고, (2) `사람'과 같이 복잡한 객체의 말단 영역 분할이 불안정하며, (3) 여러 인스턴스를 개별적으로 구별하지 못하고, (4) 임의의 학습 순서로 인해 3D 마스크의 일관성이 저해되며, (5) 심각한 `가려짐(Occlusion)' 상황에서 객체 추적에 실패하는 명확한 한계점을 지녔다.

    본 논문은 이러한 기존 연구의 한계를 극복하기 위해, 심각한 가려짐 환경에서도 강건하게 작동하는 완전 자동화된 3차원 인스턴스 분할 프롬워크를 제안한다.

    첫째, SA3D의 수동 SAM 프롬프트를 프롬프트가 필요 없는(Prompt-free) 자동 2D 인스턴스 분할 모델인 YOLOv8-seg로 대체하여, 사용자 개입 없는 완전 자동화 및 인스턴스 단위 분할을 동시에 실현하였다.

    둘째, 자동화 과정에서 발생하는 새로운 문제들을 해결하기 위해 독창적인 `기하학적 학습 전략'을 도입했다. (1) `정보량 기반 초기 시점 선택' 알고리즘은 YOLOv8-seg의 검출 신뢰도(Confidence)와 인스턴스 개수(Count)를 결합하여, 가려짐이 가장 적고 객체 정보가 풍부한 뷰(View)에서 학습을 시작함으로써 초기 객체 누락을 방지했다. (2) `포즈 기반 뷰 순서 정렬' 알고리즘은 3D 공간상 카메라의 SE(3) 포즈(Pose) 간의 기하학적 거리를 계산하고, `히스토리 기반 시점 전환' 로직을 더하여 3D 마스크가 공간적으로 가장 인접한 뷰 순서대로 부드럽게 전파되도록 학습 순서를 최적화하였다. (3) `강건한 인스턴스 추적' 알고리즘은 3D 마스크 투영 IoU와 2D 검출 신뢰도를 결합한 스코어링 방식을 사용하여, 객체가 일시적으로 완전히 가려졌다가 다시 나타나는 상황에서도 동일 인스턴스 ID를 강건하게 유지하였다. 마지막으로, `2단계 반복 최적화'를 통해 1단계에서 부정확하게 학습된 3D 마스크를 각 인스턴스별 최적의 시점에서 다시 학습하도록 하여 말단 영역의 품질까지 극대화하였다.

    제안하는 프레임워크의 성능을 검증하기 위해, 심각한 가려짐을 포함하는 자체 제작 `people1', `people2' 데이터셋 및 공개 데이터셋(T\&T-Truck)에서 실험을 수행하였다. 정량적 평가 결과, 제안하는 방법은 0.9003의 mIoU를 달성하여 2D 기반 YOLO(0.8471) 및 3D 기반 SA3D(0.7655)를 큰 폭으로 능가했다. 특히 Ablation Study는 제안하는 세 가지 핵심 모듈(초기 뷰, 뷰 순서, 추적)이 모두 성능 향상에 유기적으로 기여함을 증명했다. 정성적 평가에서는 SA3D가 분할에 실패한 `people2' 데이터셋의 심각하게 가려진 인스턴스(P1, P2)의 전신 마스크를 3D 일관성을 통해 성공적으로 복원해내는 강건함을 시각적으로 입증하였다.

    더보기

    다국어 초록 (Multilingual Abstract) kakao i 다국어 번역

    As technologies for 3D virtual environments like the Metaverse and Digital Twins advance, the importance of 3D Instance Segmentation for digitizing real-world spaces has surged. Neural Radiance Fields (NeRF) reconstruct high-quality 3D scenes from 2D images but lack object segmentation functionality. While SA3D combines NeRF with SAM to address this, it suffers from clear limitations: (1) absolute reliance on manual prompts preventing automation; (2) instability in segmenting complex objects; (3) inability to distinguish individual instances; (4) arbitrary processing orders degrading consistency; and (5) failure in object matching under severe occlusion.

    This thesis proposes a fully automated 3D instance segmentation framework robust to occlusion-heavy environments. First, SA3D's manual prompting was replaced with YOLOv8-seg, achieving both full automation and instance-level segmentation.

    Second, a novel `geometric learning strategy' was introduced to solve automation challenges. (1) An `information-driven initial view selection' algorithm utilizes detection confidence and instance counts to start learning from the most informative view, preventing object omission. (2) A `pose-based view sequence ordering' algorithm optimizes the learning order based on SE(3) geometric distances and history-aware logic, ensuring smooth mask propagation across adjacent views. (3) A `robust instance matching' algorithm combines 3D projection IoU and 2D confidence to maintain instance IDs even during temporary occlusion. Finally, a `two-pass optimization' process refines mask quality by re-learning from optimal viewpoints.

    Experiments on custom occlusion-heavy datasets (`people1', `people2') and benchmarks (T\&T-Truck) validated the framework. In quantitative evaluation, the proposed method achieved a mIoU of 0.9003, significantly outperforming 2D-based YOLO (0.8471) and 3D-based SA3D (0.7655). Ablation studies confirmed that the three core modules synergistically contribute to performance improvements. Qualitative results visually demonstrated robustness by successfully reconstructing full-body masks of severely occluded instances (P1, P2) in the `people2' dataset, which SA3D failed to segment.
    번역하기

    As technologies for 3D virtual environments like the Metaverse and Digital Twins advance, the importance of 3D Instance Segmentation for digitizing real-world spaces has surged. Neural Radiance Fields (NeRF) reconstruct high-quality 3D scenes from 2D ...

    As technologies for 3D virtual environments like the Metaverse and Digital Twins advance, the importance of 3D Instance Segmentation for digitizing real-world spaces has surged. Neural Radiance Fields (NeRF) reconstruct high-quality 3D scenes from 2D images but lack object segmentation functionality. While SA3D combines NeRF with SAM to address this, it suffers from clear limitations: (1) absolute reliance on manual prompts preventing automation; (2) instability in segmenting complex objects; (3) inability to distinguish individual instances; (4) arbitrary processing orders degrading consistency; and (5) failure in object matching under severe occlusion.

    This thesis proposes a fully automated 3D instance segmentation framework robust to occlusion-heavy environments. First, SA3D's manual prompting was replaced with YOLOv8-seg, achieving both full automation and instance-level segmentation.

    Second, a novel `geometric learning strategy' was introduced to solve automation challenges. (1) An `information-driven initial view selection' algorithm utilizes detection confidence and instance counts to start learning from the most informative view, preventing object omission. (2) A `pose-based view sequence ordering' algorithm optimizes the learning order based on SE(3) geometric distances and history-aware logic, ensuring smooth mask propagation across adjacent views. (3) A `robust instance matching' algorithm combines 3D projection IoU and 2D confidence to maintain instance IDs even during temporary occlusion. Finally, a `two-pass optimization' process refines mask quality by re-learning from optimal viewpoints.

    Experiments on custom occlusion-heavy datasets (`people1', `people2') and benchmarks (T\&T-Truck) validated the framework. In quantitative evaluation, the proposed method achieved a mIoU of 0.9003, significantly outperforming 2D-based YOLO (0.8471) and 3D-based SA3D (0.7655). Ablation studies confirmed that the three core modules synergistically contribute to performance improvements. Qualitative results visually demonstrated robustness by successfully reconstructing full-body masks of severely occluded instances (P1, P2) in the `people2' dataset, which SA3D failed to segment.

    더보기

    목차 (Table of Contents)

    • 1. 서론 1
    • 1.1. 연구 배경 및 필요성 1
    • 1.2. 연구 목적 및 범위 2
    • 1.3. 본 연구의 기여점 5
    • 1.4. 논문 구성 6
    • 1. 서론 1
    • 1.1. 연구 배경 및 필요성 1
    • 1.2. 연구 목적 및 범위 2
    • 1.3. 본 연구의 기여점 5
    • 1.4. 논문 구성 6
    • 2. 3차원 장면 표현 기술 8
    • 2.1. 3차원 장면 표현 기술의 발전 8
    • 2.2. 암묵적 신경망 표현 8
    • 2.3. NeRF (Neural Radiance Fields)의 원리 9
    • 3. 2D 및 3D 세그멘테이션 기술 17
    • 3.1. 2D 분할 기술의 발전 17
    • 3.2. 파운데이션 모델의 등장: SAM (Segment Anything Model) 17
    • 3.3. NeRF와 2D 분할의 결합: SA3D 19
    • 3.4. 자동화된 2D 인스턴스 분할: YOLOv8-seg 24
    • 4. 제안하는 3차원 인스턴스 분할 프레임워크 27
    • 4.1. 제안하는 프레임워크 개요 27
    • 4.2. 1단계 접근: YOLOv8-seg 기반 SA3D 자동화 29
    • 4.3. 1단계 접근의 한계점 30
    • 4.4. 2단계 접근: 개선된 프레임워크 (제안하는 최종 모델) 31
    • 5. 실험 및 결과 41
    • 5.1. 실험 환경 및 데이터셋 41
    • 5.2. 실험 결과 및 분석 43
    • 6. 결론 54
    • 6.1. 연구 요약 및 성과 54
    • 6.2. 향후 연구 방향 56
    • 참고문헌 58
    • Abstract 61
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼