RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    객체 중심 어텐션 유도를 통한 모방학습의 배경 의존성 완화연구 = Object Attention Guidance for Robust Imitation Learning under Background Variations

    한글로보기

    https://www.riss.kr/link?id=T17343152

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    기존의 로봇제어 분야에서 활용되는 모방학습 모델인 ACT(Action Chunking with Transformers)는 사람의 시연 데이터를 기반으로 로봇이 연속적인 행동 시퀀스를 학습함으로써 정밀한 조작 작업을 수행하는 데 우수한 성능을 보인다. 특히 트랜스포머 구조를 활용하여 장기 의존성을 효과적으로 모델링하고, 행동 청킹(Action Chunking)을 통해 추론 효율성과 행동의 일관성을 동시에 확보할 수 있다는 장점으로 주목받아 왔다. 그러나 이러한 ACT 기반 모방학습 모델은 학습이 이루어진 환경과 실제 임무가 수행되는 환경 간에 시각적 차이가 존재할 경우, 즉 배경의 색상, 조명 조건, 질감, 혹은 작업과 무관한 방해 물체가 추가되는 경우 성능이 급격하게 저하되는 한계를 가진다. 이는 모델이 작업 수행에 필수적인 핵심 객체의 시각적 특징뿐만 아니라, 배경의 패턴과 색상 등 작업과 직접적인 관련이 없는 시각적 정보까지 함께 학습하여 배경 정보에 과도하게 의존하는 특성에서 기인한다.이러한 배경 의존성 문제는 실제 산업 환경과 같이 비정형적이고 가변적인 환경에서 모방학습 기반 로봇 시스템의 신뢰성과 일반화 성능을 제한하는 주요 요인으로 작용한다. 학습 단계에서 관측되지 않았던 새로운 배경이 등장할 경우, 트랜스포머의 어텐션이 핵심 객체에서 이탈하여 배경 영역으로 분산되며, 그 결과 정책이 비정상적인 행동을 생성하거나 임무 수행에 실패하게 된다. 본 논문은 이러한 문제의 근본 원인을 트랜스포머 기반 모방학습 모델의 시각적 어텐션 구조에서 찾고, 모델의 용량을 단순히 증가시키는 대신 입력 단계에서 배경 정보를 능동적으로 제어하는 전략을 통해 해결하고자 한다. 이를 위해 본 논문에서는 객체 중심 어텐션 유도 기법인 IBR(Imitation learning with Background Robustness)을 제안한다. 제안한 IBR 기법은 트랜스포머의 어텐션 메커니즘이 배경이 아닌 작업 수행에 필수적인 핵심 객체에 집중하도록 유도함으로써, 배경 변화나 시각적 외란이 존재하는 환경에서도 로봇이 강인하게 임무를 수행할 수 있도록 설계되었다. 구체적으로, 입력 이미지에 대해 사전에 학습된 의미론적 분할 모델을 적용하여 핵심 객체의 위치정보를 이진 마스크 형태로 획득한다. 이 이진 마스크는 각 공간 위치가 배경 영역인지 객체 영역인지를 구분하는 역할을 하며, 이후 트랜스포머 디코더의 Cross-Attention 단계에 직접적으로 반영된다. 제안한 방법에서는 쿼리(Query)와 키(Key)의 내적 연산을 통해 계산된 어텐션 점수에 이진 마스크를 적용하여, 배경 영역에 해당하는 키 위치에 대해서는 큰 음수 값을 부여함으로써 Softmax 이후의 어텐션 가중치가 0에 수렴하도록 한다. 이를 통해 트랜스포머의 기본 구조와 학습 방식은 유지하면서도, 배경 영역으로의 어텐션 할당을 선택적으로 억제하고 핵심 객체 영역에 대해서만 집중적인 정보 통합이 이루어지도록 한다. 제안한 IBR 기법의 유효성을 검증하기 위하여, 본 논문에서는 두 대의 로봇팔을 사용하는 Transfer Cube 및 Insert Cube 시뮬레이션 임무를 대상으로 실험을 수행하였다. 실험에서는 학습 환경과 동일한 조건뿐만 아니라, 배경 색상을 변경하거나 작업과 무관한 물체를 추가하는 등 학습 시 관측되지 않았던 다양한 환경변수를 설정하여 성능을 평가하였다. 실험 결과, 제안한 방법은 학습 환경과 동일한 조건에서는 기존 ACT 모델과 동등한 수준의 임무 성공률을 유지하면서도, 배경 변화가 존재하는 환경에서는 기존모델 대비 임무 성공률 감소 폭을 유의미하게 완화하는 것으로 나타났다. 본 연구는 트랜스포머 기반 모방학습 모델의 시각적 일반화 성능 저하 문제를 어텐션 마스킹 관점에서 분석하고, 객체 중심 어텐션 유도를 통해 이를 완화하는 경량화된 접근법을 제시하였다. 이는 실제 산업현장과 같이 환경 변화가 빈번한 상황에서도 전문가 시연 기반 로봇제어의 안정성과 신뢰성을 향상하는데 기여할 수 있으며, 향후 다양한 모방학습 과제에 확장 적용될 수 있을 것으로 기대된다.
    번역하기

    기존의 로봇제어 분야에서 활용되는 모방학습 모델인 ACT(Action Chunking with Transformers)는 사람의 시연 데이터를 기반으로 로봇이 연속적인 행동 시퀀스를 학습함으로써 정밀한 조작 작업을 수...

    기존의 로봇제어 분야에서 활용되는 모방학습 모델인 ACT(Action Chunking with Transformers)는 사람의 시연 데이터를 기반으로 로봇이 연속적인 행동 시퀀스를 학습함으로써 정밀한 조작 작업을 수행하는 데 우수한 성능을 보인다. 특히 트랜스포머 구조를 활용하여 장기 의존성을 효과적으로 모델링하고, 행동 청킹(Action Chunking)을 통해 추론 효율성과 행동의 일관성을 동시에 확보할 수 있다는 장점으로 주목받아 왔다. 그러나 이러한 ACT 기반 모방학습 모델은 학습이 이루어진 환경과 실제 임무가 수행되는 환경 간에 시각적 차이가 존재할 경우, 즉 배경의 색상, 조명 조건, 질감, 혹은 작업과 무관한 방해 물체가 추가되는 경우 성능이 급격하게 저하되는 한계를 가진다. 이는 모델이 작업 수행에 필수적인 핵심 객체의 시각적 특징뿐만 아니라, 배경의 패턴과 색상 등 작업과 직접적인 관련이 없는 시각적 정보까지 함께 학습하여 배경 정보에 과도하게 의존하는 특성에서 기인한다.이러한 배경 의존성 문제는 실제 산업 환경과 같이 비정형적이고 가변적인 환경에서 모방학습 기반 로봇 시스템의 신뢰성과 일반화 성능을 제한하는 주요 요인으로 작용한다. 학습 단계에서 관측되지 않았던 새로운 배경이 등장할 경우, 트랜스포머의 어텐션이 핵심 객체에서 이탈하여 배경 영역으로 분산되며, 그 결과 정책이 비정상적인 행동을 생성하거나 임무 수행에 실패하게 된다. 본 논문은 이러한 문제의 근본 원인을 트랜스포머 기반 모방학습 모델의 시각적 어텐션 구조에서 찾고, 모델의 용량을 단순히 증가시키는 대신 입력 단계에서 배경 정보를 능동적으로 제어하는 전략을 통해 해결하고자 한다. 이를 위해 본 논문에서는 객체 중심 어텐션 유도 기법인 IBR(Imitation learning with Background Robustness)을 제안한다. 제안한 IBR 기법은 트랜스포머의 어텐션 메커니즘이 배경이 아닌 작업 수행에 필수적인 핵심 객체에 집중하도록 유도함으로써, 배경 변화나 시각적 외란이 존재하는 환경에서도 로봇이 강인하게 임무를 수행할 수 있도록 설계되었다. 구체적으로, 입력 이미지에 대해 사전에 학습된 의미론적 분할 모델을 적용하여 핵심 객체의 위치정보를 이진 마스크 형태로 획득한다. 이 이진 마스크는 각 공간 위치가 배경 영역인지 객체 영역인지를 구분하는 역할을 하며, 이후 트랜스포머 디코더의 Cross-Attention 단계에 직접적으로 반영된다. 제안한 방법에서는 쿼리(Query)와 키(Key)의 내적 연산을 통해 계산된 어텐션 점수에 이진 마스크를 적용하여, 배경 영역에 해당하는 키 위치에 대해서는 큰 음수 값을 부여함으로써 Softmax 이후의 어텐션 가중치가 0에 수렴하도록 한다. 이를 통해 트랜스포머의 기본 구조와 학습 방식은 유지하면서도, 배경 영역으로의 어텐션 할당을 선택적으로 억제하고 핵심 객체 영역에 대해서만 집중적인 정보 통합이 이루어지도록 한다. 제안한 IBR 기법의 유효성을 검증하기 위하여, 본 논문에서는 두 대의 로봇팔을 사용하는 Transfer Cube 및 Insert Cube 시뮬레이션 임무를 대상으로 실험을 수행하였다. 실험에서는 학습 환경과 동일한 조건뿐만 아니라, 배경 색상을 변경하거나 작업과 무관한 물체를 추가하는 등 학습 시 관측되지 않았던 다양한 환경변수를 설정하여 성능을 평가하였다. 실험 결과, 제안한 방법은 학습 환경과 동일한 조건에서는 기존 ACT 모델과 동등한 수준의 임무 성공률을 유지하면서도, 배경 변화가 존재하는 환경에서는 기존모델 대비 임무 성공률 감소 폭을 유의미하게 완화하는 것으로 나타났다. 본 연구는 트랜스포머 기반 모방학습 모델의 시각적 일반화 성능 저하 문제를 어텐션 마스킹 관점에서 분석하고, 객체 중심 어텐션 유도를 통해 이를 완화하는 경량화된 접근법을 제시하였다. 이는 실제 산업현장과 같이 환경 변화가 빈번한 상황에서도 전문가 시연 기반 로봇제어의 안정성과 신뢰성을 향상하는데 기여할 수 있으며, 향후 다양한 모방학습 과제에 확장 적용될 수 있을 것으로 기대된다.

    더보기

    목차 (Table of Contents)

    • I. 서론 1
    • 1. 연구 배경 1
    • II. 관계 연구 6
    • 1. 모방학습 6
    • 가. 행동 복제 6
    • I. 서론 1
    • 1. 연구 배경 1
    • II. 관계 연구 6
    • 1. 모방학습 6
    • 가. 행동 복제 6
    • 나. 시연 데이터 품질 개선 8
    • 다. ACT(Action Chunking with Transformers) 10
    • 라. 최신 모방학습 모델의 발전 동향 11
    • 1) Mobile Aloha 11
    • 2) Diffusion Policy 13
    • 3) Octo 14
    • 마. 모방학습의 시각적 강건성 한계 17
    • 2. 트랜스포머 기반 모델 및 비전 응용 19
    • 가. 트랜스포머 모델 개요 19
    • 나. 어텐션 메커니즘과 마스크 20
    • 1) 패딩마스크(Padding Mask) 21
    • 2) 록어해드(look-ahead)또는 인과(causal)마스크 21
    • 다. DETR 22
    • III. 객체 중심 어텐션 유도 방법 제안 24
    • 1. 이진 영역 마스크의 정의 25
    • 2. 영역 선택적 Attention Mask 25
    • IV. 실험 29
    • 1. 실험 임무 구성 29
    • 2. 성능 평가 36
    • 3. 실험 수행 36
    • 4. 실험 고찰 38
    • 5. Transfer Cube 실험 상세 분석 38
    • 가. 학습 환경에서의 성능 보존 38
    • 나. 배경 색상 변화에 따른 도메인 적응력 분석 39
    • 다. Obstacles 환경에서의 강인성 39
    • 6. Insert Cube 상세 분석 40
    • 가. 어텐션 맵 시각화 분석 40
    • 나. 양팔 협업 임무에서의 성능 40
    • 다. 배경 변화 및 시각적 강인성 평가 40
    • 7. 종합 고찰 41
    • 가. 비정형 환경에 대한 강인성 확보 41
    • V. 결론 및 향후 계획 49
    • 참고문헌 40
    • Abstract 55
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼