RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    무인기 운용을 위한 멀티 에이전트 강화학습 연구 = A Study on Multi-Agent Reinforcement Learning for the Operation of UAVs

    한글로보기

    https://www.riss.kr/link?id=T17374371

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    최근 인구 감소와 전장 환경의 급격한 변화는 제한된 자원을 적극적으로 활용하고, 자율적 협력 전략을 구사할 수 있는 무인기 군집 운용 기술의 필요성을 크게 부각시키고 있다. 본 연구는 실제 전장 상황에서 군집 무인체계의 운용 및 설계 방향을 도출하는 것을 목적으로 한다. 연구에서는 Unity 기반 시뮬레이션 환경과 MA-POCA(Multi-Agent POsthumous Credit Assignment) 알고리즘을 활용하여, 멀티 에이전트 강화학 습 프레임워크를 구축하였다. 이를 적용한 실험 설계는 두 가지 핵심 축으로 구성하였다. 첫째, 적 드론의 수에 대한 아군 드론 투입 대수를 조정하며 임무 성공률, 군집 협력정책의 수렴 패턴, 그리고 대표 성능지표(누적 보상, 에피소 드 길이, 정책 엔트로피 등) 변화를 정량적으로 비교 분석함으로써, 각 임무 조건에서의 가장 효율적인 아군 운용 대수를 도출하였다. 둘째, 대표 조합 내 에서 핵심 보상값(타겟 파괴 시)을 1, 3, 5의 다양한 스케일로 변화시켜, 보상 설계의 크기 및 구조가 협력 정책의 안정성, 탐험-수렴 균형, 팀워크 효율 등 행동 정책 및 학습 성능 지표에 미치는 영향을 비교, 평가하였다. 실험 결과, 아군 대 적군 4:3 및 5:4의 구성비에서 임무 성공률과 협력 효율 이 높게 나타났으며, 타겟 파괴 보상값을 3으로 설정한 경우 정책의 수렴 속 도, 집단 행동 다양성, 학습 효율성 측면에서 모두 최적의 성능이 확인되었다. 각 단계는 환경 파라미터 및 보상 함수의 세분화 설계와 통제된 실험 조건에 서 진행되었고, 실제 군집 운용 시스템의 전략적 의사결정 요인에 대한 실증 적 근거를 제공한다. 나아가 본 연구는 강화학습 기반 군집 운용 분야뿐만 아 니라, 실제 전장 시뮬레이션 설계의 기준 마련에 기여할 것으로 기대된다.
    주요어 : 멀티 에이전트, 군집 무인기, 시뮬레이션, MA-POCA, 협력 정책, 강화학습
    번역하기

    최근 인구 감소와 전장 환경의 급격한 변화는 제한된 자원을 적극적으로 활용하고, 자율적 협력 전략을 구사할 수 있는 무인기 군집 운용 기술의 필요성을 크게 부각시키고 있다. 본 연구는 ...

    최근 인구 감소와 전장 환경의 급격한 변화는 제한된 자원을 적극적으로 활용하고, 자율적 협력 전략을 구사할 수 있는 무인기 군집 운용 기술의 필요성을 크게 부각시키고 있다. 본 연구는 실제 전장 상황에서 군집 무인체계의 운용 및 설계 방향을 도출하는 것을 목적으로 한다. 연구에서는 Unity 기반 시뮬레이션 환경과 MA-POCA(Multi-Agent POsthumous Credit Assignment) 알고리즘을 활용하여, 멀티 에이전트 강화학 습 프레임워크를 구축하였다. 이를 적용한 실험 설계는 두 가지 핵심 축으로 구성하였다. 첫째, 적 드론의 수에 대한 아군 드론 투입 대수를 조정하며 임무 성공률, 군집 협력정책의 수렴 패턴, 그리고 대표 성능지표(누적 보상, 에피소 드 길이, 정책 엔트로피 등) 변화를 정량적으로 비교 분석함으로써, 각 임무 조건에서의 가장 효율적인 아군 운용 대수를 도출하였다. 둘째, 대표 조합 내 에서 핵심 보상값(타겟 파괴 시)을 1, 3, 5의 다양한 스케일로 변화시켜, 보상 설계의 크기 및 구조가 협력 정책의 안정성, 탐험-수렴 균형, 팀워크 효율 등 행동 정책 및 학습 성능 지표에 미치는 영향을 비교, 평가하였다. 실험 결과, 아군 대 적군 4:3 및 5:4의 구성비에서 임무 성공률과 협력 효율 이 높게 나타났으며, 타겟 파괴 보상값을 3으로 설정한 경우 정책의 수렴 속 도, 집단 행동 다양성, 학습 효율성 측면에서 모두 최적의 성능이 확인되었다. 각 단계는 환경 파라미터 및 보상 함수의 세분화 설계와 통제된 실험 조건에 서 진행되었고, 실제 군집 운용 시스템의 전략적 의사결정 요인에 대한 실증 적 근거를 제공한다. 나아가 본 연구는 강화학습 기반 군집 운용 분야뿐만 아 니라, 실제 전장 시뮬레이션 설계의 기준 마련에 기여할 것으로 기대된다.
    주요어 : 멀티 에이전트, 군집 무인기, 시뮬레이션, MA-POCA, 협력 정책, 강화학습

    더보기

    목차 (Table of Contents)

    • 제1장 서 론 1
    • 1.1. 연구 배경 및 목적 1
    • 1.2. 연구 범위 및 내용 3
    • 제2장 관련연구 4
    • 2.1. Unity ML-Agents 4
    • 제1장 서 론 1
    • 1.1. 연구 배경 및 목적 1
    • 1.2. 연구 범위 및 내용 3
    • 제2장 관련연구 4
    • 2.1. Unity ML-Agents 4
    • 2.2. 멀티 에이전트 강화학습 6
    • 2.3. 연구 동향 13
    • 제3장 멀티 에이전트 강화학습 설계 15
    • 3.1. 환경 요소 15
    • 3.2. 강화학습 시나리오 17
    • 3.3. 보상 체계 20
    • 제4장 실험 및 분석 22
    • 4.1. 실험 조건 및 방법 22
    • 4.2. 결과 분석 26
    • 제5장 결 론 33
    • 참고문헌 35
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼