RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    대규모 언어 모델(LLM)과 3D모델 휴먼 아바타를 이용한 인공지능 컴패니언 제작 사례 연구 = A Case Study on the Development of AI Companions Using Large Language Model (LLM) and 3D Human Avatars

    한글로보기

    https://www.riss.kr/link?id=T17351629

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수
    인용문이 복사되었습니다.

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    대규모 언어 모델(LLM)과 3D모델 휴먼 아바타를 이용한 인공지능 컴패니언 제작 사례 연구 4차 산업혁명의 도래와 함께 인공지능(AI) 기술은 비약적인 발전을 거듭하며 인류의 삶 전반에 깊숙이 침투하고 있다. 특히 2022년 말 등장한 대규모 언어 모델(LLM, Large Language Models) 기반 인공지능 챗봇인 챗지피티(ChatGPT)는 생성형 AI의 대중화를 이끌며, 텍스트 기반의 단순 정보 처리를 넘어 인간과 자연스러운 대화가 가능한 AI 에이전트의 시대를 활짝 열었다. 이제 AI는 단순한 도구를 넘어 사용자의 일상에 깊이 관여하 고 정서적 지지를 제공하는 반려(Companion)의 개념으로 진화하고 있다. 더불어 허깅 페이스(Hugging Face)와 같은 오픈소스 플랫폼의 활성화와 다양한 API(Application Programing Interface)의 등장은 전문 개발자가 아니더라도 누구나 고도화된 AI 기술을 활용하여 자신만의 서비스를 제작할 수 있는 AI 민주화 흐름을 가속화하고 있다. 이러한 기술적 환경은 기존의 텍스트 중심 챗봇이 가지는 전달력의 한계를 넘어, 시각적 실재감과 비언어적 표현력을 갖춘 3D 아바타와 결합된 차세대 멀티모달(Multi-modal) AI 컴패니언 서비스의 출현을 예고하고 있다. 현업 개발자이자 AI 기술에 깊은 관심을 가 진 연구자로서, 본인은 최근 급부상한 대규모 언어 모델(LLM)의 놀라운 언어 처리 능력 에 주목하였다. 그러나 현재 대다수의 LLM 활용 사례가 웹 브라우저 상의 텍스트 채팅이 나 코드 생성 등 기능적인 측면에 머물러 있다는 점에 문제의식을 느꼈다. 인간의 소통은 언어적 정보뿐만 아니라 표정, 목소리 톤, 시선 등 비언어적 요소가 결합될 때 비로소 완성되기 때문이다. 이에 ‘지능형 모델에 인간과 유사한 3D 외형과 감정이 담긴 목소리를 부여한다면, 사용자 경험은 어떻게 확장될 것인가?’라는 연구적 호기심을 바탕으로, 클라우드 기반의 거대 모델이 아닌 로컬 환경에서도 충분히 매력적인 AI 컴패니언을 구동 할 수 있는지 기술적 타당성을 확인해보고자 하였다. 본 연구의 목적은 최신 LLM 기술과 리얼타임 3D 렌더링 기술을 융합하여, 사용자와 실 시간으로 소통하고 정서적 교감을 나눌 수 있는 실재감 있는 인공지능 컴패니언 프로토 타입을 설계하고 구현하는 것이다. 구체적으로는 텍스트 기반 챗봇의 한계를 극복하고, 시청각적 몰입감을 극대화할 수 있는 통합 시스템 아키텍처를 제시하고자 한다. 이를 통 해 사용자가 AI를 단순한 기계가 아닌 인격을 가진 페르소나(Persona)로 인식할 수 있는 기술적 환경을 구축하고, 궁극적으로는 이러한 기술 융합이 교육(AI 튜터), 헬스케어(디지털 돌봄, 심리 상담), 엔터테인먼트(가상 아이돌, 게임 NPC) 등 다양한 산업 분야에서 실 질적인 부가가치를 창출할 수 있는 확장성 있는 서비스 모델로 발전할 수 있음을 프로토 타입을 통해 제안하는데 연구의 지향점이 있다. 본 연구는 문헌 고찰을 통한 이론적 분석과 실제 프로토타입 제작을 통한 구현 연구의 두 단계로 진행된다. 먼저 문헌 연구를 통해 트랜스포머(Transformer) 아키텍처 기반의 대규모 언어 모델(LLM)과 딥러닝 기반 뉴럴 TTS(Neural TTS)의 기술적 진화 과정을 고 찰하고, HCI 관점에서 멀티모달(Multi-modal) 인터페이스가 제공하는 사회적 실재감 (Social Presence)의 효과와 버추얼 휴먼의 결합이 갖는 의미를 분석한다. 이를 바탕으로 실제 구현 단계에서는 유니티(Unity) 6 게임 엔진을 통합 개발 환경으로 채택하여 기술 간의 융합을 시도한다. 특히 데이터 프라이버시 보호와 비용 효율성을 고려하여 로컬 구동이 가능한 경량화 LLM인 큐웬(Qwen) 3 14B 모델을 LLM for Unity 에셋을 통해 연동하며, Google Cloud TTS API를 활용하여 텍스트에 자연스러운 음성을 부여한다. 나아가 생성된 음성 파형을 실시간으로 분석하여 3D 아바타의 블렌드 셰이프 (BlendShapes)를 제어하는 유립싱크(uLipSync) 기술을 적용함으로써, 아바타가 실제로 말하는 듯한 정교한 립싱크를 구현한다. 이러한 인공지능 컴패니언 프로토타입의 기술적 구현 과정을 상세히 기술하여 완성된 프로토타입을 통해 향후 발전 가능성을 탐색하고자 한다. 본 연구의 의의는 개발된 프로토타입이 단순한 기술 시연을 넘어, 실제 상용화 가능한 서비스 모델로 확장될 수 있는 명확한 기술적 청사진(Blueprint)을 제시한다는 점에 있 다. 인간적인 외형과 지성을 갖춘 캐릭터 기반의 컴패니언 서비스는 사용자에게 단순 정보 제공을 넘어선 정서적 교감을 가능하게 하며, 이는 기존 텍스트 기반 챗봇 서비스와 차별화된 핵심 경쟁력이 된다. 본 연구는 LLM과 3D 휴먼 캐릭터 아바타 기술의 결합이 새로운 시장을 창출할 수 있는 혁신적인 접근법임을 확인하며, 향후 AI 교육 튜터, 디지털 헬스케어 동반자, 가상 아이돌등 구체적인 비즈니스 모델로 발전할 수 있는 기술적 토대를 마련한다는 점에서 그 가치를 가진다.
    번역하기

    대규모 언어 모델(LLM)과 3D모델 휴먼 아바타를 이용한 인공지능 컴패니언 제작 사례 연구 4차 산업혁명의 도래와 함께 인공지능(AI) 기술은 비약적인 발전을 거듭하며 인류의 삶 전반에 깊숙...

    대규모 언어 모델(LLM)과 3D모델 휴먼 아바타를 이용한 인공지능 컴패니언 제작 사례 연구 4차 산업혁명의 도래와 함께 인공지능(AI) 기술은 비약적인 발전을 거듭하며 인류의 삶 전반에 깊숙이 침투하고 있다. 특히 2022년 말 등장한 대규모 언어 모델(LLM, Large Language Models) 기반 인공지능 챗봇인 챗지피티(ChatGPT)는 생성형 AI의 대중화를 이끌며, 텍스트 기반의 단순 정보 처리를 넘어 인간과 자연스러운 대화가 가능한 AI 에이전트의 시대를 활짝 열었다. 이제 AI는 단순한 도구를 넘어 사용자의 일상에 깊이 관여하 고 정서적 지지를 제공하는 반려(Companion)의 개념으로 진화하고 있다. 더불어 허깅 페이스(Hugging Face)와 같은 오픈소스 플랫폼의 활성화와 다양한 API(Application Programing Interface)의 등장은 전문 개발자가 아니더라도 누구나 고도화된 AI 기술을 활용하여 자신만의 서비스를 제작할 수 있는 AI 민주화 흐름을 가속화하고 있다. 이러한 기술적 환경은 기존의 텍스트 중심 챗봇이 가지는 전달력의 한계를 넘어, 시각적 실재감과 비언어적 표현력을 갖춘 3D 아바타와 결합된 차세대 멀티모달(Multi-modal) AI 컴패니언 서비스의 출현을 예고하고 있다. 현업 개발자이자 AI 기술에 깊은 관심을 가 진 연구자로서, 본인은 최근 급부상한 대규모 언어 모델(LLM)의 놀라운 언어 처리 능력 에 주목하였다. 그러나 현재 대다수의 LLM 활용 사례가 웹 브라우저 상의 텍스트 채팅이 나 코드 생성 등 기능적인 측면에 머물러 있다는 점에 문제의식을 느꼈다. 인간의 소통은 언어적 정보뿐만 아니라 표정, 목소리 톤, 시선 등 비언어적 요소가 결합될 때 비로소 완성되기 때문이다. 이에 ‘지능형 모델에 인간과 유사한 3D 외형과 감정이 담긴 목소리를 부여한다면, 사용자 경험은 어떻게 확장될 것인가?’라는 연구적 호기심을 바탕으로, 클라우드 기반의 거대 모델이 아닌 로컬 환경에서도 충분히 매력적인 AI 컴패니언을 구동 할 수 있는지 기술적 타당성을 확인해보고자 하였다. 본 연구의 목적은 최신 LLM 기술과 리얼타임 3D 렌더링 기술을 융합하여, 사용자와 실 시간으로 소통하고 정서적 교감을 나눌 수 있는 실재감 있는 인공지능 컴패니언 프로토 타입을 설계하고 구현하는 것이다. 구체적으로는 텍스트 기반 챗봇의 한계를 극복하고, 시청각적 몰입감을 극대화할 수 있는 통합 시스템 아키텍처를 제시하고자 한다. 이를 통 해 사용자가 AI를 단순한 기계가 아닌 인격을 가진 페르소나(Persona)로 인식할 수 있는 기술적 환경을 구축하고, 궁극적으로는 이러한 기술 융합이 교육(AI 튜터), 헬스케어(디지털 돌봄, 심리 상담), 엔터테인먼트(가상 아이돌, 게임 NPC) 등 다양한 산업 분야에서 실 질적인 부가가치를 창출할 수 있는 확장성 있는 서비스 모델로 발전할 수 있음을 프로토 타입을 통해 제안하는데 연구의 지향점이 있다. 본 연구는 문헌 고찰을 통한 이론적 분석과 실제 프로토타입 제작을 통한 구현 연구의 두 단계로 진행된다. 먼저 문헌 연구를 통해 트랜스포머(Transformer) 아키텍처 기반의 대규모 언어 모델(LLM)과 딥러닝 기반 뉴럴 TTS(Neural TTS)의 기술적 진화 과정을 고 찰하고, HCI 관점에서 멀티모달(Multi-modal) 인터페이스가 제공하는 사회적 실재감 (Social Presence)의 효과와 버추얼 휴먼의 결합이 갖는 의미를 분석한다. 이를 바탕으로 실제 구현 단계에서는 유니티(Unity) 6 게임 엔진을 통합 개발 환경으로 채택하여 기술 간의 융합을 시도한다. 특히 데이터 프라이버시 보호와 비용 효율성을 고려하여 로컬 구동이 가능한 경량화 LLM인 큐웬(Qwen) 3 14B 모델을 LLM for Unity 에셋을 통해 연동하며, Google Cloud TTS API를 활용하여 텍스트에 자연스러운 음성을 부여한다. 나아가 생성된 음성 파형을 실시간으로 분석하여 3D 아바타의 블렌드 셰이프 (BlendShapes)를 제어하는 유립싱크(uLipSync) 기술을 적용함으로써, 아바타가 실제로 말하는 듯한 정교한 립싱크를 구현한다. 이러한 인공지능 컴패니언 프로토타입의 기술적 구현 과정을 상세히 기술하여 완성된 프로토타입을 통해 향후 발전 가능성을 탐색하고자 한다. 본 연구의 의의는 개발된 프로토타입이 단순한 기술 시연을 넘어, 실제 상용화 가능한 서비스 모델로 확장될 수 있는 명확한 기술적 청사진(Blueprint)을 제시한다는 점에 있 다. 인간적인 외형과 지성을 갖춘 캐릭터 기반의 컴패니언 서비스는 사용자에게 단순 정보 제공을 넘어선 정서적 교감을 가능하게 하며, 이는 기존 텍스트 기반 챗봇 서비스와 차별화된 핵심 경쟁력이 된다. 본 연구는 LLM과 3D 휴먼 캐릭터 아바타 기술의 결합이 새로운 시장을 창출할 수 있는 혁신적인 접근법임을 확인하며, 향후 AI 교육 튜터, 디지털 헬스케어 동반자, 가상 아이돌등 구체적인 비즈니스 모델로 발전할 수 있는 기술적 토대를 마련한다는 점에서 그 가치를 가진다.

    더보기

    목차 (Table of Contents)

    • <그림 목차> ⅰ
    • <표 목차> ⅱ
    • <국문 초록> ⅲ
    • 제 1 장 서 론 1
    • 1.1 연구 배경 및 목적 1
    • <그림 목차> ⅰ
    • <표 목차> ⅱ
    • <국문 초록> ⅲ
    • 제 1 장 서 론 1
    • 1.1 연구 배경 및 목적 1
    • 1.2 연구 범위 및 방법 2
    • 제 2 장 이론적 배경 5
    • 2.1 인공지능의 기술적 진화와 생성형 AI 5
    • 2.1.1 인공지능의 정의 및 기술적 계층 구조 5
    • 2.2 대규모언어모델(LLM)과 트랜스포머아키텍처의혁신 9
    • 2.2.1 LLM의 개념 및 작동 원리인 확률적 토큰 예측 9
    • 2.2.2 트랜스포머(Transformer) 아키텍처의핵심메커니즘 12
    • 2.2.3 인간피드백기반강화학습(RLHF)과모델의정렬 16
    • 2.3 텍스트 음성 변환(TTS) 기술의 진화와 뉴럴 TTS 17
    • 2.3.1 전통적 음성 합성 기술의 한계 17
    • 2.3.2 딥러닝 기반 뉴럴 TTS(Neural TTS)의 등장과 혁신 19
    • 2.4 인공지능 컴패니언의 정의 및 서비스 현황 20
    • 제 3 장 인공지능 컴패니언 제작 도구의 유형별 특성과 활용 29
    • 3.1 통합 개발 환경으로서의 유니티(Unity) 6 30
    • 3.2 프로토타입 제작 핵심 도구 34
    • 3.2.1 LLM for Unity 34
    • 3.2.2 Google Cloud Text-to-Speech를 활용한 음성 변환 39
    • 3.2.3 3D 모델 아바타 적용 45
    • 3.2.4 3D 캐릭터 모델 BlendShapes 47
    • 3.2.5 uLipSync를 이용한 3D 아바타 입모양 동기화 50
    • 제 4 장 인공지능 컴패니언 프로토타입 제작 54
    • 4.1 LLM 구축 54
    • 4.1.1 LLM 모델 적용 및 채팅 설정 54
    • 4.2 3D 모델 아바타 적용57
    • 4.2.1 Unity AssetStore 3D Model Import 58
    • 4.2.2 BlendShapes 지원 확인60
    • 4.3 TTS 적용 62
    • 4.3.1 Google Cloud Text-to-Speech API 설정 62
    • 4.3.2 uLipsync로 입모양 싱크 설정 65
    • 4.4 인공지능 컴패니언 통합 구현 68
    • 제 5 장 결론 및 제언 73
    • 5.1 결론 73
    • 5.2 제언 75
    • <참고문헌> 77
    • <! Not Allowed Tag Filtered ><Abstract> 84
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼