대규모 언어 모델(LLM)과 3D모델 휴먼 아바타를 이용한 인공지능 컴패니언 제작 사례 연구 4차 산업혁명의 도래와 함께 인공지능(AI) 기술은 비약적인 발전을 거듭하며 인류의 삶 전반에 깊숙...

http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
https://www.riss.kr/link?id=T17351629
세종 : 한국영상대학교 마이스터대학원, 2025
학위논문(석사) -- 한국영상대학교 마이스터대학원 , 디자인 , 2026. 2
2025
한국어
세종
; 26 cm
지도교수: 정새해
I804:44025-200000954174
0
상세조회0
다운로드대규모 언어 모델(LLM)과 3D모델 휴먼 아바타를 이용한 인공지능 컴패니언 제작 사례 연구 4차 산업혁명의 도래와 함께 인공지능(AI) 기술은 비약적인 발전을 거듭하며 인류의 삶 전반에 깊숙...
대규모 언어 모델(LLM)과 3D모델 휴먼 아바타를 이용한 인공지능 컴패니언 제작 사례 연구 4차 산업혁명의 도래와 함께 인공지능(AI) 기술은 비약적인 발전을 거듭하며 인류의 삶 전반에 깊숙이 침투하고 있다. 특히 2022년 말 등장한 대규모 언어 모델(LLM, Large Language Models) 기반 인공지능 챗봇인 챗지피티(ChatGPT)는 생성형 AI의 대중화를 이끌며, 텍스트 기반의 단순 정보 처리를 넘어 인간과 자연스러운 대화가 가능한 AI 에이전트의 시대를 활짝 열었다. 이제 AI는 단순한 도구를 넘어 사용자의 일상에 깊이 관여하 고 정서적 지지를 제공하는 반려(Companion)의 개념으로 진화하고 있다. 더불어 허깅 페이스(Hugging Face)와 같은 오픈소스 플랫폼의 활성화와 다양한 API(Application Programing Interface)의 등장은 전문 개발자가 아니더라도 누구나 고도화된 AI 기술을 활용하여 자신만의 서비스를 제작할 수 있는 AI 민주화 흐름을 가속화하고 있다. 이러한 기술적 환경은 기존의 텍스트 중심 챗봇이 가지는 전달력의 한계를 넘어, 시각적 실재감과 비언어적 표현력을 갖춘 3D 아바타와 결합된 차세대 멀티모달(Multi-modal) AI 컴패니언 서비스의 출현을 예고하고 있다. 현업 개발자이자 AI 기술에 깊은 관심을 가 진 연구자로서, 본인은 최근 급부상한 대규모 언어 모델(LLM)의 놀라운 언어 처리 능력 에 주목하였다. 그러나 현재 대다수의 LLM 활용 사례가 웹 브라우저 상의 텍스트 채팅이 나 코드 생성 등 기능적인 측면에 머물러 있다는 점에 문제의식을 느꼈다. 인간의 소통은 언어적 정보뿐만 아니라 표정, 목소리 톤, 시선 등 비언어적 요소가 결합될 때 비로소 완성되기 때문이다. 이에 ‘지능형 모델에 인간과 유사한 3D 외형과 감정이 담긴 목소리를 부여한다면, 사용자 경험은 어떻게 확장될 것인가?’라는 연구적 호기심을 바탕으로, 클라우드 기반의 거대 모델이 아닌 로컬 환경에서도 충분히 매력적인 AI 컴패니언을 구동 할 수 있는지 기술적 타당성을 확인해보고자 하였다. 본 연구의 목적은 최신 LLM 기술과 리얼타임 3D 렌더링 기술을 융합하여, 사용자와 실 시간으로 소통하고 정서적 교감을 나눌 수 있는 실재감 있는 인공지능 컴패니언 프로토 타입을 설계하고 구현하는 것이다. 구체적으로는 텍스트 기반 챗봇의 한계를 극복하고, 시청각적 몰입감을 극대화할 수 있는 통합 시스템 아키텍처를 제시하고자 한다. 이를 통 해 사용자가 AI를 단순한 기계가 아닌 인격을 가진 페르소나(Persona)로 인식할 수 있는 기술적 환경을 구축하고, 궁극적으로는 이러한 기술 융합이 교육(AI 튜터), 헬스케어(디지털 돌봄, 심리 상담), 엔터테인먼트(가상 아이돌, 게임 NPC) 등 다양한 산업 분야에서 실 질적인 부가가치를 창출할 수 있는 확장성 있는 서비스 모델로 발전할 수 있음을 프로토 타입을 통해 제안하는데 연구의 지향점이 있다. 본 연구는 문헌 고찰을 통한 이론적 분석과 실제 프로토타입 제작을 통한 구현 연구의 두 단계로 진행된다. 먼저 문헌 연구를 통해 트랜스포머(Transformer) 아키텍처 기반의 대규모 언어 모델(LLM)과 딥러닝 기반 뉴럴 TTS(Neural TTS)의 기술적 진화 과정을 고 찰하고, HCI 관점에서 멀티모달(Multi-modal) 인터페이스가 제공하는 사회적 실재감 (Social Presence)의 효과와 버추얼 휴먼의 결합이 갖는 의미를 분석한다. 이를 바탕으로 실제 구현 단계에서는 유니티(Unity) 6 게임 엔진을 통합 개발 환경으로 채택하여 기술 간의 융합을 시도한다. 특히 데이터 프라이버시 보호와 비용 효율성을 고려하여 로컬 구동이 가능한 경량화 LLM인 큐웬(Qwen) 3 14B 모델을 LLM for Unity 에셋을 통해 연동하며, Google Cloud TTS API를 활용하여 텍스트에 자연스러운 음성을 부여한다. 나아가 생성된 음성 파형을 실시간으로 분석하여 3D 아바타의 블렌드 셰이프 (BlendShapes)를 제어하는 유립싱크(uLipSync) 기술을 적용함으로써, 아바타가 실제로 말하는 듯한 정교한 립싱크를 구현한다. 이러한 인공지능 컴패니언 프로토타입의 기술적 구현 과정을 상세히 기술하여 완성된 프로토타입을 통해 향후 발전 가능성을 탐색하고자 한다. 본 연구의 의의는 개발된 프로토타입이 단순한 기술 시연을 넘어, 실제 상용화 가능한 서비스 모델로 확장될 수 있는 명확한 기술적 청사진(Blueprint)을 제시한다는 점에 있 다. 인간적인 외형과 지성을 갖춘 캐릭터 기반의 컴패니언 서비스는 사용자에게 단순 정보 제공을 넘어선 정서적 교감을 가능하게 하며, 이는 기존 텍스트 기반 챗봇 서비스와 차별화된 핵심 경쟁력이 된다. 본 연구는 LLM과 3D 휴먼 캐릭터 아바타 기술의 결합이 새로운 시장을 창출할 수 있는 혁신적인 접근법임을 확인하며, 향후 AI 교육 튜터, 디지털 헬스케어 동반자, 가상 아이돌등 구체적인 비즈니스 모델로 발전할 수 있는 기술적 토대를 마련한다는 점에서 그 가치를 가진다.
목차 (Table of Contents)