RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    통합 스크립트를 사용하는 클론 AI의 프레젠테이션 비디오 생성기 = A Presentation Video Generation System of Clone AI Using Integrated Script for Presentation Control

    한글로보기

    https://www.riss.kr/link?id=T17452397

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수

    부가정보

    국문 초록 (Abstract) kakao i 다국어 번역

    프레젠테이션을 위한 비디오는 과거 카메라 영상을 기반으로 많은 수작업을 통해 편집 및 제작되었지만, 현재 문서 내용을 자동으로 요약하는 인공지능, 비디오 슬라이드 영상을 생성해 주는 인공지능 등 다양한 인공지능 기술이 발전하고 있다. 본 연구에서는 이러한 다양한 인공지능을 사용하여 통합 스크립트(Integrated Script for Presentation Control)를 기반으로 한 클론 AI 프레젠테이션 비디오를 자동으로 생성하는 시스템을 제안하고, 이를 시스템으로 구현하고 성능을 평가하였다. 통합 스크립트는 사용자의 파워포인트 슬라이드의 텍스트를 추출하여 요약 문장을 만들고 사전에 학습된 사용자의 음성과 얼굴 영상을 가지는 클론 AI의 합성된 음성과 영상을 생성하는 스크립트로 구성되어 있다. 통합 스크립트에는 각 프레젠테이션 발표 자료의 내용 중 연출 효과가 필요한 구간에 마크업을 포함해 비디오 생성 시 텍스트에 특수한 효과를 나타내도록 설계하였다. 또한, 스크립트에는 발표자의 합성된 비디오와 동기화되어 텍스트 효과뿐만 아니라 지정된 시점에 동기화된 비디오가 생성되도록 하였다. 따라서 제안된 스크립트를 통해 사용자는 별도의 편집 과정 없이 각 슬라이드의 시각적 및 청각적 요소를 갖춘 프레젠테이션 자료와 시간상으로 동기화된 클론 AI의 프레젠테이션 비디오를 생성할 수 있다. 제안된 시스템은 음성 합성모듈, 얼굴 합성모듈 그리고 통합 스크립트에 의한 비디오 생성 모듈이 파이프라인으로 구성하였으며, 각 모듈은 독립적으로 설계되어 더 나은 성능의 인공지능 모듈로 대체될 수 있도록 하였다. 특히, 음성합성 모듈에서는 Fast-HuBERT 기반 오디오 특징 추출과정을 ONNX 추론 최적화 기법을 적용하여 연산 처리에 효율 향상을 가져왔으며, 이는 고성능 GPU 환경뿐만 아니라 모바일 및 임베디드와 같은 온디바이스 환경에서도 동작할 수 있음을 확인하였다. 따라서 본 논문에서 제안한 통합 스크립트 기반 프레젠테이션 비디오 생성 시스템은 클론 AI의 음성과 영상 그리고 통합 스크립트에 의한 프레젠테이션 슬라이드에 텍스트 효과가 설정된 시점과 동기화되어 나타나는 프레젠테이션 비디오를 자동으로 생성할 수 있다. 앞으로 제안된 통합 스크립트를 사용하여 다양한 효과로 표현된 자기만의 비디오를 생성할 수 있는 효율적인 방안이 마련되었다.
    번역하기

    프레젠테이션을 위한 비디오는 과거 카메라 영상을 기반으로 많은 수작업을 통해 편집 및 제작되었지만, 현재 문서 내용을 자동으로 요약하는 인공지능, 비디오 슬라이드 영상을 생성해 주...

    프레젠테이션을 위한 비디오는 과거 카메라 영상을 기반으로 많은 수작업을 통해 편집 및 제작되었지만, 현재 문서 내용을 자동으로 요약하는 인공지능, 비디오 슬라이드 영상을 생성해 주는 인공지능 등 다양한 인공지능 기술이 발전하고 있다. 본 연구에서는 이러한 다양한 인공지능을 사용하여 통합 스크립트(Integrated Script for Presentation Control)를 기반으로 한 클론 AI 프레젠테이션 비디오를 자동으로 생성하는 시스템을 제안하고, 이를 시스템으로 구현하고 성능을 평가하였다. 통합 스크립트는 사용자의 파워포인트 슬라이드의 텍스트를 추출하여 요약 문장을 만들고 사전에 학습된 사용자의 음성과 얼굴 영상을 가지는 클론 AI의 합성된 음성과 영상을 생성하는 스크립트로 구성되어 있다. 통합 스크립트에는 각 프레젠테이션 발표 자료의 내용 중 연출 효과가 필요한 구간에 마크업을 포함해 비디오 생성 시 텍스트에 특수한 효과를 나타내도록 설계하였다. 또한, 스크립트에는 발표자의 합성된 비디오와 동기화되어 텍스트 효과뿐만 아니라 지정된 시점에 동기화된 비디오가 생성되도록 하였다. 따라서 제안된 스크립트를 통해 사용자는 별도의 편집 과정 없이 각 슬라이드의 시각적 및 청각적 요소를 갖춘 프레젠테이션 자료와 시간상으로 동기화된 클론 AI의 프레젠테이션 비디오를 생성할 수 있다. 제안된 시스템은 음성 합성모듈, 얼굴 합성모듈 그리고 통합 스크립트에 의한 비디오 생성 모듈이 파이프라인으로 구성하였으며, 각 모듈은 독립적으로 설계되어 더 나은 성능의 인공지능 모듈로 대체될 수 있도록 하였다. 특히, 음성합성 모듈에서는 Fast-HuBERT 기반 오디오 특징 추출과정을 ONNX 추론 최적화 기법을 적용하여 연산 처리에 효율 향상을 가져왔으며, 이는 고성능 GPU 환경뿐만 아니라 모바일 및 임베디드와 같은 온디바이스 환경에서도 동작할 수 있음을 확인하였다. 따라서 본 논문에서 제안한 통합 스크립트 기반 프레젠테이션 비디오 생성 시스템은 클론 AI의 음성과 영상 그리고 통합 스크립트에 의한 프레젠테이션 슬라이드에 텍스트 효과가 설정된 시점과 동기화되어 나타나는 프레젠테이션 비디오를 자동으로 생성할 수 있다. 앞으로 제안된 통합 스크립트를 사용하여 다양한 효과로 표현된 자기만의 비디오를 생성할 수 있는 효율적인 방안이 마련되었다.

    더보기

    다국어 초록 (Multilingual Abstract) kakao i 다국어 번역

    Advances in artificial intelligence have transformed presentation creation from a manual process to an automated pipeline capable of summarizing documents and generating slides. This study extends this trend by proposing a personalized presentation video generation system that leverages an Integrated Script for Presentation Control (ISPC). The system was implemented and its performance evaluated. ISPC generates synthetic speech and video based on a user-written Script and a Clone AI pre-trained on user-specific audio-visual data. The Script contains markup indicating segments that require visual effects, and slide text effects are synchronized with the synthetic presenter video to the specified timestamps, producing a complete video. This allows users to create videos in which the visual and auditory components of each slide are temporally aligned without additional editing. The system architecture connects speech synthesis models, face synthesis models, ISPC, and video generation processes in a pipeline, with each module independently designed and replaceable. Additionally, the speech synthesis model applies Fast-HuBERT-based audio feature extraction and ONNX inference optimization to improve computational efficiency, and the system supports deployment on both high-performance GPU environments and on-device environments such as mobile and embedded platforms. The proposed ISPC-based system enables users to generate personalized presentation videos by synchronizing synthetic speech, video and slide text effects according to the timestamps defined in the Script. This approach allows users to regenerate videos in accordance with the Script settings without the need for manual editing. An efficient approach is now available to create unique videos with various effects by utilizing the proposed integrated script.
    번역하기

    Advances in artificial intelligence have transformed presentation creation from a manual process to an automated pipeline capable of summarizing documents and generating slides. This study extends this trend by proposing a personalized presentation vi...

    Advances in artificial intelligence have transformed presentation creation from a manual process to an automated pipeline capable of summarizing documents and generating slides. This study extends this trend by proposing a personalized presentation video generation system that leverages an Integrated Script for Presentation Control (ISPC). The system was implemented and its performance evaluated. ISPC generates synthetic speech and video based on a user-written Script and a Clone AI pre-trained on user-specific audio-visual data. The Script contains markup indicating segments that require visual effects, and slide text effects are synchronized with the synthetic presenter video to the specified timestamps, producing a complete video. This allows users to create videos in which the visual and auditory components of each slide are temporally aligned without additional editing. The system architecture connects speech synthesis models, face synthesis models, ISPC, and video generation processes in a pipeline, with each module independently designed and replaceable. Additionally, the speech synthesis model applies Fast-HuBERT-based audio feature extraction and ONNX inference optimization to improve computational efficiency, and the system supports deployment on both high-performance GPU environments and on-device environments such as mobile and embedded platforms. The proposed ISPC-based system enables users to generate personalized presentation videos by synchronizing synthetic speech, video and slide text effects according to the timestamps defined in the Script. This approach allows users to regenerate videos in accordance with the Script settings without the need for manual editing. An efficient approach is now available to create unique videos with various effects by utilizing the proposed integrated script.

    더보기

    목차 (Table of Contents)

    • 1. 서론 1
    • 1.1 연구 배경 1
    • 1.2 연구 목적 4
    • 2. 클론 AI 동영상의 생성 기술 7
    • 2.1 기존 연구 및 동향 분석 7
    • 1. 서론 1
    • 1.1 연구 배경 1
    • 1.2 연구 목적 4
    • 2. 클론 AI 동영상의 생성 기술 7
    • 2.1 기존 연구 및 동향 분석 7
    • 2.2 클론 AI의 동영상 생성 9
    • 2.3 데이터 수집 10
    • 2.4 음성 합성 11
    • 2.5 음성 학습 14
    • 2.6 얼굴 영상 합성 15
    • 2.7 얼굴 영상 학습 17
    • 3. 통합 스크립트를 활용한 클론 AI의 프레젠테이션 비디오 생성기 19
    • 3.1 개요 19
    • 3.2 커스텀 마크업 언어 21
    • 3.3 통합 스크립트 24
    • 3.4 클론 AI 비디오의 음성 분리 및 텍스트 추출 25
    • 3.5 인공지능 기반 및 고전적 음성 단어 분할 27
    • 3.6 비디오 영상과 프레젠테이션 자료와의 동기화 29
    • 3.7 온디바이스를 위한 인공지능 모델의 경량화 기법 32
    • 4. 실험 결과 35
    • 4.1 음성 생성 모델 성능 평가 35
    • 4.1.1 GlowTTS 성능 평가 35
    • 4.1.2 GlowTTS와 YourTTS의 비교 41
    • 4.2 얼굴 생성 모델 성능 평가 45
    • 4.3 클론 AI 비디오 생성 실험 48
    • 4.4 클론 AI 비디오의 음성 단어 분할 실험 48
    • 4.5 통합 스크립트를 활용한 클론 AI 비디오 생성 실험 49
    • 4.6 제안된 클론 AI 비디오 생성을 위한 통합 환경 시스템의 구현 51
    • 4.7 온디바이스 인공지능 모델 경량화 실험 56
    • 4.8 인공지능을 이용한 자동 요약 및 적용 64
    • 4.9 GPT-SoVITS를 활용한 음성 향상 방법 68
    • 5. 결론 및 고찰 71
    • 6. 참고 문헌 73
    • 부록 A. 프레젠테이션 비디오 생성기 매뉴얼 80
    • 부록 B. GPT-SoVITS 사용 안내 86
    • Abstract 92
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼