딥러닝은 계산 역량을 획기적으로 변화시켜 컴퓨터 비전, 자연어 처리, 음성 인식
등 다양한 분야에서 혁신을 가능하게 했습니다 [142]. 엄선된 대규모 데이터셋으
로 훈련된 ResNet과 GPT와 같...
딥러닝은 계산 역량을 획기적으로 변화시켜 컴퓨터 비전, 자연어 처리, 음성 인식
등 다양한 분야에서 혁신을 가능하게 했습니다 [142]. 엄선된 대규모 데이터셋으
로 훈련된 ResNet과 GPT와 같은 대표적인 모델들은 이러한 놀라운 발전을 잘
보여주며, 여러 작업에서 이전에 없던 높은 성능을 일관되게 달성하고 인간 수준
이상의 정확도를 기록하고 있습니다 [60, 16].
이러한 눈부신 발전에도 불구하고 최근 딥러닝 연구는 상당한 도전에 직면해
있습니다. 특히, 딥러닝 모델들이 인터넷에서 얻을 수 있는 대부분의 고품질 데이
터를 이미 소진함에 따라, 단순히 데이터 규모를 늘리는 방식의 성능 향상은 점점
한계에 이르고 있습니다 [142]. 한편, 모델이 동적 상호작용을 통해 적응적으로
학습하고, 전문적이고 데이터가 부족한 환경에서도 효과적으로 작동하는 새로운
가능성이 등장하고 있습니다 [15]. 실시간으로 상호작용하는 AI 시스템과 고도로
전문화된 산업 분야 등 이러한 새로운 응용 환경들은 기존 딥러닝 패러다임이
제대로 대응하기 어려운 독특한 도전을 제기합니다.
본 논문은 딥러닝 프레임워크에서 데이터가 가지는 핵심적 역할에 주목하여
이러한 중대한 도전들을 체계적으로 다룹니다. 구체적으로, 제한된 라벨 데이터
를 활용한 효과적인 모델 학습과 무한한 데이터 스트림을 효율적으로 처리하고
활용하는 두 가지 주요 데이터 중심의 도전을 다룹니다. 이러한 문제를 극복하기
위해 본 연구는 딥러닝 시스템의 효율성과 적응성을 모두 향상시키기 위해 특별히
설계된 혁신적인 데이터 최적화 방법론을 제안합니다.
본 연구의 핵심적인 기여 중 하나는 유익하고 고품질의 훈련 데이터를 생성하
여 대규모 라벨 데이터셋 의존성을 완화하는 합성 데이터 생성 프레임워크입니다
[91, 92]. 이에 더하여, 라벨 오류 및 이상치를 식별하고 수정하거나 제거함으로써
훈련 데이터의 무결성과 신뢰성을 보장하는 종합적인 대규모 데이터 정제 프레임 워크를 소개합니다 [94]. 또한 Transformer 기반 아키텍처에 최적화된 고급 데이터
압축 방법을 개발하여 온라인 상호작용과 메모리 사용 관리의 효율성을 크게 향상
시킴으로써, 실시간으로 상호작용하는 실제 환경에서의 활용 가능성을 높였습니다
[93, 97, 98].
이러한 기여들은 데이터 개선이 직접적으로 모델 성능 향상을 촉진하고, 다시
모델의 성능 향상이 데이터 최적화 전략을 더욱 정교하게 만드는 공동 최적화 프
레임워크를 구성합니다. 이와 같은 반복적이고 자기 강화적인 순환 구조는 딥러닝
모델이 제한된 라벨 데이터와 무한히 풍부한 데이터 스트림 모두를 효과적으로
활용하여 강력한 학습과 추론을 가능케 합니다.
본 연구를 통해 개발되고 실증적으로 검증된 방법론들은 실질적인 활용 가
능성을 크게 높이는 동시에 의미 있는 이론적 통찰을 제공합니다. 기존 딥러닝
프레임워크에 원칙에 기반한 확장을 제안함으로써 본 연구는 향후 연구를 위한 탄
탄한 기초를 마련하며, 적응적이고 효율적이며 확장 가능한 딥러닝 시스템 개발을
위한 새로운 연구 방향을 제시합니다.