본 연구는 대규모 언어 모델(LLM)에서 토큰 임베딩이 의미적으로 성숙해지는 과정을 임베딩 성숙도(maturation)라는 개념을 중심으로 분석하고, 이를 통해 언어 모델 학습 메커니즘에 대한 통합...
본 연구는 대규모 언어 모델(LLM)에서 토큰 임베딩이 의미적으로 성숙해지는 과정을 임베딩 성숙도(maturation)라는 개념을 중심으로 분석하고, 이를 통해 언어 모델 학습 메커니즘에 대한 통합적인 통찰을 제공하는 것을 목표로 한다. RoBERTa 기반 모델을 Wikitext-103 데이터셋으로 학습시키고, 학습 중 임베딩 벡터의 동적 변화를 정량적으로 분석함으로써, 성숙도 개념의 구조적 유용성을 검증하였다. 특히 전체 토큰 간 평균 코사인 유사도, 개별 토큰과 Common Vector 간 유사도 변화, 그리고 등장 빈도에 따른 임베딩의 분산성 등을 측정하여, 토큰이 공통된 임베딩 중심에서 얼마나 멀어지는지를 성숙도의 지표로 삼았다.
실험 결과, 빈도가 높은 토큰일수록 다양한 문맥에서 의미적으로 분화되며 빠르게 성숙하는 반면, 저빈도 또는 미등장 토큰은 Common Vector에 가까운 유사도를 지속적으로 유지해 미성숙한 상태를 보였다. 이러한 현상은 데이터 구성 방식에 따라서도 명확히 나타났다. 동일한 토큰(‘far-left’)에 대해 원본 조건, 단순 중복(30배), 문장 다양성 확보(409문장)라는 세 조건을 비교한 실험에서, 단순 중복은 임베딩 성숙도를 오히려 저해하였고, 의미적 특성이 임베딩에 반영되지 않은 채 Common Vector 근처에 머무르게 했다. 반면, 문맥의 다양성을 제공한 경우 임베딩이 빠르게 Common Vector로부터 분리되어 높은 성숙도를 유지하며, 이는 모델의 일반화 가능성과 직결됨을 시사하였다.
또한, 임베딩 성숙도의 관점을 확장하여 트랜스포머의 FFN(Feed-Forward Network) 파라미터를 임베딩 공간에 투영한 분석을 수행하였다. 레이어별 Key 벡터 분포는 층별로 뚜렷한 차이를 보였으며, 낮은 레이어는 문법 및 구조적 패턴에 집중된 군집을 형성했고, 높은 레이어는 분산된 형태로 의미적 표현을 포착하는 성숙한 패턴을 나타냈다. 이는 임베딩 성숙도뿐 아니라 내부 파라미터 자체도 데이터 다양성과 빈도에 반응하여 계층적으로 성숙해감을 보여준다.
결론적으로, 첫째, 임베딩 성숙도는 토큰의 빈도 및 문맥 노출 다양성에 따라 다르게 나타나며, 높은 성숙도는 표현력 있는 임베딩 형성의 핵심 지표가 된다. 둘째, 성숙도를 촉진하는 데이터 구성 전략은
단순 반복보다 문맥 다양성 확보에 기반해야 하며, 학습 초기에 저빈도 토큰에 대한 성숙 보정이 필요하다. 셋째, FFN 파라미터 분석은 모델 해석 가능성과 임베딩 품질 진단의 보조 지표로 활용될 수 있다.
본 연구는 임베딩 성숙도라는 새로운 해석 틀을 통해 언어 모델의 학습과정을 통합적으로 이해할 수 있는 이론적, 실용적 기반을 제공하며, 향후 데이터 구성, 학습 스케줄링, 모델 해석 등 다양한 응용 가능성을 제시한다.