대규모 언어 모델(Large Language Models, LLMs)은 생성 문장에서 사회적 편향을 내포하는 경향이 있으며, 이는 공정성과 잠재적 피해 측면에서 윤리적인 문제를 야기한다. 본 논문에서는 이러한 편...
대규모 언어 모델(Large Language Models, LLMs)은 생성 문장에서 사회적 편향을 내포하는 경향이 있으며, 이는 공정성과 잠재적 피해 측면에서 윤리적인 문제를 야기한다. 본 논문에서는 이러한 편향 문제를 완화하기 위해 어텐션 기반의 편향 완화 프레임워크인 KLAAD (KL-Attention Alignment Debiasing)를 제안한다. 이 방법은 고정관념(stereotype) 문장과 반고정관념(anti-stereotype) 문장 간의 어텐션 분포를 정렬(alignment)하도록 유도함으로써, 모델의 가중치를 직접 변경하지 않고도 편향을 줄이는 것을 목표로 한다. 이를 위해 Cross-Entropy, KL divergence, Triplet loss로 구성된 복합 손실 함수를 설계하여, 사회적 편향을 내포한 문맥과 그렇지 않은 문맥 모두에서 일관된 어텐션 분포가 유지되도록 모델을 학습시킨다. BBQ 및 BOLD 벤치마크에서 수행한 실험 결과, 제안하는 KLAAD는 모델의 언어 생성 성능을 크게 저하시키지 않으면서도 편향을 효과적으로 줄이는 것으로 나타났다. 본 연구는 어텐션 정렬 기반의 접근법이 생성형 언어 모델에서 사회적 편향을 완화하는 실질적인 방법이 될 수 있음을 시사한다.