인간 피드백을 활용한 강화학습(RLHF)은 대형 언어 모델(LLM)의 출력을 인간의 의도에 맞게 조정하기 위한 대표적인 기법으로 자리 잡고 있다. 그러나 이 방식으로 학습된 보상 모델은 종종 응...
인간 피드백을 활용한 강화학습(RLHF)은 대형 언어 모델(LLM)의 출력을 인간의 의도에 맞게 조정하기 위한 대표적인 기법으로 자리 잡고 있다. 그러나 이 방식으로 학습된 보상 모델은 종종 응답의 품질과 장황함을 혼동하여, 길이가 긴 응답에 일관되게 높은 보상을 부여하는 \textit{길이 편향(length bias)}을 나타낸다. 본 연구에서는 이러한 편향을 분석하고 완화하기 위한 인과적(interventional) 프레임워크를 제안한다. 핵심 아이디어는, 정보량은 같지만 길이가 다른 응답 쌍, 혹은 길이는 유사하지만 내용이 다른 응답 쌍을 생성하는 \textit{반사실적 데이터 증강(counterfactual data augmentation)} 기법을 활용하는 것이다. 이러한 제어된 비교쌍을 통해 보상 모델은 장황함이 아닌 내용 품질에 기반하여 응답을 평가할 수 있도록 유도된다. 실험 결과, 제안하는 방법은 보상 모델의 길이 편향을 효과적으로 줄이며, 정책 모델로부터 더 간결하고 의미 중심적인 출력을 유도함을 확인하였다. 본 연구는 인과 기반 데이터 증강이 RLHF 보상 학습의 견고성과 내용 민감도를 향상시킬 수 있음을 시사한다.