본 논문은 유사한 아이템의 반복적인 노출로 인해 사용자 이탈 위험이 증가하는 현상인 마케팅 피로도를 명시적으로 고려하는 효율적인 추천 전략을 연구한다. 밴딧 및 강화 학습을 추천 시...
본 논문은 유사한 아이템의 반복적인 노출로 인해 사용자 이탈 위험이 증가하는 현상인 마케팅 피로도를 명시적으로 고려하는 효율적인 추천 전략을 연구한다. 밴딧 및 강화 학습을 추천 시스템에 적용하려는 선행 연구는 많았지만, 추천이 사용자의 피로도와 이탈에 미치는 장기적인 영향을 다룬 연구는 드물다. 이러한 한계를 극복하기 위해, 우리는 피로도를 고려한 마르코프 결정 과정(Fatigue-aware Markov Decision Process, FA-MDP)을 제안한다. 이 모델은 전이 확률이 최근 추천 이력을 기반으로 한 로지스틱 함수에 의해 결정되며, 이탈 상태를 도입하여 자연스럽게 피로도로 인한 이탈 위험을 반영한다.
먼저, 우리는 Upper Confidence Bound 기반 알고리즘이 이 환경에서 이론적인 후회(regret) 상한을 보장함을 증명하였으나, 상태 공간이 기하급수적으로 증가함에 따라 실질적으로 계산 및 실행이 불가능해지는 문제가 있음을 확인하였다.
이러한 확장성 문제를 극복하기 위해, 우리는 몬테카를로 트리 탐색을 활용하여 효율적인 탐색의 핵심인 낙관적 정책을 근사하도록 하는 EMCTS-FA (Epistemic Monte Carlo Tree Search for FA-MDP) 알고리즘을 제안한다. EMCTS-FA는 이론으로부터 영감을 받은 낙관적 보상 함수를 사용하여 학습된 모델의 인식론적 불확실성을 반영한 효과적인 탐색을 유도한다.
인공 및 실제 데이터 기반의 시뮬레이터를 통한 다양한 크기의 환경에서의 실험 결과, EMCTS-FA가 불확실성을 고려하지 않는 알고리즘들에 비해 일관적으로 우수한 성능을 보였으며, 이는 피로도를 관리하고 장기적인 보상을 극대화하는 데 있어 본 연구에서 제안한 인식론적 불확실성에 기반한 탐색이 유효함을 입증한다.