대규모 언어 모델은 복잡한 추론 과제에서 우수한 성능을 보이지만, 여전히 오류
전파, 환각, 그리고 취약한 다단계 추론 문제에 취약하다. Chain-of-Thought, SelfConsistency, Tree-of-Thought와 같은 추...
대규모 언어 모델은 복잡한 추론 과제에서 우수한 성능을 보이지만, 여전히 오류
전파, 환각, 그리고 취약한 다단계 추론 문제에 취약하다. Chain-of-Thought, SelfConsistency, Tree-of-Thought와 같은 추론 시점 기법들은 정확도를 향상시키지만,
외부 감독 없이 작동하기 때문에 잘못된 가정이 도입될 경우 쉽게 실패한다. 본 연
구에서는 모델 재학습이나 파라미터 확장 없이, 보상 기반 모니터링, 반성, 그리고
선택적 피드백을 결합한 추론 시점 Human-in-the-Loop 추론 프레임워크를 제안한다.
제안하는 프레임워크는 Process Reward Model(PRM) 또는 LLM 기반 보상 평
가기를 사용하여 중간 추론 단계를 평가하고, 필요할 때에만 개입을 유도한다. 또한
오류 탐지와 교정을 분리한 구조화된 피드백 스키마를 도입하여 국소적 및 전역
적 추론 복구를 가능하게 하며, 피드백 품질, 보상 모델, 임계값, self-consistency가
정확도, 계산 비용, 그리고 인간 개입 부담에 미치는 영향을 분석한다.
GSM8K의 도전적인 하위 데이터셋에 대한 실험 결과, HITL 추론은 기본 추론
방식 대비 일관되게 우수한 성능을 보였다. 특히 더 강력한 추론 모델일수록 HITL의
효과가 커지며, 고품질 피드백은 개입 빈도를 감소시키고, self-consistency는 토큰
사용량의 증가를 억제하면서 인간의 개입 부담을 더욱 줄인다. 또한 사전 학습된
PRM이 없는 환경에서도 범용 LLM이 보상 및 피드백 모델로 효과적으로 활용될 수
있음을 보여주며, 새로운 도메인에서의 HITL 적용 가능성을 제시한다.