멀티모달 거대언어 모델(Multimodal Large Language Models)은여러 이미지를 동시에 처리하며 복잡한 시각적추론을요구하는 시나리오에 점점 더 널리 활용되고있다. 그러나 현재의MLLMs는 여전히 객체...
멀티모달 거대언어 모델(Multimodal Large Language Models)은여러 이미지를 동시에 처리하며 복잡한 시각적추론을요구하는 시나리오에 점점 더 널리 활용되고있다. 그러나 현재의MLLMs는 여전히 객체 환각(object hallucination)이라는 근본적인한계를 지니고있으며, 이는 실제 이미지와 일치하지 않지만 그럴듯해 보이는 객체 정보를 생성하는 문제를 의미한다. 기존의 벤치마크들은 주로 단일 이미지 설정에 초점을 맞추거나, 다중 이미지 환경에서도 고수준의 성능만을 평가하는 데 그쳐, 시각적 복잡성과 추론 요구가 어떻게 객체 환각을 유발하는지를 체계적으로 진단하는 데 한계가 존재한다. 이러한 공백을해소하기 위해, 본연구에서는 다중 이미지 객체 환각 벤치마크 (Miulti Image Object Hallucination Benchmark)를 제안한다. 제안하는 벤치마크는 여러 장의 이미지가 주어지는 환경에서의 객체 환각을 보다 세밀하게 분석할 수 있는 벤치마크로, 객체 존재, 개수, 속성, 위치관계의 네가지 핵심질문 유형을 대상으로 한다. 또한 여러 장의 이미지를 처리하기 위해 필요한 종합, 비교, 선택의 세 가지 추론 능력과, 환각을 유발할 수 있는 이미지의 개수 증가, 시각적 어려움, 맥락적인 편향 세 가지 요소들을 결합하여 다양한 관점에서 객체 환각을 체계적으로 평가한다. 30개의 최신 모델을 대상으로 한 광범위한 실험을통해, GPT-5와 Gemini-2.5-Pro와 같은 최신 모델들조차도 과제 유형과 추론 패턴에 따라 뚜렷하게 구분되는 실패 양상을 보임을 확인하였다. 실험 결과는 객체 환각이 단순한 시각적 인식의실패에 국한된 문제가 아니라, 다수의 이미지 전반에 걸쳐 객체 표현을 유지하고 통합하는 과정에서 발생하는 정보 융합 과정의 구조적 한계에서 기인함을 보여준다. 이 논문에서 제안하는 다중 이미지 객체 환각 벤치마크는, 다중 이미지 환경에서의 객체 환각을 정밀하게분석 할 수있는 통제된 실험 환경을 제공하며, 보다 신뢰할 수있는 멀티모달 인공지능 시스템 개발을위한 핵심적인 평가 도구로 활용될 수. 있을 것이다.