인포그래픽에 대한 시각 질의응답은 모델이 밀집된 텍스트를 읽고, 시각적 요소를 해석하며, 비선형적인 레이아웃 전반에 걸쳐 증거를 종합할 것을 요구한다. 기존 벤치마크는 주로 차트 중...
인포그래픽에 대한 시각 질의응답은 모델이 밀집된 텍스트를 읽고, 시각적 요소를 해석하며, 비선형적인 레이아웃 전반에 걸쳐 증거를 종합할 것을 요구한다. 기존 벤치마크는 주로 차트 중심 또는 통계 정보가 풍부한 인포그래픽에 초점을 맞추고 있어, 포스터형 구조를 가지며 일러스트레이션이 중심이 되는 팩트시트 형태의 인포그래픽은 상대적으로 충분히 다루어지지 않았다. 본 논문에서는 SQuADv2를 기반으로 구축한 합성 인포그래픽 질의응답 데이터셋인 SQuADv2-VQA를 제안한다. 이 데이터셋은 20,233개의 고해상도 인포그래픽과 199,279개의 질의응답 쌍으로 구성되며, 원천 말뭉치로부터 가져온 답변 가능 질문과 답변 불가능 질문뿐만 아니라, 학습을 위해 추가적으로 생성한 합성 질의응답 문항을 포함한다. 본 연구에서는 데이터 합성 프레임워크를 통해 데이터셋을 구축한다. 먼저 대규모 언어 모델이 원문 지문과 질의응답 주석에 기반하여 구조화된 인포그래픽 명세를 생성하고, 레이아웃 기반 생성기가 이에 대응하는 이미지를 렌더링한다. 이후 규칙 기반 공간 추론 엔진이 생성된 레이아웃 메타데이터를 활용하여 추가 질의응답 문항을 생성한다. 제안 데이터셋의 난이도와 유용성을 검증하기 위해, 최신 오픈소스 대규모 시각-언어 모델을 SQuADv2-VQA-test와 관련 텍스트 중심 시각 질의응답 데이터셋에서 평가하였다. 실험 결과, 제안한 데이터셋은 특히 복잡한 레이아웃, 긴 정답 구간, 그리고 답변 불가능 질문에서 높은 난이도를 보이는 것으로 나타났다. 또한 제안 데이터셋을 활용한 파인튜닝은 관련 벤치마크에서 유사한 수준의 성능을 유지하면서도 테스트 세트 성능을 향상시키는 것으로 확인되었다. 추가 분석 결과, 제안 데이터셋은 생성기 변화와 템플릿 편향 변화가 존재하는 상황에서도 강건성을 보이는 것으로 나타났다. 종합하면, 본 연구는 기존에 충분히 다루어지지 않았던 시각적 스타일의 인포그래픽으로 시각 질의응답 평가 범위를 확장하고, 밀집된 정보를 포함한 일러스트레이션 기반 팩트시트 인포그래픽에 대한 대규모 시각-언어 모델의 이해 능력을 향상시키기 위한 학습 자원을 제공한다.