본 논문은 군용 객체 이미지에 대한 제로샷 객체 탐지 성능을 향상시키기 위한 기법을 제안한다. 전통적 Open-Vocabulary Detection(OVD) 모델과 Vision-Language Model(VLM)을 비교하고 특히 프롬프트 튜닝...

http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
https://www.riss.kr/link?id=A109819916
2025
Korean
567
학술저널
84-87(4쪽)
0
상세조회0
다운로드본 논문은 군용 객체 이미지에 대한 제로샷 객체 탐지 성능을 향상시키기 위한 기법을 제안한다. 전통적 Open-Vocabulary Detection(OVD) 모델과 Vision-Language Model(VLM)을 비교하고 특히 프롬프트 튜닝...
본 논문은 군용 객체 이미지에 대한 제로샷 객체 탐지 성능을 향상시키기 위한 기법을 제안한다. 전통적 Open-Vocabulary Detection(OVD) 모델과 Vision-Language Model(VLM)을 비교하고 특히 프롬프트 튜닝이 탐지 성능에 미치는 영향을 실험적으로 분석하였다. Roboflow Russian-military 데이터셋을 COCO 형식 GT로 재구성하여 평가한 결과 Grounding DINO가 OVD 계열 모델 중 mAP 30.4%로 가장 우수한 성능을 보였으며, VLM 계열 모델인 Qwen2.5-VL-7B에 3단계 프롬프트 튜닝을 적용한 조건에서 Soft는 mAP 33.3%, Medium은 mAP 42.7%, Hard는 mAP 46.8%로 단계적으로 성능이 향상하는 경향을 나타냈다. 이러한 결과는 VLM 기반 제로샷 탐지에서 프롬프트의 구체성과 엄격성이 검출 정확도에 결정적 요소임을 실증하며 군용 객체와 같은 특수 도메인에의 적용 가능성과 확장성을 제시한다.
목차 (Table of Contents)
Directional Planar 를 활용한 DIMD 에서의 비방향성 예측 모드 결정 방법
비국지적 정보를 활용한 OBIC 후보 리스트 구성 방법
3D 가우시안 스플랫 코딩을 위한 회전 정보 변환 기술
가우시안 속성을 포함한 점 구름 색상 데이터의 벡터 양자화 기반 압축 방법