사람이 사용하는 언어를 글로 표현한 텍스트 데이터는 시간이 지남에 따라 그 양이 방대해지고 있다. 이를 분석하여 의미 있는 지식을 추론하는 활동인 텍스트 마이닝 기법은 텍스트 데이터...

http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
https://www.riss.kr/link?id=T17374383
논산 : 국방대학교 국방대학교 국방관리대학원, 2026
학위논문(석사) -- 국방대학교 국방대학교 국방관리대학원 , 컴퓨터공학 컴퓨터공학 , 2026. 2
2026
한국어
충청남도
50 ; 26 cm
지도교수: 강동수
I804:11070-200000942181
0
상세조회0
다운로드사람이 사용하는 언어를 글로 표현한 텍스트 데이터는 시간이 지남에 따라 그 양이 방대해지고 있다. 이를 분석하여 의미 있는 지식을 추론하는 활동인 텍스트 마이닝 기법은 텍스트 데이터...
사람이 사용하는 언어를 글로 표현한 텍스트 데이터는 시간이 지남에 따라 그 양이 방대해지고 있다. 이를 분석하여 의미 있는 지식을 추론하는 활동인 텍스트 마이닝 기법은 텍스트 데이터 분석을 위한 필수적인 요소이다. 다양한 텍스트 데이터 중 뉴스 데이터는 시의성을 지니며 시간이 지남에 따라 지속 축적되어 시계열 특성을 지니는 중요한 데이터이다.
한편, 북한은 한반도 안보의 큰 위협이 되는 세력으로 지속적인 연구를 통한 대책이 필요하다. 현재 북한의 김정은 집권 시기는 핵·미사일 능력 고도화에 국가의 역량을 집중한 시기로 4차례의 핵실험을 단행하고 ICBM, SLBM 등의 전략 미사일 시험 발사가 급증한 시기이다.
본 연구는 이러한 부분에 착안하여 김정은 집권 시기에 한국 언론에서 보도한 북한 핵·미사일 관련 뉴스 데이터를 분석한다. 분석 방법은 뉴스 데이터를 수집하여 이를 정량적으로 분석하고 이어 LDA와 BERTopic이라는 토픽모델링 기법을 활용하여 다량의 뉴스 데이터에 내재한 주제를 추론한다. 또한 토픽의 연도별 추세 변화를 분석하고 검증한다.
본 연구를 통해 토픽모델링 기법을 통해 뉴스 데이터를 분석하여 그 추세를 분석하는 것이 실제적 사건과 높은 상관성을 보이는 것을 확인하였고 향후 북한 관련 활동을 분석하는 기반을 마련하고 국방 분야에 활용 가능함을 확인하였다. 또한 확률 기반의 LDA 보다 트랜스포머 기반 언어모델을 활용한 BERTopic이 다각적 해석이 필요한 국방 분야 활용에 적합함을 확인하였다.
목차 (Table of Contents)