본 연구의 전체 과정은 다음의 세 단계로 요약된다. (Phase1) 이슈 소비자 관점의 이슈 클러스터링: Phase1은 Phase3의 토픽 분석 결과를 활용하여 소비자 관점의 이슈 클러스터링을 수행한다. 인...

http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
https://www.riss.kr/link?id=G3661294
2014년
Korean
한국연구재단(NRF)
0
상세조회0
다운로드본 연구의 전체 과정은 다음의 세 단계로 요약된다. (Phase1) 이슈 소비자 관점의 이슈 클러스터링: Phase1은 Phase3의 토픽 분석 결과를 활용하여 소비자 관점의 이슈 클러스터링을 수행한다. 인...
본 연구의 전체 과정은 다음의 세 단계로 요약된다.
(Phase1) 이슈 소비자 관점의 이슈 클러스터링: Phase1은 Phase3의 토픽 분석 결과를 활용하여 소비자 관점의 이슈 클러스터링을 수행한다. 인터넷 뉴스 사이트의 방문 기록을 분석하여 사용자와 기사간의 네트워크를 구성하고, 이 결과는 Phase3의 중간 산출물인 기사와 이슈간의 네트워크와 병합되어 방문자와 이슈간의 네트워크를 구성하게 된다. 마지막으로 사용자 노드에 대한 구조적 등위성 관점에서 이슈 노드에 대한 클러스터링이 수행된다.
(Phase2) R&D 관점의 이슈 클러스터링: Phase2의 목표는 R&D 관점의 이슈 클러스터링을 수행하는 것으로, 우선 특허 정보 또는 연구보고서 등의 R&D 문서로부터 R&D 용어집을 구축함으로써 시작된다. 이후 R&D 용어집에 수록된 어휘들이 Phase3의 뉴스 기사에 출현하는 빈도에 따라 기사와 R&D간 네트워크가 구축된다. 기사와 R&D간 네트워크, 그리고 Phase3의 이슈와 기사간 네트워크를 병합하여 이슈와 R&D간 네트워크를 도출하며, 마지막으로 R&D 노드에 대한 구조적 등위성 관점에서 이슈 노드에 대한 클러스터링이 수행된다.
(Phase3) 전통적 관점의 이슈 클러스터링을 포함한 다계층 프레임워크 설계: Phase3은 본 연구에서 제안하는 다계층 프레임워크의 설계를 담당한다. 우선 Phase1의 인터넷 뉴스 사이트 방문 기록을 토대로 크롤링을 수행하여 분석 대상 뉴스 기사를 수집한다. 수집된 뉴스 기사를 대상으로 토픽 분석을 수행하여 주요 이슈를 추출하고, 각 뉴스와 이슈간의 다대다 관계를 그래프로 도식화하여 뉴스 기사와 이슈간 네트워크를 도출한다. Clustering 단계에서는 기사에 대한 구조적 등위성 관점에서 이슈 노드를 클러스터링하여 동시출현 기반의 전통적인 이슈 클러스터링을 수행한다. 각 관점에 따른 세 가지 이슈 클러스터링의 결과는 매우 상이할 것으로 예상되며, Phase3의 마지막 단계인 Issue Cluster Comparison은 이러한 결과의 차이를 정량적으로 비교한다.
본 연구과제의 성공적 수행을 위해서는 실험 데이터 확보를 위한 구체적 방안이 마련되어야 하며, 수행 가능한 실험 설계가 반드시 이루어져야 한다. 실험 과정에서 발생할 수 있는 시행착오를 최소화하고 연구 방법론을 구체화하기 위해, 현재 확보하고 있는 데이터의 일부에 대한 파일럿 실험을 수행하였다. 파일럿 테스트는 국내 인터넷 사이트 순위 분석 전문 업체인 R사 패널 5,000명이 1년간 방문한 'H' 신문사의 기사 37,089건에 대해 수행하였다. 파일럿 테스트를 통해 본 실험에서는 한글 전용의 형태소 분석기를 사용하여 불용어 사전을 구축하는 등 보다 높은 수준의 데이터 전처리가 필요함을 인식하게 되었다. 또한 전체 기사에 대한 토픽 분석과 병행하여 "IT/과학", "생활/문화" 등 특정 분야의 기사만을 대상으로 토픽 분석을 수행하여 그 결과를 비교할 필요성을 인식하게 되었다.
본 연구의 실험을 위해 필요한 데이터는 i) Web Transaction, ii) News Articles, 그리고 iii) R&D Lexicon으로 요약될 수 있다. Web Transaction의 경우 국내 한 인터넷 사이트 순위 분석 전문 업체인 R사로부터 패널 5,000명의 1년 동안의 웹 사용 기록을 제공받았으며, 제공받은 데이터의 구체적 항목은 (1) 패널 5,000명의 인구통계학 정보 21개, (2) 접속 사이트 85,783개의 분류 정보 3개, (3) 해당 패널의 해당 기간 웹 사용 기록 143,293,592건에 대한 상세 항목 18개로 요약된다. 다음으로 News Articles의 경우 웹 사용 기록 중 국내 최대 인터넷 뉴스 포털 사이트인 'N' 사의 접속 기록만을 추출하고, 해당 URL의 기사에 대한 크롤링을 수행하여 기사 394,303건을 데이터베이스화 하였다. 마지막으로 R&D Lexicon의 경우 NTIS에 등록된 2010년부터 2012년 사이의 연구보고서 총 8,501건에 명시된 키워드 15,873개를 목록화하여 구축하였다.