
http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
온라인 포털 댓글 감성분석을 통한 선거결과 예측 : 제 7회 서울시장선거를 중심으로
김기현 고려대학교 정책대학원 2020 국내석사
지난 제 7회 서울시장 선거에서 안철수 후보는 구글 트렌드 검색량은 1위였으나, 실제 투표결과는 3위였다. 본 연구는 그럼에도 불구하고 온라인 데이터를 취합하고 분석하는 방법에 의해 선거결과를 예측할 수 있음을 확인하고자 하였다. 이를 위해 제7회 서울시장 후보 관련하여 Naver와 Daum 정치뉴스에 작성된 댓글들을 웹크롤러로 수집하였다. 형태소분석을 통해 도출된 단어들을 대상으로 word2vec을 적용하여 후보자 관련 주제어 및 감성어휘를 추출하여 감성어 사전을 보완하였다. 또한 극성(polarity) 기반 감성분석을 실시한 결과를 후보자들의 총 버즈량내에서 점유율로 정규화하였다. 이를 여론조사 결과에 적합(fitting)하여 투표율 예측 모델링을 실시했다. 연구 결과 Daum 댓글에서의 긍정언급량, 부정 대비 긍정 비율이 높을수록 후보자의 득표율이 높아지고, 단순히 언급량이 많을 경우 오히려 득표율이 낮아지는 것으로 나타났다. 그리고 모델링을 통해 선거결과를 예측한 결과, 6%p 오차내에서 후보자들의 득표율을 예측하였으며, 후보자간 순위를 정확하게 맞추었다. 따라서 본 연구를 통해 포털 댓글로 대표되는 온라인데이터를 여론조사와 결합할 경우 선거결과를 예측할 수 있음을 발견했다. 향후 감성분석기법의 고도화 및 분석사례를 확대하여 온라인 데이터 분석결과의 일반화 검토를 후속연구로 제언한다. In the 7th Seoul mayoral election, candidate Ahn was ranked first in Google Trends, but actually voted third. Nevertheless, this study tried to confirm that the election results can be predicted by collecting and analyzing the online portal comments. To this end, using web crawlers to collect the comments made on Naver and Daum political news regarding the 7th mayor of Seoul. By applying word2vec to the words derived of morphological analysis, I extracted words regarding the candidates and emotional vocabulary to complement the emotional dictionary. In addition, the results of polarity-based emotional analysis were normalized to the ratio within the total buzz of the candidates. Fitting this to the poll results, the model predicted the percentage of votes. As a result, the higher the number of positive comments and the positive ratio against the negative in Daum comments, the higher the percentage of vote of the candidate. And predicting the election by the model, the candidates' percentage of vote was predicted within 6% p error, and the ranking among candidates was accurately matched. Therefore, this study found that the election results can be predicted by combining online data represented by portal comments with polls. In the future, I will try the generalization of the method of online data analysis for predicting election by increasing the cases.
본연구는 확률 추정량의 안정성을 측정하는 목적으로 사용되는 Probability Coefficient of Variation(CV) 통계량의 특징을 살펴봄으로써 극단값에서 발생하는 p-CV의 특징을 살펴보았다. 표본설계 과정에 의해 계산되는 CV가 극단값에서 어떠한 현상을 나타내는지 살펴볼 필요 있는 미국건강영양조사 NHANES의 사례 중심의 연구를 진행하였다. 또한, 서베이 통계학에서 극단값 이슈 개선 사례들을 살펴보고 모의실험을 진행하였다. 제2장에서는 조사방법론 측면에서 snowballl sampling을 이용하여 극단값에서 발생할 수 있는 데이터 수집과정의 문제 해결 방안을 제시하였다. 제3장에서는 이항 값의 신뢰구간 추정 시 대표적으로 사용되는 wald 신뢰구간이 극단값에서 포함확률이 작아지는 단점을 해결하는 Agresti 신뢰구간 방안을 제시하였다. 그리고 본 연구의 취지인 CV 기준으로 안정적 설계 및 추정을 위해 근거를 제시할 모의실험을 진행하였다. 제4장의 모의실험을 통해 sample size를 키워가면서 구현되는 Coefficient of Variation sampling distribution의 특징을 살펴보았다. 특히 CV’s Coefficient of Variation을 통해 추정량의 안정성을 살펴봄으로써 이를 이용하여 안정적인 Data size 구축에 대한 가이드라인을 제시하였다. p-CV의 CV가 15%보다 작아야 한다는 기준을 이용하여 확률별로 안정적인 값을 도출할 수 있는 sample size를 제시하였다. 이는 데이터 분석 과정에서 이슈화 될 수 있는 imbalance data에 대하여 사용 가능하다. 신용사기 적발, 제품 불량률과 같이 추정 확률이 낮은 모수에 대하여 CV 관점으로 안정성을 확인하고 적절한 sample size를 제시함으로써 활용 할 수 있을 것이다.
전수층을 포함한 표본설계에서의 층화 방안 연구 : 사업체 조사의 경우
왜도가 큰 모집단을 대상으로 하는 사업체조사에서는 모집단에 대한 추정의 효율을 높이기 위해 일정 규모 이상의 사업체는 전수층으로, 일정 규모 미만의 사업체는 표본층으로 설정하는 층화추출법(Stratified Sampling)이 사용된다. 이에 따라 전수층과 표본층의 경계점을 결정하는 문제는 모집단의 추정의 정도(precision)에 직접적 영향을 미치는 중요한 논의점이 될 것이다. 본 논문은 전수층과 표본층의 최적 경계점을 결정하기 위한 새로운 방법을 제안한다. 기존 연구에 따라 이론적인 경계점을 검토하고 현재 사업체 조사의 기준과 제시한 Scree Plot 방안에 대한 추정의 효율을 비교하였다. 이를 통해 비교적 편리 하고 직관적인 방법으로 전수∙표본층의 층화 경계점을 결정하는 방안을 제시하고자 한다.
정성일 고려대학교 정책대학원 2022 국내석사
본 논문에서는 2022년 3월 실시된 20대 대통령선거 전화여론조사를 대상으로 표집틀, 조사방법, 응답률 등에 따른 예측 정확성에 대한 분석을 실시하였다. 여론조사 예측정확성을 나타내는 척도로는 Martin et al.(2005)이 제안한 척도 A를 사용하였으며, 선거여론조사심의위원회에 등록된 여론조사 중 여론조사 공표금지기간 전 10일간 진행된 조사 52건을 대상으로 하였다. 분석 결과, 52개 조사 중 이재명 후보쪽으로 편향된 조사는 13.5%, 윤석열 후보 쪽으로 편향된 조사는 86.5%로 나타나 다수 조사가 윤석열 후보의 지지율을 실제 투표결과보다 높게 예측한 것으로 나타났다. 또한 편향성이 커서 신뢰구간을 벗어나는 조사는 전체의 17.3%였고, 2개의 조사는 이상치인 것으로 나타났다. 표집틀별 분석 결과에서 휴대전화 가상번호 조사와 RDD조사는 예측정확성에서 통계적으로 유의미한 차이가 있는 것으로 나타나지 않았다. 또한 조사방법별 예측정확성에서 전화면접조사와 ARS조사로 나누어 분석한 결과에서도 두 조사의 예측정확성은 통계적으로 유의미한 차이가 나타나지 않았다. 응답률에 따른 예측정확성에서는 ARS조사에서는 응답률과 예측정확성 사이에는 응답률이 높아질수록 편향성이 줄어드는 선형관계가 존재하였고, 전화면접조사에서는 응답률과 예측정확성 사이에 유의미한 상관관계가 나타나지 않았다. 아울러 응답유보층 비율에 따른 주요 후보의 지지율 변화를 살펴본 결과, ARS조사에서는 이재명•윤석열 후보 모두 응답유보층 비율이 줄어들수록 지지율이 높아지는 선형관계가 존재하였는데, 이러한 경향은 이재명 후보가 더 강하게 나타났다. 전화면접조사에서는 이재명 후보는 응답유보층 비율이 줄어들수록 지지율이 높아지는 선형관계가 나타났지만, 윤석열 후보 지지율과 응답유보층 사이에는 상관관계가 나타나지 않았다. 위와 같은 분석결과는 여론조사 공표 금지기간의 존재로 인해 조사시점의 차이로 인한 편향이 존재할 수밖에 없는 한계점을 가지고 있으며, 20대 대통령선거 여론조사에 국한된 사례연구이므로 일반화에는 주의가 필요하다.
로지스틱 회귀분석을 통한 대학 운영 영향 요인 분석 : 대학 평가의 정량지표 등을 중심으로
윤다은 고려대학교 정책대학원 2022 국내석사
대학의 위기, 대학 존립에 대한 이슈가 지속되고 있다. 대학은 학령인구따른 신입생 유치의 어려움, 십년 이상 지속된 등록금 동결 등에 따른 재정 문제 등 다양한 문제에 직면한 상황이다. 여기에 저출산에 의한 학령인구 감소 추세로 ‘24년 입학 자원의 급감이 예상되고 있어 대학의 대내외적 개편이 필요한 것이 사실이다. 이제 교육 당국은 대학의 구조개혁을 목표로 꾸준히 정책을 추진하고 있다. 각 정권에 따라 대학 평가의 목표나 지향점이 약간 상이하였으나, 대체로 대학의 규모 조정, 대학 자율적 노력에 따른 안정적 구조 정비 등을 목표로 정책이 추진되었고, 그 수단으로 일반재정지원사업, 국가장학금, 학자금 대출 사업 등 각종 재정적 지원에 대한 차별 지급 등을 활용한 바 있다. 본 연구에서는 1주기 대학구조개혁평가, 2018년 및 2021년 대학기본역량진단 결과와 해당 평가에서 사용된 정량지표를 중심으로 대학의 운영 영향 요인에 대한 분석을 진행하였다. 3개 평가에 대한 각각의 이항 및 다항 로지스틱 분석을 통한 영향 요인을 확인한 결과, 재학생 충원율과 유지취업률이 꾸준히 영향 요인으로 작용한 것을 확인할 수 있었다. 다만, 실제 평가가 정량지표로만 진행되지 않았던 점, 각 정량지표별 점수 기준 및 산출 방식이 상이했던 점을 고려할 때, 향후 연구에서는 세부적인 군집분석 및 이에 따른 영향 요인을 분석해볼 필요가 있다.
조사 방법의 변화가 가계동향 조사 결과에 미친 영향 분석
본 연구는 소득, 지출 및 가계수지 등과 관련된 각종 지표생성 및 정책 입안의 기초 자료로 오랫동안 이용되어 왔던 「가계동향조사」를 분석 대상으로 하여 조사방법의 변화가 가계동향조사 대분류 항목별 지출에 미친 효과를 분석하였다. 개입 분석을 통해 가계동향 조사 개편의 효과를 분석하였고 크게 세 부분으로 나누어 진행하였다. 먼저 개입 시계열 회귀 분석(ISTA)을 통해 조사 개편의 영향을 분석하였고, 시계열 자료에 영향을 미칠 가능성이 있는 사건을 고려할 수 있는 개입 시계열(ARIMA-interrupted) 분석을 하였다. 또한 모형별 적합 통계량을 비교함으로써 최종 모형을 결정하였다. 우선 개입 시계열 회귀 분석을 통하여 가계동향 지출 대분류 항목별 지출에 대한 조사 개편의 효과를 분석한 결과, 대부분 항목은 예측 결과가 매우 불안정하였다. 이는 표본 개편 및 조사 병법의 급격한 변화로 인하여 지출과는 다르게 나타났기 때문으로 판단된다. 개입 시계열 분석 결과 조사 개편 이후 한가지 항목을 제외한 모든 항목에서 조사 개편이 지출 값에 영향을 준 것으로 나타났는데, 이는 회상에 따른 조사방법과 개입 효과의 연관성을 보여주는 결과이다.
본 저자는 리서치회사의 사회조사 분야에 근무하며, 여러 패널조사에 대해서 접해보았다. 그중에서 기업에 대한 패널조사의 경우 아직 우리나라에서 활성화 되지 않았으며, 가구 및 개인 패널조사에 비해서 연구가 덜 활성화 되어 있는 것으로 느껴졌다. 이에 기업에 대한 패널조사를 수행하는 입장에서 대체패널의 효율성에 대해서 직접 연구하여 효율적인 패널 대체방법의 탐색을 본 논문을 통해서 분석해 보려 한다. 최근 정부 및 공공기관의 패널조사 연구는 과거에 비해서 큰 증가세를 보이고 있으며, 이를 통해서 좀 더 과학적이고 체계적으로 시간에 따른 정책 및 제도의 효과를 파악이 가능해졌다. 하지만 초기 설계가 중요한 패널조사에서 체계적으로 준비되지 않은 조사 및 상황에 맞지 않는 조사 등으로 인해서 패널조사 데이터의 신뢰성이 떨어지며, 패널의 유지 및 대체 패널에 대해서도 정확한 인식의 부족으로 인하여 시행착오가 큰 것이 사실이다. 본 논문에서는 기존에 시행중인 기업패널 데이터를 분석하여 기존의 대체패널 데이터 및 탈락패널의 추정데이터 간의 비교를 통해 패널의 대체가 타당성 있게 이루어졌는지를 비교하고, 새로운 대체방법의 제시 및 이를 이용한 기존 대체패널데이터의 절삭을 통해서 새로운 대체방법의 효율성을 확인해 보았다. 이를 위해서 탈락패널 데이터와 대체패널의 데이터간의 비교를 위해서 회귀분석 및 다항 로지스틱 회귀분석을 적용하여 추정데이터를 생성하였으며, 그룹간 비교를 위해서 분산분석 및 교차분석을 통해 그룹간 비교검정을 수행하였다. 또한 최종적으로 기존대체패널 데이터에 새로운 대체방법을 적용하여 해당되지 않는 데이터를 절삭 후 원패널 데이터 그룹 및 기존 대체패널 데이터가 포함된 그룹, 절삭된 데이터 그룹간의 비교를 통해서 새로운 대체방법이 효율성이 있는지를 확인하였다.
유혜영 고려대학교 정책대학원 2011 국내석사
통계에 대한 관심이 높아지면서 보다 좁은 영역이나 세분화된 단위의 통계에 대한 통계이용자들의 요구가 많아져 통계의 정확도와 조사비용은 유지하면서 정도 높은 소지역 통계수치를 얻기 위한 노력으로 소지역 추정에 관한 많은 연구가 이어져오고 있다. 서비스업조사는 지역별·산업별 매출총액에 대한 통계를 매년 작성하고 있는데, 소지역 추정방법으로 추출가중치를 적용한 직접추정량을 이용하고 있다. 직접추정량은 표본크기가 작을수록 분산이 커져 신뢰도가 낮게 나타나는 추정법으로 서비스업조사의 산업분류별 표본이 크지 않은 것을 감안할 때 추정치의 정확도가 낮아지는 것이 우려되고 있다. 본 논문에서는 서비스업조사의 산업분류별 추정량의 정확도를 높일 수 있는 다른 소지역 추정모형을 적용해보았다. 자료기반추정법인 직접추정법 외에 모형기반추정법인 회귀추정법, 그리고 직접추정법과 회귀추정법을선형결합한 복합추정법을 적용하여 각 산업분류별 매출총액에 대한 추정량을 구하고 각 추정량을 MSE를 통해 비교하였다. 회귀추정량을 구하기 위한 모형의 설명변수는 서비스업조사항목 내에서 매출액에 대한 설명력이 가장 높을 것으로 기대되는 종사자수 변수를 이용하였다. 산업분류별 자료의 수가 1개 이상인 크기 1000개의 표본을 뽑는 과정을 10000번 반복하여 직접추정량, 설명변수를 종사자수로 하는 회귀추정량, 직접추정량과 회귀추정량을 선형결합한 복합추정량을 구하고, 각 추정량의 전체평균, 분산, 그리고 원자료를 모수로 가정하여 편향(bias)을 구한 후, 이들을 이용하여 비교통계량 MSE를 도출하였다. 그리고 분산, 편향(bias), MSE를 통해 이들 추정량을 비교하였다.