
http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
한국어 학습 모델별 한국어 쓰기 답안지점수 구간 예측 성능 비교
조희련,임현열,이유미,차준우 한국정보처리학회 2022 정보처리학회 논문지(KTSDE) Vol.11 No.3
We investigate the performance of deep learning-based Korean language models on a task of predicting the score range of Korean essayswritten by foreign students. We construct a data set containing a total of 304 essays, which include essays discussing the criteria for choosinga job (‘job’), conditions of a happy life (‘happ’), relationship between money and happiness (‘econ’), and definition of success (‘succ’). Theseessays were labeled according to four letter grades (A, B, C, and D), and a total of eleven essay score range prediction experiments wereconducted (i.e., five for predicting the score range of ‘job’ essays, five for predicting the score range of ‘happiness’ essays, and one forpredicting the score range of mixed topic essays). Three deep learning-based Korean language models, KoBERT, KcBERT, and KR-BERT,were fine-tuned using various training data. Moreover, two traditional probabilistic machine learning classifiers, naive Bayes and logisticregression, were also evaluated. Experiment results show that deep learning-based Korean language models performed better than the twotraditional classifiers, with KR-BERT performing the best with 55.83% overall average prediction accuracy. A close second was KcBERT (55.77%)followed by KoBERT (54.91%). The performances of naïve Bayes and logistic regression classifiers were 52.52% and 50.28% respectively. Dueto the scarcity of training data and the imbalance in class distribution, the overall prediction performance was not high for all classifiers. Moreover, the classifiers’ vocabulary did not explicitly capture the error features that were helpful in correctly grading the Korean essay. By overcoming these two limitations, we expect the score range prediction performance to improve.
Naive Bayes 와 SVM 을 이용한 트위터 데이터의 긍정/부정 의견 자동분류 결과 분석
조희련 ( Heeryon Cho ),김성국 ( Songkuk Kim ) 한국정보처리학회 2012 한국정보처리학회 학술대회논문집 Vol.19 No.1
나꼼수 비키니 시위’에 대한 긍정적(지지), 부정적(비판) 의견을 담은 트위터 데이터를, 단어의 출현에 주목하여 Naïve Bayes (NB)와 Support Vector Machine (SVM)을 적용하여 자동분류 한 결과, NB가 75.98%로, 73.65%인 SVM 보다 약간 더 나은 성능을 보였다. 본 실험을 통해, 기계학습을 이용한 대중의견(opinion) 자동분류 시스템을 실용화할 때의 고려사항에 대해 살펴 본다.
다양한 차원 축소 기법을 적용한 문서 군집화 성능 비교
조희련 ( Heeryon Cho ) 한국정보처리학회 2018 한국정보처리학회 학술대회논문집 Vol.25 No.1
문서 군집화 성능을 높이기 위한 한 방법으로 차원 축소를 적용한 문서 벡터로 군집화를 실시하는 방법이 있다. 본 발표에서는 특이값 분해(SVD), 커 널 주성분 분석 (Kernel PCA), Doc2Vec 등의 차원 죽소 기법을, K-평균 군집화(K-means clustering), 계층적 병합 군집화(hierarchical agglomerative clustering), 스펙트럼 군집화(spectral clustering)에 적용하고, 그 성능을 비교해 본다.
KoBERT, 나이브 베이즈, 로지스틱 회귀의 한국어 쓰기 답안지 점수 구간 예측 성능 비교
조희련 ( Heeryon Cho ),임현열 ( Hyeonyeol Im ),차준우 ( Junwoo Cha ),이유미 ( Yumi Yi ) 한국정보처리학회 2021 한국정보처리학회 학술대회논문집 Vol.28 No.1
한국어 심층학습 언어모델인 KoBERT와, 확률적 기계학습 분류기인 나이브 베이즈와 로지스틱 회귀를 이용하여 유학생이 작성한 한국어 쓰기 답안지의 점수 구간을 예측하는 실험을 진행하였다. 네가지 주제(‘직업’, ‘행복’, ‘경제’, ‘성공’)를 다룬 답안지와 점수 레이블(A, B, C, D)로 쌍을 이룬 학습데이터 총 304건으로 다양한 자동분류 모델을 구축하여 7-겹 교차검증을 시행한 결과 KoBERT가 나이브 베이즈나 로지스틱 회귀보다 약간 우세한 성능을 보였다.
조희련 ( Heeryon Cho ),최상현 ( Sang-hyun Choi ) 한국정보처리학회 2015 한국정보처리학회 학술대회논문집 Vol.22 No.1
본 연구에서는 네이버 영화평을 학습데이터로 사용하여 영화평 감성분류에 필요한 감성사전을 자동으로 구축하는 방법에 대해 제안한다. 이 때 학습데이터의 분량과 긍정/부정 영화평의 비율을 달리하여 네 가지의 학습데이터를 마련하고, 각 경우에 대하여 감성사전과 나이브베이즈(이하, NB) 분류기를 구축한 후, 이 둘의 성능을 비교했다. 네 종류의 학습데이터로 구축한 감성사전과 NB 분류기를 이용하여 영화평 감성 자동분류 성능을 비교한 결과, 네 경우의 평균 균형정확도는 감성사전이 78.2%, NB 분류기가 66.1%였다.
3축 가속도 센서 기반 인간 행동 인식을 위한 기계학습 분석
이송미,조희련,윤상민,Lee, Song-Mi,Jo, Hui-Ryeon,Yun, Sang-Min 한국통신학회 2016 정보와 통신 Vol.33 No.10
최근 스마트폰의 이용 사례가 증가함에 따라, 스마트폰에 내장되어 있는 다양한 센서를 이용하여 인간의 행동을 인식하기 위한 연구가 많은 각광을 받고 있다. 본고에서는 인간의 기본적인 행동 중에 앉기, 걷기, 달리기 등의 행동 특성을 스마트폰에 내장되어 있는 3축 가속도 센서를 통하여 분석하고 인간의 기본적 행동을 자동으로 인식하기 위한 방법에 대하여 비교 분석하는 것을 목적으로 한다. 구체적으로는 스마트폰에 내장되어 있는 3차원 가속도 센서로부터 추출된 데이터를 시간축에서 샘플링하여 인간의 행동을 인식하기 위한 기댓값 최대화 알고리즘, 랜덤 포레스트, 딥러닝 기반의 기계학습 방법을 비교하여 각 기계학습 알고리즘의 장단점을 분석한다.
객체의 위치와 윤곽선 정보를 활용한 딥러닝 기반 영역 세분화 방법론에 관한 연구 : 건물 외벽 이미지를 중심으로
박희성(Heesung Park),김덕우(Deuk-Woo Kim),김우주(Wooju Kim) 한국IT서비스학회 2021 한국IT서비스학회 학술대회 논문집 Vol.2021 No.-
본 연구는 이미지 분석 딥러닝 기법을 이용하여, 건물 외피 이미지에 존재하는 객체의 영역을세분화(Segmentation)하는 방법론에 대해 제안하고자 한다. 기존의 영역 세분화 방법론은 이미지에 존재하는 객체의 위치와 윤곽선에 대한 정보를 직접 활용하지 않는 단점이 있다. 하지만, 건물의 경우 윤곽선 명확하게 구분되고 연결된다는 특징을 가진다. 따라서 본 연구에서는 건물 외피이미지를 효과적으로 분석하기 위해, 객체 위치 정보를 기반으로 프로세스를 세분화하고, 윤곽선정보를 효과적으로 반영할 수 있는 방법론을 제안한다.