본고는 영어 및 한국어의 딥러닝 모델을 활용하여 언어 연구를 하는 방법론에 대해서 소개한다. 딥러닝 언어모델은 언어 표현의 연쇄가 가지는 확률적 자연스러움을 학습하므로, 그 자연스...

http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.
변환된 중국어를 복사하여 사용하시면 됩니다.
https://www.riss.kr/link?id=A108432990
송상헌 (고려대학교)
2022
Korean
딥러닝 ; 언어모델 ; surprisal ; 트랜스포머 ; 수용성 ; deep learning ; language model ; surprisal ; transformer ; acceptability
KCI등재
학술저널
9-39(31쪽)
0
상세조회0
다운로드본고는 영어 및 한국어의 딥러닝 모델을 활용하여 언어 연구를 하는 방법론에 대해서 소개한다. 딥러닝 언어모델은 언어 표현의 연쇄가 가지는 확률적 자연스러움을 학습하므로, 그 자연스...
본고는 영어 및 한국어의 딥러닝 모델을 활용하여 언어 연구를 하는 방법론에 대해서 소개한다. 딥러닝 언어모델은 언어 표현의 연쇄가 가지는 확률적 자연스러움을 학습하므로, 그 자연스러움에 반하는 이상 분포에 대해서는 민감하게 반응한다. 이러한 이상치를 계산하는 심리언어학적 방식이 surprisal이다. 이 산술식을 이용한 언어 연구는 사실상 언어의 전 층위에 적용 가능하다. 형태론, 통사론, 의미론 등의 문장 단위 구성은 물론이며 담화 및 정보구조 등의 연구에도 사용할 수 있다. 나아가 언어 데이터에 함축되어 있는 인간의 세계 지식 및 상식 판단에 대해서도 준용할 수 있다. 본고는 surprisal 기반 실험을 실시할 때 주요한 고려 사항에 대해서도 개괄한다. 물론, 딥러닝 기반 방법이 자연언어에 대한 모든 것에 해법을 줄 수 있는 만능열쇠는 아니다. 그러나 인간 언어를 분석하기 위한 새로운 도구로서 실효성을 가진다는 점에서 앞으로 그 활용 여지가 크다. 관심있는 연구자의 편의를 위해 라이브러리를 함께 공개한다.
참고문헌 (Reference)
1 강다은 ; 송상헌, "코퍼스–실험–딥러닝 연구방법론 비교분석: ‘-도록’ 통제 구문을 중심으로" 한국중원언어학회 (62) : 133-161, 2022
2 박권식 ; 김성태 ; 송상헌, "최소대립 문장쌍을 활용한 한국어 사전학습모델의 통사 연구 활용 가능성 검증" 한국언어정보학회 25 (25): 1-21, 2021
3 송상헌 ; 노강산 ; 박권식 ; 신운섭 ; 황동식, "적대적 사례에 기반한 언어 모형의 한국어 격 교체 이해 능력 평가" 대한언어학회 30 (30): 45-72, 2022
4 송상헌, "딥러닝 언어모형의 평가와 언어학" 언어정보연구소 45 : 169-191, 2022
5 송상헌 ; 이규민 ; 김경민, "딥러닝 언어모형을 활용한 영어 비결속 재귀사 검증" 한국언어과학회 28 (28): 51-78, 2021
6 Yu, Charles, "Word frequency does not predict grammatical knowledge in language models"
7 황동진 ; 송상헌, "What Can BERT Do for English Linguistics?: A Case Study of Examining It-cleft Constructions" 한국영어학학회 28 (28): 135-165, 2022
8 Rissman, Lilia, "Using instruments to understand argument structure: Evidence for gradient representation" 142 : 266-290, 2015
9 DeKeyser, Robert M., "The robustness of critical period effects in second language acquisition" 22 (22): 499-533, 2000
10 Kim, Mi-ryung, "The Studies of Verbal Classes According to Case Mark-Alternation" 25 : 161-190, 2004
1 강다은 ; 송상헌, "코퍼스–실험–딥러닝 연구방법론 비교분석: ‘-도록’ 통제 구문을 중심으로" 한국중원언어학회 (62) : 133-161, 2022
2 박권식 ; 김성태 ; 송상헌, "최소대립 문장쌍을 활용한 한국어 사전학습모델의 통사 연구 활용 가능성 검증" 한국언어정보학회 25 (25): 1-21, 2021
3 송상헌 ; 노강산 ; 박권식 ; 신운섭 ; 황동식, "적대적 사례에 기반한 언어 모형의 한국어 격 교체 이해 능력 평가" 대한언어학회 30 (30): 45-72, 2022
4 송상헌, "딥러닝 언어모형의 평가와 언어학" 언어정보연구소 45 : 169-191, 2022
5 송상헌 ; 이규민 ; 김경민, "딥러닝 언어모형을 활용한 영어 비결속 재귀사 검증" 한국언어과학회 28 (28): 51-78, 2021
6 Yu, Charles, "Word frequency does not predict grammatical knowledge in language models"
7 황동진 ; 송상헌, "What Can BERT Do for English Linguistics?: A Case Study of Examining It-cleft Constructions" 한국영어학학회 28 (28): 135-165, 2022
8 Rissman, Lilia, "Using instruments to understand argument structure: Evidence for gradient representation" 142 : 266-290, 2015
9 DeKeyser, Robert M., "The robustness of critical period effects in second language acquisition" 22 (22): 499-533, 2000
10 Kim, Mi-ryung, "The Studies of Verbal Classes According to Case Mark-Alternation" 25 : 161-190, 2004
11 Zellers, Rowan, "SWAG: A large-scale adversarial dataset for grounded commonsense inference"
12 Meister, Clara, "Revisiting the uniform information density hypothesis"
13 이주원 ; 송상헌, "Revisiting the persuade-constructions in Korean with empirical evidence" 언어정보연구소 37 (37): 29-70, 2020
14 Warstadt, Alex, "Neural network acceptability judgments" 7 : 625-641, 2019
15 Hochreiter, Sepp, "Long short-term memory" 9 (9): 1735-1780, 1997
16 Rumelhart, David E., "Learning representations by back-propagating errors" 323 (323): 533-536, 1986
17 Radford, Alec, "Language Models are Unsupervised Multitask Learners" 1 (1): 9-, 2019
18 Lee, Sangah, "KR-BERT: A small-scale korean-specific language model"
19 신운섭 ; 박명관 ; 송상헌, "Is c-command Machine-learnable?" 대한언어학회 29 (29): 183-204, 2021
20 Shin, Unsub, "Investigating neural network’s sensitivity to negative polarity items" Korea University 2022
21 Hwang, Dongjin, "How the Deep Learning Models Understand Information Structure in Korean: Focusing on ‘-(n)un’ in Relative Clauses" 2022
22 Yi, Eunkyung, "Grammar modulates discourse expectations: evidence from causal relations in English and Korean" 13 (13): 99-127, 2021
23 Levy, Roger, "Expectation-based syntactic comprehension" 106 (106): 1126-1177, 2008
24 Hwang, Dongjin, "Evaluating the World Knowledge of Language Models: English Backshift Phenomenon" 2022
25 이규민 ; 김성태 ; 김현수 ; 박권식 ; 신운섭 ; 왕규현 ; 박명관 ; 송상헌, "DeepKLM - 통사 실험을 위한 전산 언어모델 라이브러리 -" 언어정보연구원 52 : 265-306, 2021
26 Kwonsik Park ; 박명관 ; 송상헌, "Deep learning can contrast the minimal pairs of syntactic data" 언어정보연구소 38 (38): 395-424, 2021
27 McEnery, Tony, "Corpus Linguistics: Method, Theory and Practice" Cambridge University Press 2011
28 Huang, Lifu, "COSMOS QA: Machine reading comprehension with contextual commonsense reasoning"
29 Devlin, Jacob, "BERT: Pre-training of deep bidirectional transformers for language understanding"
30 신운섭 ; 송상헌, "BERT Learns More than Word Frequency Information: A Case Study of Do-Be Constructions" 한국언어학회 47 (47): 467-489, 2022
31 이은경 ; 조효원 ; 송상헌, "An Experimental Investigation of Discourse Expectations in Neural Language Models" 한국영어학회 22 : 1101-1115, 2022
32 Bhagavatula, Chandra, "Abductive commonsense reasoning"
33 Hale, John, "A probabilistic Earley parser as a psycholinguistic model" 2 : 159-166, 2001
34 Sprouse, Jon, "A comparison of informal and formal acceptability judgments using a random sample from Linguistic Inquiry 2001–2010" 134 : 219-248, 2013
35 박권식 ; 송상헌, "A Deep Learning-based Understanding of Nativelikeness: A Linguistic Perspective" 한국영어학회 21 : 487-509, 2021
한국 대중 서사 기반 감정 데이터 구축과 활용 - 감정 딥러닝 모델 구현을 통한 문학 연구의 활용 가능성 탐색을 중심으로
지식 생산과 소비의 새 플랫폼으로서의 유튜브의 윤리적 문제에 대한 연구
구성주의적 정보 철학의 관점에서 본 근대와 그 이후의 주체 개념