RISS 학술연구정보서비스

검색
다국어 입력

http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

변환된 중국어를 복사하여 사용하시면 됩니다.

예시)
  • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
  • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
닫기
    인기검색어 순위 펼치기

    RISS 인기검색어

      검색결과 좁혀 보기

      선택해제
      • 좁혀본 항목 보기순서

        • 원문유무
        • 원문제공처
        • 등재정보
        • 학술지명
          펼치기
        • 주제분류
        • 발행연도
          펼치기
        • 작성언어
        • 저자
          펼치기

      오늘 본 자료

      • 오늘 본 자료가 없습니다.
      더보기
      • 무료
      • 기관 내 무료
      • 유료
      • KCI등재SCOPUS

        문서관리를 위한 자동문서범주화에 대한 이론 및 기법

        고영중,서정연,Ko, Young-Joong,Seo, Jung-Yun 한국과학기술정보연구원 과학기술정보센터 2002 Journal of Information Science Theory and Practice Vol.33 No.2

        최근 디지털 도서관이 등장하고 인터넷이 폭 넓게 보급되어 온라인 상에서 얻을 수 있는 텍스트 정보의 양이 급증함에 따라 효율적인 정보 관리 및 검색이 요구되고 있다. 자동 문서 범주화란 문서의 내용에 기반하여 미리 정의되어 있는 범주에 문서를 자동으로 할당하는 작업으로써 효율적인 정보 관리 및 검색을 가능하게 하는 동시에 방대한 양의 수작업을 감소시키는데 그 목적이 있다. 문서 분류를 위해서는 문서들을 가장 잘 표현할 수 있는 자질들을 정하고, 이러한 자질들을 통해 분류할 문서를 색인 과정을 통해 표현한다. 또한, 문서 분류기를 통해 문서를 목적에 맞게 분류한다. 본 논문에서는 자동 문서 범주화를 수행하기 위한 각 단계를 소개하고 각 수행 단계에서 사용되는 여러 가지 기법들을 소개하고자 한다. With the growth of the digital library and the use of Internet, the amount of online text information has increased rapidly. The need for efficient data management and retrieval techniques has also become greater. An automatic text categorization system assigns text documents to predefined categories. The system allows to reduce the manual labor for text categorization. In order to classify text documents, the good features from the documents should be selected and the documents are indexed with the features. In this paper, each steps of text categorization and several techniques used in each step are introduced.

      • KCI등재

        문장 중요도를 이용한 자동 문서 범주화

        고영중,박진우,서정연 한국정보과학회 2002 정보과학회논문지 : 소프트웨어 및 응용 Vol.29 No.6

        Automatic text categorization is a problem of assigning predefined categories to free text documents. In order to classify text documents, we have to extract good features from them. In previous researches, a text document is commonly represented by the frequency of each feature. But there is a difference between important and unimportant sentences in a text document. It has an effect on the importance of features in a text document.In this paper, we measure the importance of sentences in a text document using text summarizing techniques. A text document is represented by features with different weights according to the importance of each sentence. To verify the new method, we constructed Korean news group data set and experiment our method using it. We found that our new method gave a significant improvement over a basis system for our data sets.Key workds : Automatic text categorization, Importance of sentence, Text summarization techniques 자동 문서 범주화란 문서의 내용에 기반하여 미리 정의되어 있는 범주에 문서를 자동으로 분류하는 작업이다. 문서 분류를 위해서는 문서들을 가장 잘 표현할 수 있는 자질들을 정하고, 이러한 자질들을 통해 분류할 문서를 표현해야 한다. 기존의 연구들은 문장간의 구분 없이, 문서 전체에 나타난 각 자질의 빈도수를 이용하여 문서를 표현 한다. 그러나, 하나의 문서 내에서도 중요한 문장과 그렇지 못한 문장의 구분이 있으며, 이러한 문장 중요도의 차이는 각각의 문장에 나타나는 자질의 중요도에도 영향을 미친다.본 논문에서는 문서 요약에서 사용되는 중요 문장 추출 기법을 문서 분류에 적용하여, 문서 내에 나타나는 각 문장들의 문장 중요도를 계산하고 문서의 내용을 잘 나타내는 문장들과 그렇지 못한 문장들을 구분하여 각 문장에서 출현하는 자질들의 가중치를 다르게 부여하여 문서를 표현한다. 이렇게 문장들의 중요도를 고려하여 문서를 표현한 기법의 성능을 평가하기 위해서 뉴스 그룹 데이타를 구축하고 실험하였으며 문장 중요도를 사용하지 않은 시스템 보다 향상된 성능을 얻을 수 있었다.

      • 요구 사항 문장 범주화를 이용한 웹 기반의 요구 사항 추출 지원 시스템

        고영중(Youngjoong Ko),강기선(Kisun Kang),김재선(Jaeseon Kim),박수용(Sooyong Park),서정연(Jungyun Seo) 한국정보과학회 2000 정보과학회논문지 : 소프트웨어 및 응용 Vol.27 No.4

        시스템이 사용되는 분야가 점점 복잡해지고 대형화됨에 따라 시스템 개발에 있어 사용자 요구 사항의 올바른 분석과 서술이 중요하게 인식되고 있으며, 인터넷(internet)의 발전으로 분산 환경에서의 요구 사항 추출 및 분석의 필요성이 대두되고 있다. 본 논문에서는 자연어로 표현되는 요구 사항 문장을 유사도 측정 기법을 이용하여 주제별로 범주화(categorization)함으로써 분산 환경에서 수집된 요구 사항 문장을 분석하기 위한 기초를 제공할 수 있는 요구 사항 추출 지원 시스템을 제안한다. 제안된 시스템은 단어간, 문장간의 유사도 측정 기법을 이용하여 수집된 요구 사항 문장들을 주제별로 자동으로 분류함으로써 요구 사항 분석 시 초기 작업의 어려움을 줄이고 신속하고 정확하게 분석 작업을 수행하도록 지원할 것이다. 본 논문에서는 단어간, 문장간 유사도 측정 기법을 이용한 범주화 기법의 효율성을 실험을 통해 검증하였으며 구현된 시스템을 통해 추출, 처리되는 과정을 보여주고 있다. As a software becomes more complicated and large-scaled, it is very important for a software engineer to analyze user's requirements precisely and apply them effectively in the development stage. Due to the growth of the internet, the necessity of requirements elicitation and analysis in distributed environments has also become larger. This paper proposes a requirements elicitation supporting system that offer the basis for effectively analyzing requirements collected in distributed environments. The proposed system automatically categorizes collected requirements sentences into selected subject fields by measuring their similarity using a similarity measurement technique. Therefore, it reduces the difficulties in the initial stage of requirements analysis and it supports rapid and correct requirements analysis. This paper verifies the efficiency of the proposed system in similarity measurement techniques through experiments, and presents a process for requirements specifications elicitation using the embodied system

      • KCI등재

        오류 데이타에 강한 자질 투영법 기반의 문서 범주화 기법

        고영중(Youngjoong Ko),서정연(Jungyun Seo) 한국정보과학회 2004 정보과학회논문지 : 소프트웨어 및 응용 Vol.31 No.4

        본 논문은 자질 투영법을 사용한 새로운 문서 분류기를 제안한다. 제안된 문서 분류기는 학습문서를 각 자질로의 투영으로써 표현한다. 문서를 위한 분류 작업은 투영된 각 자질로부터의 투표(voting) 에 기인한다. 실험을 통해서 본 제안된 문서 분류기는 단순한 구조에도 불구하고 높은 성능을 보이고 있으며, 특히 기존의 문서 범주화 기법에서 높은 성능을 보여왔던 최근린법(k-NN)과 지지벡터기계(SVM)와 비교했을 때 빠른 수행 속도와 오류 데이타가 많을 환경에서 높은 성능을 보인다는 장점이 있다. 또한 제안된 문서 분류기의 알고리즘이 매우 단순하기 때문에 분류기의 구현과 학습 과정이 쉽게 수행될 수 있다. 이러한 이유로 제안된 문서 분류기는 빠른 수행 속도와 견고성(robustness), 그리고 높은 성능을 요구하는 문서 범주화 응용 영역에 유용하게 사용될 수 있을 것이다. This paper presents a new text classifier based on a feature projection technique. In feature projections, training documents are represented as the projections on each feature. A classification process is based on individual feature projections. The final classification is determined by the sum from the individual classification of each feature. In our experiments, the proposed classifier showed high performance. Especially, it have fast execution speed and robustness with noisy data in comparison with k-NN and SVM, which are among the state-of-art text classifiers. Since the algorithm of the proposed classifier is very simple, its implementation and training process can be done very simply. Therefore, it can be a useful classifier in text classification tasks which need fast execution speed, robustness, and high performance.

      • KCI등재

        준지도 학습 기반의 자동 문서 범주화

        고영중(Youngjoong Ko),서정연(Jungyun Seo) 한국정보과학회 2008 정보과학회논문지 : 소프트웨어 및 응용 Vol.35 No.5

        자동 문서 범주화란 문서의 내용에 기반하여 미리 정의되어 있는 범주에 문서를 자동으로 할당하는 작업이다. 자동 문서 범주화에 관한 기존의 연구들은 지도 학습 기반으로서, 보통 수작업에 의해 범주가 할당된 대량의 학습 문서를 이용하여 범주화 작업을 학습한다. 그러나, 이러한 방법의 문제점은 대량의 학습 문서를 구축하기가 어렵다는 것이다. 즉, 학습 문서 생성을 위해 문서를 수집하는 것은 쉬우나, 수집된 문서에 범주를 할당하는 것은 매우 어렵고 시간이 많이 소요되는 작업이라는 것이다. 본 논문에서는 이러한 문제점을 해결하기 위해서, 준지도 학습 기반의 자동 문서 범주화 기법을 제안한다. 제안된 기법은 범주가 할당되지 않은 말뭉치와 각 범주의 핵심어만을 사용한다. 각 범주의 핵심어로부터 문맥간의 유사도 측정 기법을 이용한 부스트래핑(bootstrapping) 기법을 통하여 범주가 할당된 학습문서를 자동으로 생성하고, 이를 이용하여 학습하고 문서 범주화 작업을 수행한다. 제안된 기법은 학습 문서 생성 작업과 대량의 학습 문서 없이 적은 비용으로 문서 범주화를 수행하고자 하는 영역에서 유용하게 사용될 수 있을 것이다. The goal of text categorization is to classify documents into a certain number of pre-defined categories. The previous studies in this area have used a large number of labeled training documents for supervised learning. One problem is that it is difficult to create the labeled training documents. While it is easy to collect the unlabeled documents, it is not so easy to manually categorize them for creating training documents. In this paper, we propose a new text categorization method based on semi-supervised learning. The proposed method uses only unlabeled documents and keywords of each category, and it automatically constructs training data from them. Then a text classifier learns with them and classifies text documents. The proposed method shows a similar degree of performance, compared with the traditional supervised learning methods. Therefore, this method can be used in the areas where low-cost text categorization is needed. It can also be used for creating labeled training documents.

      • KCI등재

        문장 중요도를 이용한 자동 문서 범주화

        고영중(Youngjoong Ko),박진우(Jinwoo Park),서정연(Jungyun Seo) 한국정보과학회 2002 정보과학회논문지 : 소프트웨어 및 응용 Vol.29 No.5·6

        자동 문서 범주화란 문서의 내용에 기반하여 미리 정의되어 있는 범주에 문서를 자동으로 분류하는 작업이다. 문서 분류를 위해서는 문서들을 가장 잘 표현할 수 있는 자질들을 정하고, 이러한 자질들을 통해 분류할 문서를 표현해야 한다. 기존의 연구들은 문장간의 구분 없이, 문서 전체에 나타난 각 자질의 빈도수를 이용하여 문서를 표현 한다. 그러나, 하나의 문서 내에서도 중요한 문장과 그렇지 못한 문장의 구분이 있으며, 이러한 문장 중요도의 차이는 각각의 문장에 나타나는 자질의 중요도에도 영향을 미친다. 본 논문에서는 문서 요약에서 사용되는 중요 문장 추출 기법을 문서 분류에 적용하여, 문서 내에 나타나는 각 문장들의 문장 중요도를 계산하고 문서의 내용을 잘 나타내는 문장들과 그렇지 못한 문장들을 구분하여 각 문장에서 출현하는 자질들의 가중치를 다르게 부여하여 문서를 표현한다. 이렇게 문장들의 중요도를 고려하여 문서를 표현한 기법의 성능을 평가하기 위해서 뉴스 그룹 데이타를 구축하고 실험하였으며 문장 중요도를 사용하지 않은 시스템 보다 향상된 성능을 얻을 수 있었다. Automatic text categorization is a problem of assigning predefined categories to free text documents. In order to classify text documents, we have to extract good features from them. In previous researches, a text document is commonly represented by the frequency of each feature. But there is a difference between important and unimportant sentences in a text document. It has an effect on the importance of features in a text document. In this paper, we measure the importance of sentences in a text document using text summarizing techniques. A text document is represented by features with different weights according to the importance of each sentence. To verify the new method, we constructed Korean news group data set and experiment our method using it. We found that our new method gave a significant improvement over a basis system for our data sets.

      • KCI우수등재

        클립-문장열의 일대일대응 관계를 이용한 동영상 검색 시스템

        김두영,고영중 한국정보과학회 2023 정보과학회논문지 Vol.50 No.6

        동영상 검색은 후보 동영상 중 텍스트 쿼리와 연관된 동영상을 찾는 연구 분야이다. 기존의 동영상 검색 모델은 비디오와 텍스트의 구조적 특징을 고려하지 않고 쌍을 이루는 임베딩이 서로 유사해지도록 학습하는 방식을 사용해왔다. 본 논문에서는 비디오와 텍스트의 구조적 특징 중 하나인 클립 시퀀스와 문장 시퀀스가 일대일대응 관계를 이룬다는 점을 활용하는 새로운 동영상 검색 모델 및 학습 기법을 제안한다. 실험 결과 본 논문에서 제안하는 최종 모델의 성능은 베이스라인 모델 대비 YouCook2 데이터셋에서 문장-클립 검색 R@1과 문단-동영상 검색 R@1에서 각각 0.3%p와 5.4%p의 향상된 성능을 보인다.

      • KCI우수등재

        데이터 생성 및 증강 기반의 개체 그래프를 활용한 음성 대화용 대화 상태 추적 모델

        유하은,고영중 한국정보과학회 2022 정보과학회논문지 Vol.49 No.10

        As a part of a task-oriented dialogue system, dialogue state tracking is a task for understanding the dialogue and extracting user’s need in a slot-value form. Recently, Dialogue System Track Challenge (DSTC) 10 Track 2 initiated a challenge to measure the robustness of a dialogue state tracking model in a spoken conversation setting. The released evaluation dataset has three characteristics: new multiple value scenario, three-times more entities, and utterances from automatic speech recognition module. In this paper, to ensure the model’s robust performance, we introduce an extraction-based dialogue state tracking model with entity graph. We also propose to use data collection and template-based data augmentation method. Evaluation results prove that our proposed method improves the performance of the extraction-based dialogue state tracking model by 1.7% of JGA and 0.57% of slot accuracy compared to baseline model. 대화 상태 추적은 목적 지향 대화 시스템의 한 부분으로, 대화를 이해하고 사용자의 목적을 이해하기 위해 수행되어야 하는 작업이다. 최근 Dialogue System Track Challenge (DSTC) 10 트랙2는 이를 음성 대화 환경으로 확장하여 음성 발화에 대한 대화 상태 추적 모델의 강건성을 주제로 진행되었다. 트랙2에서 공개한 평가 데이터는 새로운 시나리오의 등장, 3배 많은 개체 수 그리고 음성 인식된 발화로 이루어진 대화라는 특징을 가지고 있다. 본 논문에서는 이러한 데이터에도 강건한 개체 그래프를 활용한 추출 방식의 대화 상태 추적 모델과 새로운 시나리오에 대한 대화 데이터 생성 및 대화 익명화 방식을 활용한 증강 방법을 제안한다. DSTC10 평가 데이터에 대한 평가 결과 베이스라인 모델과 비교했을 때 Joint Goal Accuracy (JGA)와 Slot Accuracy에서 각각 1.7%, 0.57%의 성능 향상이 있음을 확인하였다.

      • KCI우수등재

        문서 기반 대화 시스템의 외부 지식 검색을 위한 다중 작업 학습 기반 재순위화 모델

        이홍희,고영중 한국정보과학회 2023 정보과학회논문지 Vol.50 No.7

        문서 기반 대화 시스템은 대화에 관련된 외부 문서를 검색하고 해당 문서를 활용해 적절한 응답을 생성한다. 그러나 기존 듀얼 인코더(dual-encoder) 구조의 검색 모델은 문서를 찾는데 낮은 성능을 기록했고, 이를 보완하기 위한 재순위화 모델은 충분히 최적화되지 않은 모습을 보였다. 본 논문에서는 이러한 문제를 해결하고 효과적인 검색을 수행하기 위해 다중 작업 학습 기반 재순위화 모델을 제안한다. 제안 모델은 크로스 인코더(cross-encoder) 구조의 모델로 대조 학습 기반 순위화, MLM(Masked Language Model), PDR(Posterior Differential Regularization)을 미세조정 단계에 동시에 학습하며, 보조 작업인 MLM과 PDR을 통해 모델의 언어 이해 능력과 강건성을 강화하는 방향으로 학습한다. 평가 결과 제안 모델은 베이스라인 모델과 비교했을 때 Recall@1, Recall@5, Recall@10에서 모두 성능 향상을 보였다.

      연관 검색어 추천

      이 검색어로 많이 본 자료

      활용도 높은 자료

      해외이동버튼