구문 분석 결과를 이용한 한국어 무제한 정보추출

A Syntax-Based Hybrid System for Korean Open Information Extraction

  • 김병수 (포항공과대학교 컴퓨터공학과) ;
  • 유환조 (포항공과대학교 컴퓨터공학과) ;
  • 이근배 (포항공과대학교 컴퓨터공학과)
  • Kim, Byungsoo (Department of Computer Science and Engineering, POSTECH) ;
  • Yu, Hwanjo (Department of Computer Science and Engineering, POSTECH) ;
  • Lee, Gary Geunbae (Department of Computer Science and Engineering, POSTECH)
  • 발행 : 2015.10.17

초록

무제한 정보추출은 주로 영어를 대상으로 연구가 진행 되었지만, 최근에는 영어가 아닌 다른 언어에 대한 적용이 시도되고 있다. 본 논문에서는 관계 어휘의 유형을 동사형과 명사형 2가지로 정의하고, 각 유형별로 구문 분석 결과 기반의 서로 다른 방법론을 적용하는 한국어 대상 무제한 정보추출 시스템을 소개한다. 동사형 관계 어휘에 대해서는 의존 관계 기반의 추출 규칙을 적용하고, 명사형 관계 어휘에 대해서는 대량의 말뭉치로부터 자동으로 학습한 의존 관계 구조 기반의 추출 패턴을 적용한다. 임의의 100개 문장에 대해서 수행한 결과는 산출된 전체 트리플에 대해 0.8이상의 정밀도를 보임으로써 본 논문에서 제안하는 방법의 효용성을 증명하였다.

키워드