Separating Head from Body in Web-Tables

웹상의 표에서 머리와 몸체 분리 방안 연구

  • Jung, Sung-Won (Korean Language Processing Lab, School of Electrical & Computer Engineering, Pusan National University) ;
  • Kwon, Hyuk-Chul (Korean Language Processing Lab, School of Electrical & Computer Engineering, Pusan National University)
  • 정성원 (부산대학교 컴퓨터공학과 한국어정보처리연구실) ;
  • 권혁철 (부산대학교 컴퓨터공학과 한국어정보처리연구실)
  • Published : 2005.10.21

Abstract

본 논문은, 웹상의 표에서 유용한 정보를 뽑기 위하여 표 머릿부분과 몸체부분을 효과적으로 분리하는 방안을 제안한다. 웹상의 표로부터 정보를 뽑기 위해서는 웹상의 표를 기계가 해석할 수 있는 형태, 즉 속성-값의 쌍으로 변환해야 한다. 이중 속성은 보통 표 머리에 해당하며, 그에 해당하는 값은 표 몸체에 해당하는데, 이는 머리가 해당 몸체 부분을 대표하여 나타내는 단어이기 때문이다. 본 연구의 선행 연구에서는 인터넷상의 표가 표 본래의 정보 전달을 위한 목적 이외에 인터넷 문서의 정렬이나 구조화를 목적으로 쓰이는 경우가 많으므로 이러한 표를 제거하고 표 본래의 의미를 전달하는 표(의미 있는 표)만 추출하는 연구를 하였다 본 연구에서는 이를 바탕으로 의미 있는 표에서 표 머리와 몸체를 분리하기 위한 휴리스틱에 기반을 둔 모델을 제안한다. 이를 위하여, 표의 본래 특성과, 표를 작성하는 저자의 작성 습관을 관찰하여 머리와 몸체를 분리하기 위한 방안을 설정하고, 이 방안들을 결합하는 모델을 구축한다. 본 연구에서는 이 결과로 80.3%의 표 머리 추출 정확도를 얻을 수 있었다.

Keywords