Korean Phoneme Sequence based Word Embedding

한국어 음소열 기반 워드 임베딩 기술

  • 정의석 (한국전자통신연구원, 음성지능연구그룹) ;
  • 송화전 (한국전자통신연구원, 음성지능연구그룹) ;
  • 이성주 (한국전자통신연구원, 음성지능연구그룹) ;
  • 박전규 (한국전자통신연구원, 음성지능연구그룹)
  • Published : 2017.10.13

Abstract

본 논문은 한국어 서브워드 기반 워드 임베딩 기술을 다룬다. 미등록어 문제를 가진 기존 워드 임베딩 기술을 대체할 수 있는 새로운 워드 임베딩 기술을 한국어에 적용하기 위해, 음소열 기반 서브워드 자질 검증을 진행한다. 기존 서브워드 자질은 문자 n-gram을 사용한다. 한국어의 경우 특정 단음절 발음은 단어에 따라 달라진다. 여기서 음소열 n-gram은 특정 서브워드 자질의 변별력을 확보할 수 있다는 장점이 있다. 본 논문은 서브워드 임베딩 기술을 재구현하여, 영어 환경에서 기존 워드 임베딩 사례와 비교하여 성능 우위를 확보한다. 또한, 한국어 음소열 자질을 활용한 실험 결과에서 의미적으로 보다 유사한 어휘를 벡터 공간상에 근접시키는 결과를 보여 준다.

Keywords