1. 서론
연구자의 경력과 전문성을 정확하게 평가하는 것은 학술 진흥, 인력 채용, 연구비 지원 등 다양한 의사결정 과정에서 중요한 역할을 한다[1]. 특히 전문가 집단의 연구경력에 대한 신뢰도 검증 과정은 해당 연구자의 전문성의 신뢰성 향상에 필수적인 요소라고 할 수 있다[2].
특정 연구자의 연구경력 분석에 있어 석사와 박사 학위 논문은 해당 연구자의 초기 학문적 관심사와 심화된 전문 영역을 각각 대표한다고 할 수 있다. 아울러 실제 학위 취득 경로는 매우 다양하다. 2019년 한국직업능력연구원 통계에 따르면 국내 신규 박사학위 취득자의 평균 소요 기간은 약 5.2년(62.8개월)이 걸린다. 이러한 점은 학위 논문을 활용한 연구경력 분석이 연구자의 실제 학위 취득 과정의 차이를 충분히 반영해야 함을 보여준다. 따라서 두 학위 논문 간의 주제 일치도 분석은 연구자의 학문적 일관성과 발전 방향을 이해하는 데 중요한 역할을 한다고 볼 수 있다[1]. 그러므로 특정 연구 주제에 대한 일관성 문제는 해당 연구자의 전문성 평가를 위한 직접·간접 지표로 활용할 수 있으며, 해당 연구자의 전문성에 대한 신뢰도 검증을 위한 중요 요소에 해당한다고 할 수 있다[3,4].
본 논문은 전문가들의 연구경력 일치도 분석을 위해 학위 논문을 이용한 신뢰성 검증 프레임워크를 제안한 것이다. 이를 위해 국립중앙도서관에서 수집한 전문가의 학위논문을 기반으로 제목 유사도, 논문 핵심 주제어의 일관성, 전공 유사도를 반영하여 특정 연구자의 석사-박사 학위 논문간의 유사도 측정을 통해 해당 연구자의 연구경력 일치도를 분석하였다.
일반적으로 학위논문은 연구자의 해당 시점까지의 학문적 성취와 전문화를 집약한 결과물로 간주되며, 석사와 박사 학위논문 간의 주제적 연속성은 연구자의 연구경력 일치도를 판단할 수 있는 객관적 지표가 될 수 있다[5]. 따라서 본 연구에서는 석사-박사 학위논문을 연구자의 학문적 일관성 검증을 위한 자료로 활용하였다. 이에 따라 본 연구에서는 연구자의 연구 경력 일치도 측정을 위해 논문 제목, 주제어, 전공 정보를 핵심 분석 요소로 사용하였다.
제목은 논문 주제를 가장 간결하게 함축한 표현으로 연구 방향성을 파악하는 지표로 활용될 수 있다[6]. 또한 주제어는 저자가 직접 정의한 핵심 개념으로 제목만으로는 포착하기 어려운 연구의 범위를 보완한다. 마지막 전공 정보는 연구자의 학문적 소속 영역을 반영하여 장기적인 연구 연속성 평가에 기여할 수 있는 요소로 제시되어 왔다[7]. 따라서 이 세 가지 요소를 함께 분석함으로써 단일 지표의 한계를 보완하고, 다차원적인 신뢰성 검증이 가능하다.
본 논문의 구성은 다음과 같다. 제2장에서는 관련 연구 부분을 살펴보고, 3장에서 제안모델에 관해 설명하고, 4장에서 본 논문의 전반적인 과정에 대한 시뮬레이션을 보이고, 5장에서 결론과 본 논문의 향후 응용 가능성에 대한 설명을 하였다.
2. 관련 연구
2.1 문장 임베딩 기반 유사도 분석 방법
문장 임베딩 기반의 유사도 분석 기법은 문장을 고차원 의미 공간에서 문장의 주제어, 문맥, 어휘 간 의미관계, 구조적 패턴 등의 의미 정보를 내포한 수치를 벡터로 표현하고, 이를 통해 문장 간 의미에 대한 유사도를 정량적으로 비교하는 분석 기법이다[8,9]. FastText, Universal Sentence Encoder(USE), Sentence-BERT(SBERT) 등에 대해 사전학습 기반인 임베딩 모델은 다양한 자연어 문장 간의 의미 비교를 통해 유사도 분석을 하고 있다. 해당 분석을 통한 표현력의 우수성이 다수의 연구에서 입증되었다[10].
아울러 국내 연구자들의 사례에서는 한국어 발화문쌍의 의미 유사도 평가를 위해 다수의 문장 임베딩 모델을 비교하는 연구가 진행되었다. 또한 해당 분석 기법은 주로 비형식적 대화체 문장을 대상으로 하고 있기 때문에 학술 텍스트나 논문 제목과 같이 정보밀도가 높고 구조적 제약이 있는 데이터에 직접적으로 적용하기에는 한계가 있다.
이러한 초기 임베딩 모델의 문제점을 보완하기 위해 논문 제목 및 초록을 SBERT로 임베딩한 후, 저널 데이터베이스와 유사도 비교를 통해 자동 저널 추천 시스템을 보완할 수 있는 기법이 제안 되었다[11]. 해당 분석 기법은 학술 문서 간 의미 기반 유사도 계산의 적용 가능성을 보여준 연구라고 할 수 있다. 그렇지만 분석 대상이 장문의 텍스트로 구성된 초록에 집중되어 있고, 단문으로 구성되는 논문 제목 간 비교, 전공, 주제어 등 다중 요소 기반 자료의 통합 분석에는 수행할 수 없는 문제점이 도출되었다. 그리고 해당 분석 기법의 추천 결과는 유사도 순위 기반으로 제공되기 때문에 특정 연구에 대한 일치도를 명확히 판별하거나 신뢰성을 정량적으로 평가하기에는 구조적 한계가 존재한다.
이와 같이 문장 임베딩 기반 연구는 문장 수준의 의미 분석에는 유용한 부분을 제공할 수 있지만, 연구자의 학술적 맥락 분석을 위한 경력 일치도를 다면적으로 평가에 필요한 통합적 유사도 분석 구조로 충분히 확장할 수 없는 단점을 가지고 있다[9].
2.2 키워드 기반 임베딩 유사도 분석 방법
전통적인 TF-IDF 방식보다 높은 정밀도를 제공하는 키워드 기반 임베딩 분석 기법은 문서의 핵심 주제어를 효과적으로 추출한 다음 이를 의미 공간에서 비교 분석하는 기법이다[13]. 특히 KeyBERT는 사전 학습된 BERT 모델을 활용하여 문서 내에서 의미 중심의 키워드를 추출하는 기법이다[11]. 해당 분석 기법은 뉴스 데이터를 기반으로 KeyBERT 알고리즘을 활용하여 핵심 키워드를 추출하고, 이를 임베딩하여 키워드 간 의미적 근접성을 계산하는 분석기법이다[11].
이 과정에서 유사도가 높은 키워드 간의 군집을 생성한 다음, 이를 논리 연산 기반의 검색 쿼리로 변환하여 정보 검색 효율을 개선하는 기법이다. 그렇지만 해당 연구는 일반 뉴스 기사와 같은 비정형적 텍스트를 중심으로 군집을 생성하기 때문에 논문 제목과 같은 단문 구조의 정밀 키워드 추출에는 적용상의 한계가 있다[15]. 또한, 키워드 간 유사도 분석결과를 전공이나 주제 일치도와 같은 상위 개념의 정량적 판단이 가능한 구조적 설계를 할 수 없는 문제점이 있다. 그러므로 의미 요소 간 상호보완적 관계를 반영하는 통합 모델로 확장할 수 없는 한계성을 가지고 있다.
이상과 같이 기존 연구들은 일반적으로 키워드 단위의 의미 분석 가능성을 제시하고 있지만, 주제적 맥락이 복잡하고 구조화된 학술 정보 간의 일치도를 정량화하는 데에는 한계가 있다.
그 외 학위 논문을 활용한 전공 분류에 대한 연구가 진행되었는데, 일반적으로 메타데이터 기반의 정적 분류에 집중하고 있다[16]. 그렇지만 해당 연구 사례 또한 대부분 단일 요소 중심의 비교 분석에 국한되어 있다. 그러므로 논문 제목, 주제어, 전공 간의 의미 신호를 통합적으로 분석한 후 연구경력의 일관성을 정량적으로 평가하기 위한 신뢰성 검증 모델로 제시하기 어렵다.
이상과 같이 연구자의 학문적 일관성 및 전문성을 평가하기 위한 기법에는 문장 임베딩 기반의 유사도를 분석하는 방법과 키워드 기반 임베딩 유사도를 분석 방법이 있다. 본 논문은 이러한 기존 분석 기법들의 문제점을 보완하기 위해, 다양한 의미 기반 요소를 통합한 다음 구조적 모델을 생성한 후 이를 기반으로 전문가 집단의 연구경력 일치도를 평가하는 정량적 프레임워크를 제안한다.
3. 제안모델
3.1 제안모델의 구성
본 연구는 기존의 문장 임베딩 기반 유사도 분석 기법과 키워드 기반 임베딩 유사도 분석 기법의 문제점 개선을 위해 전문가 집단의 연구경력 일치도를 정량적으로 평가할 수 있는 신뢰성 검증 모델을 제안한 것이다. 이를 위해 학위논문의 제목, 핵심 주제어, 전공 정보를 수집하고, 해당 요소들의 의미 기반 유사도 요소를 추출한 다음 이를 학습 기반으로 통합 분류 모델로 결합하였다.
제안모델은 총 세 개의 유사도 추출 모듈과 하나의 통합 분류기 모듈로 구성하였다. 유사도 추출 모듈은 제목 유사도 추출 모듈, 주제어 유사도 추출 모듈, 전공 유사도 추출 모듈로 구성하였으며, 세 가지 유사도 벡터를 입력으로 MLP (Multi-Layer Perceptron) 기반 통합 분류기를 통해 일치 여부를 판단하도록 구성하였다.
3.1.1 제목 유사도 추출 모듈 (Title Similarity Module)
일반적으로 모든 논문은 해당 논문의 제목에 모든 내용을 함축하고 있다. 그러므로 특정 논문 상호간의 제목에 대한 의미적 유사도를 평가하기 위해 다국어 문장 임베딩 모델인 Multilingual Sentence-BERT를 활용하였다. 본 논문에서 적용하고 있는 임베딩 모델은 논문의 제목을 벡터로 변환하여 두 벡터 간 코사인 유사도를 계산한 다음 기존의 단순 어휘 일치 여부가 아닌 제목의 전반적인 의미에 대한 유사도를 정량화하였다. (그림 1)은 제목간의 유사도를 추출한 것이다.

(그림 1) 제목 유사도 추출 결과
3.1.2 주제어 유사도 추출 모듈 (Keyword Similarity Module)
특정 논문의 제목은 일반적으로 짧은 문장으로 구성되어 해당 논문의 전반적인 내용을 함축하고 있다. 그렇지만 논문의 제목은 해당 저자 외 다른 논문 저자들도 활용이 가능하기 때문에 이에 대한 보완이 필요하다. 본 논문에서는 KeyBERT 알고리즘을 이용하여 논문의 제목에서 핵심 주제어를 추출하였다. 아울러 추출한 주제어들을 사전 학습 임베딩 모델을 통해 벡터화시키고, 상호 간 코사인 유사도를 계산하여 주제적 유사성을 평가하였다. 그러므로 본 논문에서는 특정 논문의 제목이 나타내는 단순 함축적 유사도보다 더 정확한 분석이 가능할 수 있도록 하였다. (그림 2)는 제목으로부터 KeyBERT를 이용해 키워드를 추출하고 키워드간 유사도를 추출한 것이다.

(그림 2) 주제어 유사도 추출 결과
3.1.3 전공 유사도 추출 모듈 (Major Similarity Module)
전공 정보는 연구자가 속한 학문 분야의 맥락을 반영하지만 논문 메타데이터에서 전공항목이 비어있거나 불완전한 경우가 많다. 이에 따라 본 연구에서는 논문 제목으로부터 전공 의미를 간접적으로 유추하여 유사도를 평가했다. 교육부에서 전공목록을 수집하여 전처리 후 약 9천개의 전공 리스트를 확보하였고, 논문 제목의 벡터와 코사인 유사도가 가장 근접한 전공 3개를 후보군으로 도출하였다. 각각의 논문에 대해 전공 후보군을 도출하고, 전공 벡터의 유사도를 비교하여 전공 유사도를 정량화하였다. 따라서 전공 정보의 누락, 학교별 상이한 전공표기 방식 등의 단점을 논문 제목을 이용하여 전공 벡터를 추출함으로써 보완하였다. (그림 3)은 제목으로부터 전공을 추출하고 제목과 전공간의 유사도를 추출한 것이다.

(그림 3) 전공 유사도 추출 결과
3.1.4 통합 분류기 모듈 (MLP Classifier Module)
세 가지 유사도(제목, 주제어, 전공) 값은 서로 다른 의미 차원을 가지며, 각각 독립적으로는 부분적인 신호만을 담고 있다. 이를 효과적으로 통합하기 위해 본 연구는 세 유사도 값을 입력으로 하여 이진 분류를 수행하는 MLP 분류기를 구성하였다. 해당 MLP는 2개의 은닉층(16-8 유닛 구조)으로 구성되며, ReLU 활성화 함수를 사용하여 비선형 결합을 학습하고, sigmoid 출력층을 통해 최종적으로 논문 쌍의 일치 여부를 예측한다.
위의 3가지 유사도 모듈로부터 추출된 유사도 요소는 의미적으로 독립적인 정보 채널로 간주되며, 각각의 요소가 상호보완적인 역할을 수행함으로써 보다 정교한 유사도 판단을 가능하게 한다. 특히 제목과 주제어 유사도가 높은 쌍이라 하더라도, 전공 유사도가 낮다면 학문적 연속성이 결여된 것으로 간주할 수 있으며, 반대로 전공이 유사하나 제목 및 키워드가 현저히 다른 경우는 표면적 일치를 의심할 수 있다. 이러한 다양한 패턴을 탐지하기 위해, 본 연구는 MLP 기반의 통합 분류기를 활용해 비선형적 관계까지 학습할 수 있도록 구성하였다.
3.2 제안모델의 시스템 흐름
본 논문의 제안시스템은 (그림 4)와 같은 흐름으로 구성된다.

(그림 4) 제안 프레임워크 흐름도
3.2.1 데이터 수집 및 전처리
본 논문에서 제안하는 모델의 분석 자료에는 국립중앙도서관의 학위 논문 데이터베이스로부터 석사 및 박사 논문의 제목, 전공, 저자 정보를 수집하였다. 수집된 텍스트는 정제, 소문자화, 특수문자 제거 등의 전처리 과정을 거친다.
3.2.2 유사도 요소 추출
해당 추출 과정은 다음과 같은 산출 과정을 수행한다. 먼저 제목 유사도 산출 과정은 전처리된 논문 제목을 SBERT에 임베딩 후 벡터 간 코사인 유사도 계산을 수행한다. 그 다음 주제어 유사도 산출 과정은 KeyBERT를 통해 추출된 키워드를 임베딩 한 다음 키워드 벡터 간 평균 유사도를 계산한다. 마지막으로 전공 유사도 산출 과정은 논문제목을 기반으로 사전 정의된 약 9천개의 전공명에 대한 의미적 유사도를 계산하여 전공을 산출하고, 전공 벡터 간 유사도를 전공 유사도로 산출한다.
3.2.3 유사도 통합 및 일치 여부 판별
추출된 3가지 유사도(제목, 주제어, 전공)을 통합하여 최종적으로 논문 쌍의 일치 여부를 판단하기 위해 MLP 기반의 이진 분류기를 구성한다. 모델은 정답쌍과 오답쌍을 학습하여 유사도 벡터를 분류하고, 예측 확률값을 출력하여 임계값에 따라 정밀도, 재현율, F1-Score를 산출한다.
4. 실험 및 평가
본 연구에서 제안하는 모델은 Ubuntu 운영체제에서 Python 3.10 환경을 기반으로 구현하였으며, 실험에는 Sentence-transformers, KeyBERT, PyTorch, Scikit-learn 등 주요 자연어처리 및 머신러닝 라이브러리를 사용하였다. 실험에 활용된 데이터는 (2004년에서 2024년 05월까지) 국립중앙도서관의 학위 논문 데이터베이스로부터 수집된 석사-박사 논문의 제목 및 전공 정보를 바탕으로 구성하였으며, 총 27,670건의 박사 논문을 보유한 전문가 데이터를 기반으로 하였다. 아울러 해당 데이터셋에서 석사와 박사 학위 취득 간의 기간은 평균 6.45년, 최소 2년에서 최대 22년 까지의 분포를 보여 학위 간 연계가 일정하지 않고 연구자의 경력 경로에 따라 다양하게 나타남을 확인하였다.

(그림 5) 학위 논문 JSON 데이터
본 논문의 전공 일치도 분석을 위한 실험 자료로는 논문 제목과 전공이 모두 존재하는 동일인의 석사-박사 논문을 한 쌍으로 구성하여 일치하는 쌍(positive pair)과 불일치하는 쌍(negative pair)을 생성하였다. 다음으로 제안모델의 유사도 측정 결과를 기반으로 통합 분류기를 이용해 일치 여부를 이진 분류하는 방식으로 수행하였다. 아울러 평가 지표로는 정밀도(Precision), 재현율(Recall), F1-Score를 사용하였으며 실험 결과는 <표 1>과 같은 결과를 보였다.
<표 1> 실험 결과

<표 1>를 분석해 보면 개별 요소만을 활용한 모델에 비해 본 논문에서 제안 프레임워크의 제목, 주제어, 전공 정보를 통합적으로 반영한 제안모델이 가장 높은 F1-Score를 나타내고 있는 것을 알 수 있다. 특히, 키워드 기반 유사도는 높은 재현율에 비해 정밀도가 낮아 단독 활용 시의 한계가 있음을 확인할 수 있었으며, 전공 유사도까지 통합한 제안 프레임워크 분석 기법이 연구경력 일치도 판별에 효과가 있다는 것을 알 수 있다.
5. 결론
일반적인 기존 논문의 전공 일치도 분석 방식은 논문 수, 인용 횟수 등 양적 지표 또는 단일 유사도 중심 분석에 의존하는 한계성을 가지고 있다. 본 연구는 기존의 분석 방식을 개선하기 위해 전문가 집단의 연구경력 일치도를 정량적으로 평가할 수 있는 신뢰성 검증 프레임워크를 제안한 것이다. 논문 제목, 핵심 주제어, 전공 정보라는 세 가지 의미 기반 요소를 통합하여 연구경력 일치도를 다차원적으로 평가할 수 있는 구조적 접근을 도입하였다.
본 논문의 제안 프레임워크는 제목 임베딩 유사도, 주제어 임베딩 유사도, 전공 임베딩 유사도를 각각 독립적으로 산출하고, 이들을 입력으로 통합분류기를 학습하여 최종 일치도를 산정하였다. 특히 전공 유사도는 전공명의 누락, 전공명의 완전한 일치의 문제를 해결하기 위해 제목으로부터 전공을 예측하여 전공명 임베딩 벡터의 유사도를 계산함으로써 보다 유연하고 의미 기반의 평가가 가능하도록 설계하였다.
아울러 실험 결과에 대한 신뢰성을 높이기 위해 총 27,670건의 석사-박사 학위 논문 데이터를 수집하였다. 이를 기반으로 제안모델에서 개별 요소 기반 모델에 비해 높은 정밀도와 F1-Score가 향상됨을 확인할 수 있었다. 이를 통해 학문적 일관성과 전문성 평가에서의 실효성도 입증할 수 있었다. 또한 본 모델은 연구자 이력 검증, 경력 기반 연구자 추천 시스템 등에 다양하게 응용할 수 있으며, 학위과정에서의 초기 연구경력 일관성을 검증하는 지표로 활용할 수 있다. 그렇지만 학위논문만으로는 연구자의 전 생애 연구경력을 완전하게 설명할 수는 없다. 그러므로 학술 논문, 특허, 연구과제 성과물 등 다양한 자료를 추가한 확장 모델을 통해 수행될 필요가 있다. 아울러 변화하고 있는 다양한 학위 취득 과정의 세밀한 분석을 통해 연구자의 연구수행 기간에 대한 가중치 부여를 통해 연구 일치도의 신뢰성을 향상시킬 필요가 있다고 본다.
References
- 정종균, "대형언어모델에서의 공격 방지를 위한 필터링 기법에 관한 연구," 융합보안논문지, 제24권, 제2호, pp. 55-63, 2024. https://doi.org/10.33778/kcsa.2024.24.5.063
- 유우준, "유사도를 활용한 신뢰성 있는 저자 정보 확장 방법," 동국대학교 대학원 석사학위논문, 2015.
- 정종균 외, "임베딩 모델을 활용한 텍스트 분류 실험 연구," 융합보안논문지, 제24권, 제4호, pp. 109-116, 2024. https://doi.org/10.33778/kcsa.2024.24.4.109
- Y. Liu and M. Li, "A comprehensive framework for evaluating researchers' academic performance and consistency," Journal of Informetrics, Vol. 15, No. 2, Article ID 101157, 2021. https://doi.org/10.1016/j.joi.2021.101157
- 김춘주 외, "경력정체성(Career Identity)에 대한 통합적 문헌 고찰: 국내·외 양적 연구를 중심으로", HRD연구, 제25권, 제2호, pp. 189-223, 2023. https://doi.org/10.18211/KJHRDQ.2023.25.2.007
- 송민, 김재윤, "학술 논문 메타데이터 요소의 활용 가능성에 관한 연구", 정보관리학회지, 제29권, 제3호, 2012.
- H. D. White and K. W. McCain, "Visualizing a discipline: An author co-citation analysis of information science, 1972-1995", Journal of the American Society for Information Science, Vol. 49, No. 4, pp. 327-355, 1998. https://doi.org/10.1002/(SICI)1097-4571(19980401)49:4<327::AID-ASI4>3.0.CO;2-W
- N. Reimers and I. Gurevych, "Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks," Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing (EMNLP), 2019.
- J. Devlin, M. W. Chang, K. Lee and K. Toutanova, "BERT: Pre- training of deep bidirectional transformers for language understanding," arXiv preprint arXiv:1810.04805, 2018.
- K. Ethayarajh, "How contextual are contextualized word representations Benchmarking ELMo, BERT and CoVe against traditional word embeddings," Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Vol. 1, pp. 2818-2828, 2019.
- 김용우 외, "Sentence BERT를 이용한 내용 기반 국문 저널추천 시스템," 지능정보연구, 제29권, 제3호, pp. 37-55, 2023. https://doi.org/10.13088/JIIS.2023.29.3.037
- L. Wang and H. Chen, "Semantic similarity analysis of scientific papers using deep learning models: A review," Expert Systems with Applications, Vol. 205, Article ID 117678, 2022.
- T. Mikolov, K. Chen, G. Corrado and J. Dean, "Efficient estimation of word representations in vector space," arXiv preprint arXiv:1301.3781, 2013.
- M. Grootendorst, "KeyBERT: Minimal keyword extraction with BERT," arXiv preprint arXiv: 2010.11965, 2020.
- S. V. Camargo and C. Papanastasiou, "Automatic keyword extraction: A comprehensive review," Artificial Intelligence Review, Vol. 55, No. 2, pp. 1435-1473, 2022.
- 박수진, 윤광택, "메타데이터 및 내용 기반 특징을 활용한 학위논문의 학술분야 분류," 정보관리학회지, 제33권, 제2호, pp. 87-105, 2016.