DOI QR코드

DOI QR Code

Evaluating BERT-Based Models for Mapping RMF Security Controls to MITRE ATT&CK Techniques

BERT 기반 RMF 보안통제항목과 ATT&CK 매핑 기법 연구

  • 이한희 (세종대학교 컴퓨터공학과.사이버전연구소) ;
  • 윤석준 (세종대학교 컴퓨터공학과.사이버전연구소) ;
  • 이윤경 (한국전자통신연구원 국방사이버전기술연구센터) ;
  • 강지원 (세종대학교 컴퓨터공학과.사이버전연구소)
  • Received : 2025.09.15
  • Accepted : 2025.10.02
  • Published : 2025.12.31

Abstract

Aligned with Korea's K-RMF, this study automates mapping between NIST RMF security controls and MITRE ATT&CK techniques using semantic similarity. Current MITRE mappings are sparse and manual, limiting threat intelligence integration. We apply BERT variants and LLMs to compute similarity between control and technique descriptions, generating Top-K mappings. Expert-validated mappings serve as ground truth for evaluating precision, recall, and F1-score. Results show semantic LLMs outperform SBERT in coverage and interpretability, while hybrid models enhance reliability and scalability. This work provides a structured, automated RMF-ATT&CK mapping framework, enabling defense systems to better align security controls with real-world adversary behaviors. The approach supports proactive cyber defense by bridging policy and threat intelligence, offering measurable improvements in mapping accuracy and operational applicability for national defense.

한국군 위험관리제도(K-RMF) 시행에 따른 국방정보시스템의 보안통제항목에 대한 위협 기법 매핑을 통해 대응방안을 수립할 수 있다. 본 연구는 NIST 위험관리 프레임워크(RMF) 보안통제항목과 MITRE ATT&CK 기술 간 연계를 의미 유사도 기반 자동화로 정교화하고, 그 결과를 국방 사이버 방어 운용에 적용 가능한 Top-K 후보와 근거를 제시하는 것이다. 현재 공개된 MITRE Mapping Explorer는 일부 RMF 통제 항목에 대해서만 ATT&CK Technique 항목과 수동 매핑 정보를 제공하고 있다. 이로 인해 대부분의 통제 항목은 위협 인텔리전스 지식베이스와의 직접적인 연결 고리가 부족한 상태이다. 이에 따라 본 연구에서는 기존 매핑의 한계를 극복하고 RMF-ATT&CK 간 매핑 커버리지 및 정확도를 향상시키기 위한 자동화된 접근 방법을 제안한다. 실험에는 BERT 파생모델과 대형 언어모델(LLM)을 포함한 여러 의미 기반 언어 모델들을 적용하여, RMF 보안 통제 설명과 ATT&CK Technique 설명 간의 유사도를 계산하고, Top-K 후보 매핑 항목을 도출하였다. 또한, 일부 RMF 보안 통제에 대한 전문가 수작업 매핑 결과를 정답 세트로 활용하여 각 모델의 정확도, 재현율, F1-score를 비교 평가하였다. 그 결과, 의미 기반 LLM은 기존 SBERT 기반 모델 대비 설명력과 커버리지 면에서 우수한 결과를 보였으며, 혼합형 모델 구조는 매핑의 신뢰도와 확장성 모두에서 높은 가능성을 확인할 수 있었다.

Keywords

1. 서론

국방부의 한국군 위험관리제도(K-RMF) 시행에 따라 보안통제항목의 구현과 평가에 필요한 연구가 진행되고 있다. K-RMF에 적용되는 국방정보시스템은 보안통제항목이 선정하고 항목별 보안대책을 수립해야 한다. 공격자의 공격기법 매핑을 통해 실질적인 대응방안 수립에 도움이 될 수 있다. 본 연구는 미국 국립표준기술연구소 위험관리 프레임워크(NIST Risk Management Framework, RMF) 보안 통제와 MITRE 공격 전술·기법·절차 프레임워크(ATT&CK: Adversarial Tactics, Techniques & Common Knowledge) 기법 간 관계를 AI 기반 의미 유사도 분석으로 체계화·자동화하는 것을 목표로 한다. 문장-BERT(Sentence-BERT, SBERT) 계열 임베딩과 대규모 언어모델(Large Language Model, LLM) 추론을 결합하여 RMF 통제 설명과 ATT&CK 기법 설명의 의미적 근접도를 산출하고 Top-K 후보를 도출한 뒤, 전문가 정답(골드)셋으로 정밀도·재현율·F1을 평가한다. 특히 하이브리드 재순위화로 커버리지와 신뢰도를 동시에 높이는 절차를 제안한다. 본 논문은 다음과 같이 구성된다. 2장은 관련 연구를 정리하고. 3장은 연구 접근, 데이터셋, 유사도 기반 기법, BERT/LLM 적용 매핑 결과를 기술하며, 4장은 실험 환경, 평가 지표, 매핑 결과와 해석을 제시한다. 5장은 결론과 핵심 성과를 정리하고 향후 과제를 제안한다.

2. 관련 연구

2.1 NIST RMF와 MITRE ATT&CK

미국 국립표준기술연구소의 위험관리 프레임워크(NIST RMF)는 자산‧위협‧취약점 평가를 바탕으로 보안통제의 선정‧구현‧지속 모니터링에 이르는 생애주기 절차를 제시한다. 국방부는 이 제도를 기반으로 한국군 무기체계 및 정보체계에 한국군 위험관리제도(K-RMF)로 도입하여 시행하고 있다. MITRE ATT&CK는 공격자의 전술‧기법‧절차(TTP:Tactical Techniques Procdures)를 체계화한 지식베이스로서 관측 데이터와 완화 수단을 매트릭스로 정리한다. 두 체계는 통제 요구와 공격 기술을 연계하는 준거틀을 제공한다. 국방분야에서는 ATT&CK 프레임워크를 활용하여 사이버위협에 대한 대응방안을 수립하려고 노력하고 있다.

2.2 위협 인텔리전스 지식베이스 기반의 매핑 기법 연구

Wudali[1]는 규칙기반-ATT&CK 매퍼(Rule-ATT&CK Mapper, RAM) 연구에서 프롬프트 체이닝과 컨텍스트 주입을 결합한 다단계 LLM 파이프라인으로 SIEM 결과를 ATT&CK와 매핑하는 기법을 제안하였다. 이는 학습 없이 SIEM 규칙을 ATT&CK 기법에 고정밀 매핑하였고(Avg. Recall≈0.75, Avg. Precision≈0.52; 동적-k에서 F1≈0.62), 자연어화와 근거 기반 정제가 성능 향상의 핵심임을 보였다. Wudali[1]는 기법 간 텍스트 유사성으로 환각 또는 혼동이 발생하는 경우가 있다. 본 연구는 이 절차를 RMF 통제 서술에 이식해 ‘정규화→임베딩 후보→LLM 정합성 재순위화→동적 -k’의 하이브리드 매핑으로 확장한다.

Abderehman[2]는 보안취약점(CVE: Common Vulnerabilities and Exposures) 설명에 대해 MiniLM 임베딩+코사인과 멀티레이블 MLP를 결합해 ATT&CK 기법을 자동 예측하고, CVSS·익스플로잇·자산 중요도를 통합한 합성 위험 점수로 우선순위를 제시했으며(Micro-F1≈0.68, Hamming Loss≈0.10), 임계값 조절을 통한 정밀–재현 균형을 입증하였다. Mohammed[2]는 유사 기법(Technique) 간 구분의 난점이 있다. 본 연구는 이를 RMF 통제 도메인으로 전환하여 ‘임베딩 기반 후보–정합성(LLM/분류기) 결합–동적-k’로 매핑 품질을 높이는데 적용한다.

Zhang[3]는 대규모언어모델(LLM)의 파인튜닝(Fine-Tuning)을 통한 취약점-전술-기법(Vulnerability-to-Tactic-and-Technique, VTT) 매핑 연구를 제안하였다. 이는 보안약점(CWE:Common Weakness Enumeration)·CAPEC(Common Attack Pattern Enumerations and Classifications) 지식을 체인 템플릿으로 주입해 대규모언어모델(LLM)을 미세조정하고, 생성된 공격 기술 서술을 임베딩 매핑(Embeding mapping)으로 정합화하는 생성+매핑 2단 구조로 보안취약점(CVE)→ATT&CK 전술/기술 매핑 정확도를 크게 향상시켰다(전술 정확도 85.18%, 체인 기반 평균 +9.24%p). Chenhui[1]는 일부 미세조정과 평가셋 간 교집합이 존재할 가능성이 있다. 본 연구는 이 구조를 RMF 통제 서술에 맞춰 ‘Control→(Mitigation/Data Source)→Technique’ 체인으로 재설계하여, 근거 스팬 기반 재순위화와 동적-k를 결합한 하이브리드 매핑을 구현한다.

Rafiey[4]는 범용 대형언어모델(GPT-3.5, GPT-4o, OpenAI o1)과 소량 예시(Few-shot) 프롬프트(Prompt)로 보안취약점(CVE)→ATT&CK 매핑을 자동화하여 BERT 기반을 상회하는 F1(최고 59%)을 달성했음을 보였다. Pasha[4]는 취약점 서술이 모호하고 희박할 때 성능이 저하되었고 용어 불일치로 인한 키워드 기반 한계가 있다. 우리는 이 접근을 RMF 통제 서술에 이식하되, 폐회로 RAG·하이브리드 재랭크·근거 스팬인용으로 정합성과 감사추적성을 강화한다.

지식베이스 기반 매핑 자동화 관련 기존연구를 비교하면 <표 1>과 같다.

<표 1> 지식베이스 기반 매핑 연구

SOBTCQ_2025_v25n5_11_3_t0001.png 이미지

*CTID(Center for Threat Infored DefenseTM)

3. RMF-ATT&CK 매핑 기법 제안

3.1 매핑 아키텍처

본 장은 RMF–ATT&CK 매핑을 위한 세 계층 아키텍처(데이터 통합–표현/후보 생성–결정 계층)를 제안한다. 기존 수작업 매핑의 [한계: 예, 범위 제한/주관성/갱신 비용]을 극복하기 위해, 우리는 통합 테이블을 기반으로 임베딩 유사도와 LLM 판단을 결합하는 하이브리드 접근을 구성하였다. 제안 아키텍처는 (i) 데이터 통합(Consolidation), (ii) 텍스트→임베딩 및 Top-M 후보 생성, (iii) 게이팅·모델 분기·점수결합/선택으로 구성된다. (그림 1)은 RMF-ATT&CK 매핑 아키텍처를 표현한 것이다.

SOBTCQ_2025_v25n5_11_3_f0001.png 이미지

(그림 1) 제안하는 매핑 아키텍처

3.2 데이터 통합(consolidation)과 전처리

데이터 통합 테이블은 ‘데이터 품질·라벨·버전’을 고정한 후, 임베딩과 결정 로직을 공정하게 비교·개선할 수 있게 만드는 실험의 토대이다. 이걸 해둬야 연구에서 주장하는 정밀도/재현율 향상, 게이팅 효과, LLM 분기 기여도를 객관적·재현 가능하게 증명할 수 있다. 데이터 소스는 RMF(R5)과 ATT&CK[v12.1]을 사용한다. RMF에서는 control_id, family, title, description, supplemental_guidance를 추출하고, ATT&CK에서는 tech_id, name, description, tactic, data_sources, mitigations를 사용한다. 두 소스를 단일 통합 테이블로 병합한다). <표 2>는 본 연구의 유일한 학습/평가 데이터 원천으로 이용된다. 버전 태그(ver_tag)와 데이터 분할(split)은 재현성 확보를 위해 명시한다.

<표 2> 단일 통합 테이블(스키마)

SOBTCQ_2025_v25n5_11_3_t0002.png 이미지

정답 라벨은 MITRE Mapping Explorer/CTID의 공개 매핑을 사용한다. 동일 tech_id는 완전일치(1.0), 상위–하위 기법 간 대응은 부분일치(0.5)로 가중하며, 그 외는 0으로 처리한다. 가중치 1/0.5/0를 명시하는 이유는 추후에 보다 더 정확한 점수를 제시하기 위한 것이다. 골드가 부분적이라는 한계를 고려해, [품질 점검/휴먼 검토] 절차를 병행한다. (그림 2)는 RMF-ATT&CK 데이터 통합 절차를 표현한 것이다.

SOBTCQ_2025_v25n5_11_4_f0001.png 이미지

(그림 2) RMF-ATT&CK 데이터 통합(Consolidation)

3.3 표현 및 부호생성(임베딩・FAISS)

모든 텍스트는 [전처리 규칙]으로 정규화하고, 동일 임베딩 모델([예: all-MiniLM-L6-v2])에 통과시켜 동형 임베딩 공간으로 사상한다. 문단은 문장 분할 후 mean-pooling으로 대표 벡터를 산출한다. 코사인 유사도(=정규화 내적)를 사용해 각 통제에 대한 상위 M개 기법 후보를 생성한다. 이 단계는 선택을 수행하지 않으며, 결정 계층의 입력으로서 후보 풀을 제공한다.

수식(임베딩·유사도)

ec=f(control_desc)

et=f(tech_desc)

sembed(c,t)=⟨ec,et⟩ (1)

|| ec ||2 = || et ||2 = 1

예: ec(“AC-2 desc…”)·et(“T1078 desc…”) → cos=0.31 → Retrieval Top-M 포함

(그림 3)은 RMF 통제 문장과 ATT&CK 기법 문장을 전처리·임베딩·후보 Top-M을 검색하는 절차를 표현 것이다. Top-M은 유사한 매핑에 최근접한 M개를 추출한는 것이며, Top-K는 최종적으로 매핑한 결과를 제시하는 K개를 의미한다.

SOBTCQ_2025_v25n5_11_4_f0002.png 이미지

(그림 3) 텍스트→임베딩 및 Top-M 후보 생성

FAISS(facebook AI Similarity Search)는 대규모 벡터(임베딩) 간 유사도 검색과 군집화를 아주 빠르게 수행하기 위한 라이브러리다. 문장 임베딩으로 만든 수십만∼수억 개의 벡터에서 Top-K 최근접 이웃(NN)을 찾을 때 표준처럼 사용된다. 이번 RMF ↔ ATT&CK 매핑에서는 1차 후보검색기로 FAISS를 사용해 ‘통제 설명 ↔ ATT&CK 기술 설명’ 임베딩 간 Top-M 후보를 빠르게 찾는데 활용한다. 이후 LLM 재랭크 및 전술·데이터소스 게이팅으로 의미 정밀도를 보강한다. 이어서, 임베딩 정규화 + IndexFlatIP 조합을 사용하여 코사인 유사도를 재현한다.

<표 3>은 전술/데이터소스·미티게이션 게이팅 효과로 후보가 어떻게 정제되는지를 보여준다. 게이팅으로 후보 규모가 37.2% 감소해 LLM 재랭크 호출 비용이 절감되었다. 게이팅 후 소량 K 구간의 정밀도(P@1)가 +0.066 개선되었고, F1@5도 소폭(+0.006) 향상되었다. 정확히 부합되는 Top-K를 찾기위해 게이팅, 자카드, LLM 재랭크하기 전에 Top-M 후보군 선별 과정을 거치면 다중 정합성 효과를 기대할 수 있다.

<표 3> 통제별 Top-M 후보 통계 게이팅 전·후 비교

SOBTCQ_2025_v25n5_11_4_t0001.png 이미지

3.4 결정 단계:게이팅· LLM 분기·점수결합/선택

결정 단계는 후보에 도메인 제약을 적용하고, 다양한 모델 분기에서 점수를 산출하여 최종 매핑을 선택한다. 본 절은 본 연구의 핵심 공헌에 해당한다. (1)전술 게이팅: family F → 허용 전술집합 G(F)로 제한한다. (2)데이터소스/미티게이션 정합: 통제에서 추출한 관측/완화 신호와 기법 메타의 겹침을 임계로 필터링한다(지표: Jaccard 등). 게이팅은 LLM 호출·검토하는 시간을 줄이며 정밀도를 개선한다.

3.4.1 게이팅(Gating)

게이팅은 도메인 제약으로 후보를 1차 거르는 규칙이다. 본 연구에서는 전술 게이팅(Tactics gating)을 사용한다. 통제 패밀리(controls family)(예: AC, IA, AU ...)마다 합리적인 ATT&CK 전술 집합을 미리 정의하고, 해당 전술에 속하지 않는 기법(Technique)은 후보에서 제거한다. 전술 게이팅의 효과는 저춤질 후보를 제거하므로써 정밀도를 높이고 이후 LLM 재랭크 호출량을 줄이면서 평가 결과를 안정화하는데 도움이 된다.

3.4.2 자카드(Jaccard) 필터

자카드(Jaccard) 필터는 통제 텍스트(controls text)에서 뽑은 관측/완화 신호와 ATT&CK 기법 메타데이터(특히 Data Source, Mitigation)의 토큰 집합을 비교하여 허위적 정합을 점수화한다. 자카드(Jaccard) 필터는 통제가 감시/완화할 수 있는 행위와 정합되는 기법만 남겨 정밀도와 설명 가능성을 함께 끌어올리는 효과가 있다.

\(\begin{align}\text {자카드(Jaccard)(Jaccard) 유사도} :J(A, B)=\frac{|A \sqcap B|}{|A \sqcup B|}\end{align}\)

A: 통제의 관측/완화 토큰(예: “audit”, “logon”, “network”, “deny”, “lockout”…)

B: 기술의 데이터소스/미티게이션토큰(예: “Authentication logs”, “Network traffic content”, “Account use policies”…)

* 임계값으로 통과여부 결정:

J(obs, tech_DS) ≥ θds​ 또는

J(mit, tech_MIT) ≥ θmit이면 통과

<표 4> Gating + Jaccard 간단 의사코드

SOBTCQ_2025_v25n5_11_5_t0001.png 이미지

3.4.3 결정 단계

최종 매핑에 적용한 4개 모델의 정의는 <표 5>와 같다.

<표 5> 4개 모델 정의

SOBTCQ_2025_v25n5_11_5_t0002.png 이미지

4개 모델의 표기를 M2, M1(LLM rerank), M3(Ref.3), M1-Direct 라고 사용하는 이유는 계보를 보이기 위해 ‘직접(Direct)’라고 사용한다. M1-Direct는 같은 계열이잠 재랭크(점수)가 아니라 직접 예측(라벨)을 한다. 이는 “M1의 직접 예측 변형‘이라는 메시지를 이름에서 바로 전달하려는 의도이다. 이처럼 참고문헌의 매핑과 추적성을 위해서 이과 같은 표기법을 사용하였다. M3는 Ref.3(생성→임베딩)고 일치, M1-Direct는 Ref..4(직접 TID 예측)과 일치한다. 같은 LLM 계열이라도 재랭크(M1) vs 직접 예측(M1-Direct)로 나눠야 관련 연구/어블레이션 표와 1:1 매핑이 정확히 부합된다.

SOBTCQ_2025_v25n5_11_6_f0001.png 이미지

(그림 4) 결정(게이팅→분기→융합/선택)의 흐름도

어블레이션 표(ablation table)는 모델·파이프라인을 이루는 구성요소를 하나씩 껐다 켰다 하면서, 각 요소가 성능에 얼마나 기여하는지 정량적으로 보여주는 비교 표이다. 쉽게 말해, “이 부품을 빼면 점수가 얼마나 떨어지나?”를 단계별로 검증하는 실험 기록이다. 어블레이션 표는 ‘무엇이 성능을 만들었는지’를 증명하는 핵심 도구이다. 본 연구의 하이라이트인 결정 계층의 게이팅·LLM 분기·융합 설계가 실제로 성능과 비용을 어떻게 바꾸는지를 투명하게 보여주며, 운영 전략을 선택할 수 있게 해준다. <표 6>은 어블레이션의 구성과 기대효과를 나타낸 것이다.

<표 6> 어블레이션(Ablation) 구성 및 기대효과

SOBTCQ_2025_v25n5_11_6_t0001.png 이미지

4. 실험 설계 및 결과 분석

4.1 실험 환경 및 모델 구성

<표 7>은 6개 실험 모델별 측정 지표 결과이다. 6개 실험 모델은 (a) 임베딩 기준 → (b) 게이팅 변형 (1) → (c) 게이팅 변형(2) → (d) LLM 재랭크 → (e) 생성-임베딩 → (f) Direct 휴리스틱으로 실험하였다.

<표 7> 모델별 지표

SOBTCQ_2025_v25n5_11_6_t0002.png 이미지

RMF-ATT&CK 매핑 아키텍처 설계에 대한 실험 증명은 구글의 개발환경이 코랩(Colab)에서 수행하였다. 실험환경에 대한 세부내용은 <표 8>과 같다.

<표 8> 실험 환경

SOBTCQ_2025_v25n5_11_6_t0003.png 이미지

4.2 평가 지표 및 기준

평가 지표와 기준은 대규모언어모델(LLM)을 성능을 비교하는 지표를 기준으로 평가하였다 평가 지표 및 기준은 <표 9>와 같다.

<표 9> 평가 지표 및 기준

SOBTCQ_2025_v25n5_11_7_t0001.png 이미지

4.3 RMF-ATT&CK 매핑 실험 결과

본 절에서는 NIST SP 800-53 Rev.5 통제(Controls)와 ATT&CK v12.1 기법(Techniques) 간 매핑을 대상으로, (a) 임베딩 기반 기준선(M2)과 (b) 전술 게이팅을 결합한 변형(M2+Gating)의 성능을 비교한다. 평가는 정답(Gold) 매핑(CTID, v12.1↔R5)을 기준으로 P/R/F1@K 및 Coverage(0–1)를 사용하고, 부분일치(변형 기법–기본 기법)에는 0.5 가중 신용(credit)을 부여하였다.

4.3.1 M2(임베딩만) : Top-M→Top-K 기준선

Sentence-BERT(MiniLM) 임베딩으로 통제 설명-기법 설명간 코사인 유사도로 계산하고, 각 통제별 Top-M(200) 후보에서 Top-K를 선택하였다. P/R/F1@K는 <표 8>을 기준으로 K가 증가할수록 재현율(Recall)이 점진 상승, 정밀도(Precision)는 완만히 하락하는 전형적 형태를 보였다.

곡선(그림 5-a)에서 최적 K≈50, F1≈0.187로 관찰되며, 이는 Top-K를 크게 가져갈수록 정답 후보가 포함될 확률은 높아지되 오검출이 늘어 정밀도가 희석되는 트레이드오프를 반영한다.

SOBTCQ_2025_v25n5_11_7_f0002.png 이미지

(그림 5) 전술 게이팅과 자카드(Jaccard)의 효과 비교

4.3.2 전술 게이팅(M2+TacticGate) 및 자카드(Jaccard) 보강(M2+GateJ)

통제 패밀리별 합리적 전술 범주로 1차 필터링한 M2+TacticGate와 데이터소스/미티게이션 키워드의 자카드(Jaccard) 유사도를 추가한 M2+GateJ를 비교했을 때, 모두 소량 K(≤5) 구간에서 정밀도(Precision)이 유의하게 개선되었다(그림 5-b, 그림 5-c).

특히, 두 변형 모두 P@1은 약 0.22→0.29 수준으로 상승(K=1 상위 후보의 정확도 개선)하고, F1은 K가 작을수록 개선, K≥10에서는 기준선 대비 소폭 열세를 보였다. 이는 게이팅으로 일부 진양성 후보도 함께 절단되며 Recall 성장 속도가 둔화된 영향이다. 한편 표 0(empty_breakdown.json)에 따르면 전술 게이팅·자카드(Jaccard)·백오프 적용 후에도 empty_ratio=0.0으로 계산되어, Coverage=1.0이 유지되었다. 이는 백오프 정책으로 게이팅 후 빈 후보가 발생할 경우 전술 게이트 결과로 안전하게 대체되었음을 의미한다.

(그림 5-a)에서 M2는 K가 커질수록 재현율(Recall)이 증가하고 정밀도(Precision)이 감소한다. 반면 (그림 5-b/c)에서 전술 게이팅과 전술+자카드(Jaccard) 그림에서 게이팅은 작은 K구간에서 Precision을 끌어올린다. 게이팅은 소량 K에서 정밀도(Precision) 이득을 주지만, K가 커질수록(≥10) 재현율(Recall) 성장 둔화로 F1은 기준선 대비 소폭 낮다.

4.3.3 LLM/휴리스틱 계열

(그림 6-a)에서 LLM-재랭크(M1)은 K≤5 구간에서 정밀도가 매우 높게 시작(K=1 ≈0.24 내외)하며, K가 커질수록 급격히 하락한다. 이 의미는 ‘Top-few 선택 문제’에서 상위 랭크 품질 향상에는 유리하나, 폭넓은 재현율을 요구하는 대형 K 세팅에는 불리하다.

SOBTCQ_2025_v25n5_11_7_f0001.png 이미지

(그림 6) 전술 게이팅과 자카드(Jaccard)의 효과 비교

(그림 6-b)에서 생성→임베딩(M3)은 LLM-재랭크(M1) 대비 근소하게 높은 F1@5 값을 산출한다. 이는 통제문 요약과 정규호가 표현 괴리 완화에 기여한다는 의미이다. K가 커지면 M1과 유사하게 정밀도가 희석이 된다.

(그림 6-c)에서 직예측 휴리스틱(M1-Direct)는 상이 K가 작을 때 저비용 백업 채널로서 동작한다. 게이팅으로 희박해진 통제에 후보를 채워주는 용도에 적합하다.

4.3.4 후보 품질 분포와 비용 절감(=후속 LLM 재랭크 비용)

원천 통계에 따르면, 게이팅 적용 시 통제 당 후보 수의 중앙값과 하위 분위수(Q25)가 감소하여 저품질 후보의 초반 절단이 정량적으로 확인되었다. 이는 후속 LLM 재랭크의 입력 크기 축소(비용 절감)와 초기 Top-K 정밀도 개선으로 직접 연결된다.

4.3.5 오류 해석

과탐(FP)으로 나온 경우는 SI-7(10): ‘소프트웨어/펌웨어 무결성’ 통제에서 M2가 T1542.002(Component Firmware)를 과대평가하였다. 통제 문구의 “boot/firmware” 키워드가 기법 이름과 강하게 겹치지만, 실제 골드 매핑에는 해당 세부기법이 포함되지 않아 FP로 집계되었다(유사 패턴이 M2+GateJ에도 잔존).

또 다른 과탐(FP)으로는 IA-2(2): 다요소 인증 보완 통제에서 T1111(MFA Interception)을 상위로 올리는 경향. 완화 정책 유형 통제에 대해 공격 기법명과 키워드가 직접 겹치며 생긴 과탐 사례가 있었다.

미탐(FN)은 CP-2: 재해/비상계획 수립 통제는 골드 기준으로 T1486/T1490/T1491(영향‧파괴 계열)과 연결되나, M2 및 M2+GateJ는 조직/정책 단어에 끌려 T1615/그룹 정책 발견 등으로 분산되어 Top-K에 선택되지 못하였다. 본 연구에서 주는 시사점은 전술 게이팅만으로는 정책형 통제의 의미 공간을 충분히 보정하기 어렵다. 이후 결합 전략 자카드(Jaccard) 임계 완화+백오프, LLM 재랭크/생성분기)로 회복 여지가 크다.

4.4 모델별 요약

4개의 모델을 정의하고 매핑 실험간에 2개 모델을 응용하여 실험하였다. RMF-ATT&CK 매핑 정확성을 높이는 모델과 파이프라인을 설계하기 위한 다양한 방법을 실험하였다. 실험에서 얻을 수 있는 시사점은 2-단계 파이프라인을 활용하는 것이다. M2(+게이팅)로 Top-M을 만들고 → M1 또는 M3로 Top-K(작게)를 정밀화하는 것이다. 정밀하게 매핑하는 목적이면 M1이 우선이고, 표현 괴리/정책형 통제가 많다면 M3가 우선이다. 비용 제약이 크고 커버리지 확보가 우선이면 M2(+게이팅) 단독 운용하면서 M1-Direct를 백업 채널로 하는 것이 유리하다. K-튜닝이 필요할 경우에는 업로드된 곡선 공통으로 최적 K는 LLM 분기에서 5, 임베딩 계열에서는 50으로 관찰되었으므로 배포 환경에서는 업무 목적(탐지/감사/컨설팅)별 K-프로파일을 분리해 운용하는 것이 유리하다. 모델별 실험 결과 특징과 적합한 사용 용도를 정리하면 <표 10>과 같다.

<표 10> 모델별 요약표

SOBTCQ_2025_v25n5_11_9_t0001.png 이미지

5. 결론

본 연구는 NIST RMF 보안통제와 MITRE ATT&CK 기법 간 자동으로 매핑하는 기법을 제안하고 평가하였다. 매핑 기법은 BERT 및 대형언어모델(LLM) 기반 의미 유사도 분석을 적용하였다. 기존 수작업 매핑의 커버리지 부족 문제를 해결하기 위해 통제 설명과 기법 설명의 임베딩 유사도를 기반으로 후보를 생성하고, 전술/데이터소스 게이팅과 LLM 재랭킹·생성 모델을 결합한 하이브리드 구조를 제안하였다. 실험 결과, LLM 기반 접근법은 SBERT보다 정밀도와 커버리지에서 우수했으며, 게이팅은 후보 수를 37% 줄이며 LLM 사용률을 절감하고 P@1을 개선했다. 특히, ‘임베딩 후보 + LLM 재랭크’의 2단계 파이프라인은 정확성과 효율성을 균형 있게 달성하여, 실무 적용 가능성을 입증하였다. 이 방법론은 기존 수동 매핑의 한계인 커버리지와 신뢰도를 개선하며, 위험관리와 실제 위협 정보를 체계적으로 연계할 수 있는 확장 가능한 자동화 절차를 제시했다는 점에서 의의가 있다.

References

  1. P. N. Wudali, "Rule-ATT&CK Mapper (RAM): Mapping SIEM Rules to TTPs Using LLMs", arXiv preprint, arXiv:2502.02337, 2025.
  2. M. Abderehman, "VMTT&RP: Automated Vulnerability Mapping with MITRE ATT&CK TTPs and Risk Prioritization", Research Square (preprint), 2025. DOI : 10.21203/rs.3.rs-6893438/v1
  3. C. Zhang, "VTT-LLM: Advancing Vulnerability-to-Tactic-and-Technique Mapping through Fine-Tuning of Large Language Model", Mathematics (MDPI), Vol. 12, p. 1286, 2024.
  4. P. Rafiey, "Mapping Vulnerability Description to MITRE ATT&CK Framework by LLM", Research Square (preprint), 2025. DOI : 10.21203/rs.3.rs-4341401/v2
  5. P. MMRAlves, "Leveraging BERT's Power to Classify TTP from Unstructured Text", In 2022 Workshop on Communication Networks and Power Systems (WCNPS), IEEE, pp. 1-7, 2022.
  6. B. Al-Sada, "Mitre attack: State of the art and way forward", Comput. Surveys, Vol. 57, No. 1, pp. 1-37, 2024.
  7. B. Ampel, "Linking common vulnerabilities and exposures to the MITRE ATT&CK framework: A self distillation approach", arXiv preprint arXiv:2108.01696, 2023.
  8. J. Baker, "CVE+MITRE ATT&CK to understand vulnerability impact," MITRE-Engenuity, Medium, 2021.
  9. I. Branescu, "Automated mapping of common vulnerabilities and exposures to MITRE ATT&CK tactics", Information(Switzerland), Vol. 15, No. 4, 2024.
  10. O. Grigorescu, "CVE2ATT&CK: BERT based m appin g of cve s to MI TRE ATT&CK techniques", Algorithms, Vol. 15, No. 9, 2022.
  11. B. E. Strom, "MITRE ATT&CK: Design and philosophy, In Technical Report", The MITRE Corporation, Bedford, MA, USA, 2018.
  12. NIST, "Security and Privacy Controls for Information Systems and Organizations", SP 800-53 Rev5., 2020.
  13. MITRE, Available: https://attack.mitre.org/matrices/enterprise/, Accessed: 15 Sep. 2025.
  14. Security Control Framework Mappings to ATT&CK, Available: https://github.com/center-for-threat-informed-defense/attack-control-framework-mappings/tree/main, Accessed: 15 Sep. 2025.