1. 서론
사물인터넷(Internet of Things, IoT)은 국방 혁신 및 국방력 강화를 위해 적극적으로 적용이 검토되고 있는 기술 중 하나이다. 최근에는 인공지능(Artificial Intelligence, AI) 기술과 결합되어 지능형 사물인터넷(Artificial Intelligence of Things)으로 진화하고 있어 향후 활용은 더욱 다양해질 것으로 전망된다.
그러나 IoT 기술은 연결성을 최우선 목표로 하며, 활용되는 기기들의 자원제약적 특성으로 인해 사이버 보안 대책을 적용하기가 어려워 각종 사이버위협에 손쉽게 노출될 수 있다. 따라서 IoT 기술의 국방분야 적용을 확대하기 위해서는 사이버보안 대책에 대한 고려도 반드시 병행되어야만 한다. 특히 최근의 사이버공격들이 방대한 데이터와 이를 처리·분석하는 AI 알고리즘 자체를 주요 표적으로 삼는 경향이 점점 더 강해지고 있어 국방 IoT(M-IoT)를 위한 사이버보안 대책을 마련할 때 신중한 접근이 필요하다.
한편, 사이버보안의 핵심이라 할 수 있는 침입탐지 분야에서 AI 기반 모델은 방대한 위협 인텔리전스를 신속하게 분석해 잠재적 위협과 취약점을 정확하게 식별한다는 장점을 가져 활용 범위가 확대되고 있다. 그러나 IoT 환경에서는 기기의 계산 성능 및 에너지 제약으로 인해 복잡한 AI 알고리즘을 적용하는 것이 제한된다. 이러한 이유로 M-IoT 환경에서의 AI 기반 침입탐지 모델은 경량화가 필수적이나, 경량화된 침입 탐지 모델은 새로운 보안 취약성을 초래할 수 있다.
경량화된 AI 기반 침입탐지 모델은 제한된 연산 자원과 단순화된 구조로 인해 탐지 정확도 및 방어 능력에 한계가 발생할 수 있으며, 특히 적대적 공격(adversarial attack)에 상당히 취약하다. 공격자는 IoT 환경에서 발생하는 방대한 정상 트래픽 내에 미세한 교란을 삽입해 탐지모델을 속이거나 허위경보 생성을 유도하여 시스템의 신뢰성을 저하시킬 수 있다[1][2]. 또한, 적대적 공격의 대표적 유형인 회피(evasion) 공격[3]을 통해 입력 데이터에 사람이 인지하기 어려운 교란을 추가해 탐지모델이 공격을 정상 트래픽으로 오인하게 만드는 것도 가능하다.
AI 기반 침입탐지 모델의 적용이 증가함에 따라 적대적 공격의 기법은 더욱 정교해지고 있으며, 그에 대한 대응 기법 역시 활발하게 연구되고 있다. 그러나 적대적 공격에 대한 대응을 다뤘던 많은 선행 연구들[4-10]은 침입탐지 모델이 구축된 이후 강건성을 강화하는데 초점을 맞추고 있다. 모델 학습에 사용된 데이터에 대한 기밀성을 사전에 확보해 공격자의 접근을 원천적으로 차단하는 선제적 방어에 관한 연구는 상대적으로 소홀하다.
그리고 적대적 공격을 방어하기 위해서는 적대적 강건성(adversarial robustness)과 데이터 프라이버시(data privacy)가 동시에 확보되어야 한다. 그러나 두 요소를 개별적으로 다루는 연구는 많지만 통합하여 고려한 연구는 없다. 적대적 강건성 또는 데이터 프라이버시 중 하나의 요소에만 치중한 결과 다른 요소가 미흡해지거나 침입탐지 성능이 저하되는 현상도 발생한다. 그에 더해 실제 배치 시 필요한 계산 비용·추론 지연·학습 시간 등에 대한 분석 역시 미흡하다.
일부 연구들[4][7][8][10]은 적대적 학습이 AI 기반 침입탐지 모델의 적대적 강건성 향상에 도움이 될 수 있음을 입증하였으나, 적대적 학습이 정상적인 테스트 데이터에 대한 분류 성능 저하를 동반할 수 있다는 점을 간과하고 있다. 적대적 공격에 대한 방어는 미세 교란이 포함된 적대적 데이터가 학습되었음에도 불구하고 정상적인 데이터에 대해서는 높은 탐지 정확도를 유지할 수 있어야 한다.
이러한 문제 인식 하에, 본 연구는 경량화된 기계 학습 기반 침입탐지 모델을 기반으로 적대적 강건성 및 데이터 프라이버시를 동시에 보장할 수 있는 접근 방법을 제안한다. 제안하는 접근방법은 우선 기계학습 기반 침입탐지 모델이 적대적 학습을 실시할 적대적 예제(adversarial samples)를 생성한다. 이어서 적대적 예제를 기반으로 전이학습을 수행하는 과정에서 차등 프라이버시(Differential Privacy, DP) 최적화 기법을 적용하여 적대적 강건성을 강화하면서 학습 데이터에 대한 기밀성도 확보한다. 그리고 하이퍼파라미터 미세 조정을 통해 계산 효율성도 최적화하여 자원 제약이 큰 국방 IoT 환경에서의 적용 가능성을 높인다.
이후 논문의 구성은 다음과 같다. 2장에서는 연구에서 활용한 MQTTset 데이터세트, LightGBM 모델, 적대적 학습 기법 및 평가 데이터 생성 방법에 대해 설명하고, 선행연구를 분석한다. 3장에서는 제안하는 기법 및 실험 절차를 제시하며, 4장에서 실험 환경을 설명한다. 5장에서는 실험 결과를 분석하고 기존 연구와의 차별성을 논의한 후, 6장에서 결론을 맺는다.
2. 관련연구
2.1 MQTTset 데이터세트
MQTT(Message Queuing Telemetry Transport) 프로토콜은 센서나 임베디드 시스템 등 자원이 제한된 IoT 기기 간 효율적인 데이터 교환을 위해 설계된 경량 발행-구독 기반 메시징 프로토콜이다. 브로커(Broker)를 매개로 메시지를 전달하여 불안정한 네트워크 환경에서도 안정적인 통신을 보장하며, 이러한 특성으로 인해 스마트 홈, 산업용 IoT, 커넥티드 차량 등 다양한 IoT 서비스는 물론, 국방 IoT 환경에서도 표준 프로토콜로 널리 활용되고 있다[11].
본 연구에서는 MQTT 브로커와 다수의 IoT 클라이언트 간 실제 통신 환경에서 정상 및 악성 트래픽을 모두 수집하여 가공 후 생성한 MQTTset 데이터 세트[12]를 사용하였다. 해당 데이터세트는 IoT 환경에서의 침입탐지 연구를 지원하기 위해 2020년 공개되었으며, 총 33개의 특징과 라벨을 포함한다. 정상 트래픽은 다양한 IoT 기기들의 동작 과정에서 수집되었다. 악성 트래픽은 DoS, Bruteforce, Malformed data, SlowITe 및 Flooding 등 5가지 공격 유형으로 구성되어 있다. 원본 데이터세트의 클래스별 데이터 분포는 <표 1>에서 보는 바와 같다.
<표 1> 원본 MQTTset 데이터세트 세부 구성

2.2 LightGBM
LightGBM은 Microsoft 사에서 개발한 Gradient Boosting 기반 모델로서, 대규모 데이터세트 처리에서 빠른 학습 속도와 높은 예측 정확도를 보여준다[13]. 그리고 GOSS(Gradient-based One-Side Sampling) 및 EFB(Exclusive Feature Bundling) 두 가지 알고리즘을 통해 학습 효율성을 크게 향상시키면서 메모리 사용량을 절감한다. GOSS는 손실값이 큰 데이터에 높은 우선순위를 부여하고, 손실값이 작은 일부 데이터만 선택적으로 샘플링함으로써 학습 시간을 단축하면서도 예측 성능 저하를 최소화한다. EFB는 고차원 희소 데이터에서 상호 배타적인 특징을 그룹화하여 특성 차원과 계산 복잡도를 줄이고 학습 속도를 향상시킨다. 또한, LightGBM 모델은 손실 감소폭이 가장 큰 리프(leaf) 노드를 우선적으로 확장하는 Leaf-wise Tree Growth 전략을 통해 트리를 더 깊고 정밀하게 구축한다.
GOSS, EFB 및 Leaf-wise Tree Growth 전략이 결합된 LightGBM 모델은 기존 그래디언트 부스팅 계열의 모델들 대비 빠른 학습 속도와 낮은 메모리 사용량을 실현하는 동시에 분류 성능도 개선되었다. 이러한 장점으로 인해 LightGBM 모델은 높은 처리 성능을 유지하면서도 경량화가 가능해 자원 제약적인 시스템 환경에서 활용하기에 적합하다. 이에 본 연구에서는 LightGBM 모델을 기반으로 침입탐지 모델을 구축하고 실험에 활용하였다.
2.3 적대적 학습
적대적 학습은 적대적 환경에서 모델의 강건성을 향상시키는 대표적인 기법이다. 이 기법은 의도적으로 교란된 입력, 즉, 적대적 예제를 학습 데이터에 포함시켜 모델을 강화한다. 학습 과정에서 모델을 이러한 예제에 반복적으로 노출시킴으로써, 공격 상황에서도 더 정확한 예측이 가능해진다. 대표적인 적대적 예제 생성 기법에는 FGSM(Fast Gradient Sign Method), PGD(Projected Gradient Descent), DeepFool(DF), DP-SGD(Differentially Private Stochastic Gradient Descent) 등이 있다.
FGSM은 고차원 공간에서 단일 그래디언트 계산만으로 적대적 예제를 생성하는 기법이다[1]. 핵심 원리는 입력 데이터에 대해 손실 함수가 최대화되는 방향으로 입력을 미세하게 교란하여 잘못된 분류를 유도하는 것이다. 교란 생성 과정은 수식 (1)–(5)와 같이 정의된다.
xadv = x + η (1)
w⊤xadv = w⊤x + w⊤η (2)
η = sign(w) (3)
η = ϵsign(∇xL(θ, x, y)) (4)
xadv = x + ϵsign(∇xL(θ, x, y)) (5)
먼저 원본 입력 x로부터 초기 적대적 예제 xadv를 생성한다(수식 1). 선형 분류기의 경우, 적대적 예제는 가중치 벡터 𝜔와의 내적 관계로 설명할 수 있다(수식 2). w⊤η을 최대화하기 위해 교란 벡터 η는 가중치 벡터와 동일한 방향으로 정렬되어야 하며, 이를 단순하고 계산 효율적으로 근사하기 위해 부호 벡터 sign(w)를 사용한다(수식 3). 마지막으로, 교란의 크기를 제어하는 하이퍼파라미터 𝜖을 곱해 최종적인 적대적 예제 xadv가 생성된다(수식 4 및 5).
PGD는 반복적 방식으로 적대적 예제를 생성하는 기법이다[2]. FGSM은 단일 단계에서만 교란을 생성하는 반면, PGD는 사전에 정의된 스텝 크기 ⍺를 각 반복 단계 t마다 적용해 적대적 노이즈를 점진적으로 갱신한다. 또한, 교란의 크기가 허용된 범위 ϵ을 초과하지 않도록 개별 단계마다 투영(projection) 연산을 수행하여 입력을 제한하며, 계산 과정은 수식 6에서 확인할 수 있다.
\(\begin{align}x_{adv}^{t+1}=\prod_{B_{\epsilon}(x)}(x^t+{\alpha}sign(\triangledown_xL(\theta,x^t,y)))\end{align}\) (6)
DeepFool(DF)은 분류기의 결정 경계를 반복적으로 선형화하고, 입력을 최소한의 교란으로 해당 경계 너머로 밀어내어 적대적 예제를 생성하는 기법이다[14]. FGSM과 PGD가 사전에 정의된 교란 크기와 방향에 의존하는 것과 달리, DF는 모델의 예측을 변경하는 최소 교란(minimal perturbation)을 찾는다.
미분 가능한 분류기 f가 주어지면, DF는 각 반복 단계에서 분류기를 선형함수로 근사하고 분류 결정을 변경하는 최소 교란 ηt를 계산한다. 이 과정은 입력이 결정 경계를 넘어설 때까지 반복 수행되며, 최종적인 적대적 예제는 수식 (7)과 같이 계산된다.
xadv(t+1) = xadvt + ηt (7)
여기서 ηt는 t단계에서 분류기를 선형 근사하여 입력을 가장 가까운 결정 경계로 투영함으로써 계산된다. DF는 인지하기 어려운 최소한의 교란을 생성할 수 있어, FGSM이나 PGD보다 더욱 정밀한 수준에서 모델의 강건성을 평가하는 데 널리 활용된다.
DP-SGD는 데이터 프라이버시 보호와 강건성을 동시에 보장하기 위해 고안된 최적화 기법이다[15]. 우선 각 반복에서 무작위로 샘플링된 미니배치 xi에 대한 손실 함수의 그래디언트를 계산한다. 이후 민감도를 줄이기 위해, 개별 그래디언트의 L2norm이 사전에 정의된 임계값 C를 초과하면 이를 클리핑하여 민감도를 줄인다(수식 8). 이어서 평균 그래디언트에 평균 ‘0’, 분산 ‘σ2C2'인 가우시안노이즈를 추가한다. 여기서 σ는 노이즈 배율(noise multiplier)이고, C는 클리핑 기준 임계값이다. 모델 파라미터는 미니배치 크기 L로 평균화된 그래디언트를 기반으로 업데이트된다(수식 9). 최종적으로 노이즈가 주입된 그래디언트가 확률적 경사 하강법을 통해 적용되어 모델 파라미터가 갱신된다(수식 10).
\(\begin{align}\bar{g}_{t}\left(x_{i}\right)=g_{t}\left(x_{i}\right) / \max \left(1, \frac{\left\|g_{t}\left(x_{i}\right)\right\|_{2}}{C}\right)\end{align}\) (8)
\(\begin{align}\tilde{g}_{t}=\frac{1}{L}\left(\sum_{i} \bar{g}_{t}\left(x_{i}\right)+N\left(0, \sigma^{2} C^{2} I\right)\right)\end{align}\) (9)
\(\begin{align}\theta_{t+1}=\theta_t-\eta{\overline{g_t} }\end{align}\) (10)
학습이 완료되면 알고리즘은 최종 모델 파라미터 θt+1와 함께 누적된 프라이버시 비용 (ϵ, δ)을 반환한다. 이는 모델이 (ϵ, δ)-차등 프라이버시 조건을 만족함을 보장하며, 개별 데이터 샘플 단위에서 노출 위험을 평가할 수 있게 한다. 차등 프라이버시는 파라미터 ϵ으로 프라이버시 손실을 제한하고, 위반 확률이 δ를 넘지 않도록 함으로써 학습 데이터 내에서 단일 샘플이 모델 출력에 미치는 영향을 최소화한다.
학습 과정 전반에서 누적 프라이버시 손실을 추적하기 위해 다양한 프라이버시 accounting 메커니즘이 활용된다. DP-SGD에서는 프라이버시 손실 확률변수의 고차 모멘트를 분석하여 정밀한 상한을 제공하는 Moments Accountant 방식을 사용한다. 최근에는 Rényi divergence를 기반으로 차등 프라이버시를 일반화한 Rényi Differential Privacy (RDP) accounting 방식이 자주 적용되며, 이는 단순성, 확장성, 분석 정밀성 측면에서 강점을 지닌다.
2.4 ZOO(Zero-Order Optimization) 공격
ZOO 공격은 모델 파라미터나 그래디언트에 직접 접근할 수 없는 블랙박스(black-box) 환경에서 널리 활용되는 적대적 공격 기법이다[16]. 모델 출력만을 기반으로 최적화 문제를 해결하기 때문에 0차 최적화(zero-order optimization) 방법으로도 분류된다. 또한, 입력 질의에 대한 모델 응답을 이용한 유한 차분(finite difference) 기법으로 그래디언트를 근사하여, 미분 가능한 모델이 아니어도 교란을 유도할 수 있다.
공격을 수행하는 절차는 다음과 같다. 우선, 표적 입력 근처에서 두 개의 입력 샘플을 생성하고, 이에 대응하는 출력값을 이용해 각 입력 차원에 대한 그래디언트를 유한 차분 방식으로 추정한다. 추정된 그래디언트를 활용하여 표준 최적화 기법을 통해 입력을 반복적으로 조정함으로써 오분류(misclassification)를 유도한다. 이러한 과정을 반복함으로써 블랙박스 환경이나 미분이 가능하지 않은 모델에서도 효과적으로 적대적 예제를 생성할 수 있다.
본 연구에서는 적대적 학습 과정에서 데이터 프라이버시를 보장하기 위해 DP-SGD 최적화 기법을 적용한다. 이에 따라 공격자는 모델의 내부 구조나 학습 데이터에 접근할 수 없는 블랙박스 환경에서 공격을 수행할 것으로 가정한다. 이러한 가정하에, 본 실험에서는 원본 테스트 데이터세트를 대상으로 ZOO 공격을 적용하여 강건성을 평가할 수 있는 적대적 평가 데이터를 구성한다.
2.5 선행연구 분석
적대적 공격에 대한 대응과 관련된 선행연구들은 다음과 같다.
Roshan 등[4]은 C&W 기반 공격에 대응하기 위해 2단계 방어 기법을 제안하였다. 학습 단계에서는 가우시안 데이터 증강을 활용한 적대적 학습을 실시했고, 테스트 단계에서 Feature Squeezing을 적용했다. CIC-DDoS-2019 데이터세트 기반 실험에서 효과를 입증했으나, 성능 비교 지표는 제한적이었다.
Alkadi 등[5]은 IoT 환경을 대상으로 RobEns (Robust Ensemble Adversarial Machine Learning)를 제안하였다. 6종의 IDS 모델과 3개 데이터세트(UNSW-NB15, ToN-IoT, Edge-IoT)를 통해 적대적 강건성을 평가하였으며, 특히 블랙박스 공격에 대해 탐지 정확도 100%를 달성하였다.
Alahmed 등[7]은 PCA/RFE(Recursive Feature Elimination) 기반 전처리와 GAN(Generative Adversarial Neural Networks)을 결합한 적대적 학습을 제시했으나, RFE(48.7%), PCA(75.9%)로 정확도가 낮고 계산 비용이 높다는 한계를 보였다. Khamis 등[8]은 PCA/RFE와 Min-Max 최적화를 ANN, CNN, RNN 모델에 적용하여 성능을 개선하였다.
Xiong 등[9]은 공격자, 방어자 및 학습모듈을 모두 포함하는 AIDTF(Adversarial training framework for network intrusion detection)를 제안하였다. FGSM, PGD, JSMA(Jacobian-based Saliency Map Attack) 공격에 대한 적대적 정확도에서 최소 5.85%p 향상, 94% 이상의 강건성을 보였으나, 정상 데이터에 대한 탐지율은 91.12%에 그쳤다.
Sharma 등[10]은 PGD(화이트박스)와 ZOO, Boundary, HopSkipJump(블랙박스) 공격의 효과성을 기계학습 기반 침입탐지 모델의 취약성 평가를 통해 비교하였다. 그 결과, ZOO는 특히 고도화된 모델에 대해 효과적인 공격 성능을 보였다. 그리고 기계학습 기반 침입탐지 모델은 그래디언트에 의존하지 않는 블랙박스 공격에 취약함을 확인하였다.
Debicha 등[17]은 PGD 공격 강도와 적대적 학습 비율에 따른 성능 트레이드오프를 분석했다. 공격의 강도가 높아질수록 강건성은 향상되었으나, 정상 데이터에 대한 정확도가 30% 이상 크게 감소하여, 적대적 데이터 비율과 공격 강도의 균형이 필요함을 보였다.
IoT 침입탐지 모델 연구 중 본 연구와 동일하게 MQTTset 데이터세트를 활용한 사례는 다음과 같다. 다만, 이하에서 소개하는 연구들은 동일한 데이터세트를 사용하였더라도, 본 연구의 핵심 목표가 데이터 프라이버시 확보와 적대적 강건성 강화에 있기에 직접적인 성능 비교 대상으로 삼지는 않는다.
Ferrag 등[18]은 RNN·CNN·DNN을 중앙집중식 학습과 연합학습 환경에서 비교하여, 연합학습이 데이터 프라이버시 보장 및 성능 향상 측면에서 모두 우수하다는 사실을 확인하였다. Lee 등[19]은 LightGBM에 주성분 분석(PCA)을 적용하여 단 5개의 주성분만 사용해도 전체 특징을 사용했을 때(93.98%)와 유사한 정확도(93.96%)를 유지할 수 있음을 입증하였다.
Alzahrani 등[20]은 CNN과 LSTM의 결합 모델을 제안하였으며, KNN(80.82%) 및 LDA(76.60%) 대비 향상된 98.94%의 정확도를 달성하였다. Kim 등[21]은 선형판별분석(Linear Discriminant Analysis, LDA)을 통해 특징 차원을 축소한 뒤 LightGBM으로 분류를 수행하여 이진분류는 99.08%, 다중분류는 99.76%의 정확도를 달성하였다.
3. 제안 방법
본 연구는 선행연구들의 한계를 극복하기 위해 DP-SGD 기반 최적화와 적대적 전이학습을 결합하여 침입탐지 모델을 구축하는 기법을 제안한다. 제안하는 기법을 통해 달성하고자 하는 목표는 M-IoT 환경하에서 운용할 침입탐지 모델의 데이터 프라이버시와 적대적 강건성을 강화하는 동시에 자원 제약적인 IoT 환경에 적합한 계산 효율성을 달성하는 것이다. 제안하는 침입탐지 모델의 적대적 강건성에 대한 평가는 블랙박스 시나리오에 특화된 ZOO 공격을 기반으로 종합적인 평가 전략을 적용하여, 실제 적대적 환경을 보다 현실적으로 반영하면서 수행한다.
3.1 실험 설계
실험 절차는 (그림 1)에서 보는 바와 같으며, 원본 MQTTset 데이터세트는 실험을 위해 학습용과 테스트용을 80:20의 비율로 분할하였다.

(그림 1) 실험 절차
적대적 학습의 절차는 다음과 같이 수행한다. 우선, 두 가지의 MLP 기반 Shadow 모델을 구축하고 각각 Adam 및 DP-SGD 기반의 최적화를 적용하여 원본 학습용 데이터세트로 학습시킨다. 이후, 학습된 모델들에 대해 PGD 및 DeepFool 공격을 사용하여 적대적 예제를 생성한다. 이어서 생성된 적대적 예제를 원본 학습 데이터와 결합하여 증강된 학습 데이터세트를 구성하고, 침입탐지 모델을 증강 데이터세트를 이용해 전이학습을 실시한다. 전이학습이 완료된 모델은 원본 평가 데이터세트와 ZOO 공격을 통해 생성된 적대적 예제를 사용하여 병행 평가한 후, 각 모델의 성능을 비교하여 제안하는 DP-SGD 기반 적대적 전이학습 모델의 효과성을 분석한다.
전이 학습 단계에서는 Carlini & Wagner (C&W) 공격 대신, PGD와 DeepFool을 활용하였다. 그 이유는 다음과 같다. 첫째, DeepFool은 L2 공간에서 최소 교란을 생성하도록 설계되어 있으며, 이는 현실적이고 미세한 공격 시나리오에서 모델 강건성을 평가하려는 본 연구의 목적과 부합한다. 둘째, C&W에 비해 DeepFool은 계산 효율성이 높고 하이퍼파라미터 튜닝에는 덜 민감하여 다수의 모델 구성에 대한 대규모 재학습 실험에 적합하다. 셋째, PGD와 DeepFool은 상호 보완적 특성을 제공한다. PGD는 L∞에서 손실을 최대화하는 반면, DeepFool은 L2 기준에서 교란을 최소화한다. 따라서 두 공격을 함께 사용하면 더 넓은 범위의 적대적 상황을 포괄할 수 있으며, 이는 적대적 학습의 강건성을 강화하는 효과를 제공한다.
4. 실험 환경 및 구성
4.1 실험 환경
모든 실험은 Google Colab Pro 환경(Python 3.10, T4 GPU, RAM 51GB)에서 수행되었다. 적대적 예제 생성을 위해 IBM Research에서 개발한 오픈소스 라이브러리인 Adversarial Robustness Toolbox (ART)[22]를 사용하였다.
4.2 적용 모델
실험에서는 IoT 기기 특유의 제한된 연산 자원을 고려해 입력되는 데이터의 차원을 대폭 축소한 경량 침입탐지 모델을 구현하였다. 본 연구에서 제안하는 침입탐지 모델은 연구진의 선행연구[21]에서 소개된 구조를 기반으로 한다. 그러나 전처리 과정에서 LDA를 적용하기에 앞서 데이터 표준화(standardization) 기법을 추가하여 각 특성의 분산을 동일하게 맞춤으로써 LDA의 고유값 분해 및 행렬 연산을 안정적으로 수행할 수 있도록 개선하였다. 이후, 모델 경량화와 학습 시간 단축을 위해 LDA를 통해 입력되는 특성의 차원을 축소하였다. 학습 알고리즘으로는 메모리 사용량이 적고 실행 속도가 빠르며 높은 분류 정확도를 보이는 LightGBM을 채택하였다.
실험 모델의 결과 비교를 위해 본 연구진은 추가로 랜덤 포레스트(Random Forest, RF) 기반 침입탐지 모델을 구현하였다. 그러나 RF 기반 모델은 학습 및 추론 속도에서 다소 우위를 보이긴 했지만, 정확도, 적대적 강건성, 프라이버시 보호 효과 측면에서는 LightGBM보다 낮은 성능을 보였다. 이러한 결과와 자원제약적 IoT 환경에서의 실제 배치를 고려하여, 본 연구는 성능과 계산 효율성 간의 균형이 우수한 LightGBM을 최종 모델로 선정하였다.
4.3 데이터세트 전처리
MQTTset 데이터세트에 대한 전처리를 수행하는 과정에서 TCP 세그먼트의 길이를 의미하는 ‘tcp.len’ 필드가 ‘0’으로 기록되어 비정상적이거나 빈 패킷을 의미하는 122,918개의 데이터를 제거하였다. 그 결과 최종적으로 208,008개의 샘플이 실험에 사용되었으며, 실험에 사용된 데이터세트의 세부 구성은 표 2에서 확인할 수 있다.
<표 2> 실험에 사용된 데이터세트 세부 구성

4.4 평가 방법
적대적 강건성의 평가는 원본 테스트 데이터세트로 부터 ZOO 공격을 통해 적대적 테스트 샘플을 생성한 뒤, 정상(clean) 데이터와 적대적(adv) 데이터 모두에 대해 동시에 수행하였다.
분류 성능은 정확도(Accuracy), 정밀도(Precision), 재현율(Recall), F1-score, 그리고 학습 및 추론 시간(training, inference time)을 기준으로 평가하였으며, 클래스 불균형을 고려하여 모든 평가지표에는 가중평균을 적용하였다.
또한, 본 연구에서는 학습·추론 시간을 계산 효율성의 지표로 사용하였다. 일반적으로 보안 운영 환경에서는 평균탐지시간(Mean Time to Detect, MTTD)을 통해 종단 간 지연을 평가한다. 그러나 본 실험에서는 MTTD에 네트워크 트래픽 처리·특징 추출·의사결정 과정에서의 오버헤드 등이 포함되어 모델의 성능을 왜곡할 수 있다고 판단하였다. 따라서 시스템 수준의 요인은 배제하고 모델 자체의 효율성을 직접적으로 반영하는 학습·추론 시간을 측정하였다.
4.5 하이퍼파라미터 설정
ZOO 공격은 다음과 같이 하이퍼파라미터를 설정하여 수행하였다. 우선 비표적(untargeted) 공격으로 구현하여 특정 클래스로의 오분류가 아닌 단순 오분류를 유도하도록 하였다(targeted = False). 그래디언트는 유한 차분(finite difference) 기법을 통해 추정하였으며, 입력 차원별로 ±1e-4의 교란 크기를 적용하였다(variable_h = 1e-4). 최적화 과정은 초기값 1e-3에서 시작(initial_const = 1e-3)하였으며, 최대 10회의 반복(iteration) 동안 교란을 생성하도록 설정하였다(max_iter = 10). 공격 대상 모델과 ZOO 공격 수행을 위해 설정한 하이퍼파라미터는 <표 3>에서 확인할 수 있다.
<표 3> 모델과 ZOO 공격에 사용된 하이퍼파라미터

적대적 학습을 위해서는 원본 학습 데이터세트를 대상으로 Adam과 DP-SGD 두 가지 최적화 기법을 적용하여 MLP 기반의 Shadow 모델을 학습시켰다. 이후 각 모델에 대해 PGD 및 DeepFool 공격을 통해 동일한 수의 적대적 예제를 생성하였다.
DP-SGD의 경우, 각 데이터 샘플별 그래디언트가 1.0을 초과하지 않도록 클리핑을 적용하였다 (max_ grad_norm = 1.0). 최적화 단계에서는 클리핑된 그래디언트에 평균이 0, 분산이 σ2C2인 가우시안노이즈를 추가하였다.
프라이버시 예산은 (ϵ, δ)=(1.0, 1e-5)로 설정했다.이는 차등 프라이버시 기반 머신러닝에서 일반적으로 사용되는 보수적이면서도 실용적인 값으로서, 모델의 성능은 유지하면서 의미 있는 데이터 프라이버시를 보장한다. ϵ 값을 더 낮추면 데이터 프라이버시가 좀더 엄격하게 보장될 수 있지만, 침입탐지 로그와 같은 고차원 데이터에서는 성능 저하가 두드러질 수 있다. δ 값은 일반적 기준인 δ<1/N (N은 학습 샘플 수)을 만족한다. 또한, 학습 과정 전반에서 누적 프라이버시 손실을 추적하기 위해 RDP accountant를 사용하여 (ϵ, δ) 보장 값으로 변환하였다.
PGD 공격의 경우, 초기 무작위화는 단 한 번 적용했으며(num_random_init = 1), 최대 40회까지 적대적 노이즈가 업데이트되도록 설정하였다(max_iter = 40). 각 단계별 교란은 0.02(eps_step = 0.02), 교란 크기의 상한은 0.2(eps = 0.2)로 설정하였다.
DeepFool 공격의 경우에는 교란 정제를 위한 최대 반복 횟수를 10회로 제한하였다(max_iter = 10). 연산 효율성을 높이기 위해 적대적 예제는 미니배치 단위(32개)로 생성되었다(batch_size = 32).
이러한 과정을 거쳐 최종 학습 데이터세트는 원본 데이터 70%, PGD 기반 적대적 예제 15%, DeepFool 기반 적대적 예제 15%를 무작위로 혼합하여 구성하였으며, 이를 이용해 침입탐지 모델을 대상으로 재학습을 수행하였다.
강건성 강화를 위해 사용된 알고리즘들의 세부 하이퍼파라미터 설정은 <표 4>에 요약하였다.
<표 4> 강건성 강화를 위해 설정된 하이퍼파라미터

5. 실험 결과
5.1 이진분류 모델 실험 결과
이진분류 모델에 대한 성능 평가 결과는 <표 5>를 통해 확인할 수 있다. 기준(Base) 모델은 원본(clean) 데이터세트에서 99.08%의 정확도, 99.29%의 정밀도, 98.84%의 재현율, 99.07%의 F1-Score를 기록하면서 우수한 성능을 보였다. 그러나 적대적(adv) 데이터세트에서는 정확도가 77.47%로 급격히 감소하였으며, 정밀도 69.79%, 재현율 96.31%, F1-Score 80.93%로 탐지 성능 저하가 두드러졌다.
<표 5> 이진분류 모델 성능 평가 결과

Adam 기반 적대적 학습 모델은 원본 데이터세트에서 정확도 98.16%, 정밀도 99.45%, 재현율 96.82%, F1-Score 98.12%를 달성하였다. 적대적 데이터세트에서는 정확도가 85.82%로 기준 모델 대비 8.35%p 향상되었으며, 정밀도 79.74%, 재현율 95.76%, F1-Score 87.02%를 기록하였다. 이러한 결과는 적대적 환경에서도 탐지 성능이 개선되었음을 보여준다.
DP-SGD 적대적 학습 모델은 원본 데이터세트에 대해 정확도 98.41%, 정밀도 98.65%, 재현율 98.14%, F1-Score 98.40%를 기록하여 Adam 모델과 유사한 성능을 보였다. 그러나 적대적 데이터세트에 대해서는 정확도 89.52%, 정밀도 84.66%, 재현율 96.35%, F1-Score 90.13%로 Adam 모델과 비교해 전반적인 성능 향상을 보였다. 특히 정확도와 F1-Score에서 각각 3.70%p 및 3.11%p 개선된 수치는 DP-SGD의 강건성 강화 효과를 잘 보여준다.
학습 및 추론 시간 측면에서도 큰 저하를 보이지 않았다. 기준 모델은 원본 입력에서 2.59초, 적대적 입력에서 1.61초의 추론 시간이 소요되었으며, Adam은 각각 3.03초 및 4.17초를 기록하였다. 반면, DP-SGD 모델은 5.67초와 3.61초로 Adam 모델 대비 원본 입력에서 더 긴 시간이 소요되었으나, 적대적 입력에서는 추론 속도가 다소 개선되었다. 그리고 복잡한 최적화 알고리즘이 적용되었음에도 불구하고 학습 시간은 약 0.4초로 거의 동일한 시간이 소요되었다.
종합적으로 평가하면, 두 적대적 학습 모델은 모두 적대적 데이터세트에서 기준 모델 대비 성능을 크게 향상시켰다. 그러나 DP-SGD 모델은 더 높은 분류 정확도와 F1-Score를 달성함과 동시에 (ϵ, δ)=(1.0, 1e-5) 수준의 데이터 프라이버시 보장을 제공한다는 점에서, 보안성과 신뢰성을 모두 고려하면 좀 더 효과적인 접근법으로 평가할 수 있다.
이진분류 실험에서의 기준 모델과 제안된 모델의 혼동행렬은 (그림 2)에서 보는 바와 같다.

(그림 2) 이진분류 모델 혼동행렬
5.2 다중분류 모델 실험 결과
다중분류 모델에 대한 성능 평가 결과는 <표 6>에 제시되어 있다. 기준 모델은 원본 데이터세트에서 99.75%의 정확도, 99.76%의 정밀도, 99.75%의 재현율, 99.75%의 F1-Score를 기록하며 매우 높은 성능을 보였다. 그러나 적대적 데이터세트에서는 정확도가 소폭 감소하여 98.97%로 나타났고, 정밀도는 98.87%, 재현율은 98.97%, F1-Score 98.96%로 성능이 전반적으로 저하되었다.
<표 6> 다중분류 모델 성능지표

Adam 기반 모델은 원본 데이터세트에서 정확도 99.73%, 정밀도 99.73%, 재현율 99.73%, F1-Score 99.73%를 기록하였다. 적대적 데이터세트에서는 정확도가 99.16%, 정밀도 99.14%, 재현율 99.16%, F1-Score 99.15%로 나타나 기준 모델 대비 소폭 개선된 결과를 보였다. 이는 다중분류 환경에서도 적대적 학습이 성능 저하를 완화하는 데 효과적임을 시사한다.
DP-SGD 기반 모델은 원본 데이터세트에서 정확도 99.72%, 정밀도 99.73%, 재현율 99.72%, F1-Score 99.73%를 기록하여, 기준 및 Adam 기반 모델과 거의 동일한 수준의 성능을 나타냈다. 그러나 적대적 데이터세트에서는 정확도 99.28%, 정밀도 99.27%, 재현율 99.28%, F1-Score 99.26%로 Adam 기반 모델 대비 향상된 성능을 보였다. 99%이상의 고정밀 영역에서는 이러한 0.1∼0.2%p 수준의 개선이라 하더라도 의미있는 강건성 향상으로 평가될 수 있다.
추론 시간에서는, Adam 기반 모델은 원본 데이터 세트에서 0.19초, 적대적 데이터세트에서는 0.18초가 소요되었지만, DP-SGD 기반 모델은 각각 0.65초, 0.70초로 상대적으로 긴 시간이 소요되었다. 그리고 학습 시간에서도 DP_SGD 기반 모델이 약 0.8초 추가 소요되어 전체적으로 계산 비용이 다소 증가했음을 확인했다. 그러나 DP-SGD 기반 모델은 (ϵ, δ) = (1.0, 1e-5) 수준의 데이터 프라이버시 보장을 제공한다는 점에서 분류 성능과 보안성을 모두 보장할 수 있는 효과적인 선택지로 판단된다.
종합하면, 다중분류 모델에서는 모든 방법이 99%에 가까운 높은 정확도를 달성했으나, DP-SGD 기반 모델은 모든 환경에서 가장 안정적인 성능을 보였다.
다중분류 실험에서의 기준 모델과 제안된 모델의 혼동행렬은 (그림 3)에서 보는 바와 같다.

(그림 3) 다중분류 모델 혼동행렬
5.3 관련 연구 결과 비교
침입탐지 모델의 데이터 프라이버시와 적대적 강건성을 향상시키기 위해 적대적 학습을 적용을 시도한 선행연구들과 본 논문에서 제안한 접근법을 비교하여 요약한 결과는 <표 7>에서 보는 바와 같다.
<표 7> 관련 연구 결과 비교

선행연구들은 적대적 방어 측면에서 중요한 진전을 이루었으나, 데이터 프라이버시 보장, 계산 가능성, 다양한 공격 시나리오에 대한 일반화 등에서는 한계를 지니고 있다. 선행연구 [4]와 [8]에서는 적대적 학습을 활용하였으나, 데이터 프라이버시는 고려되지 않았다.
Alkadi 등[5]은 다중 데이터세트를 대상으로 블랙박스 공격을 탐구했으나, 차등 프라이버시 학습을 적용하지 않았으며 높은 쿼리 복잡도를 갖는 공격에만 의존하였다. GAN 기반의 적대적 학습[7][9]은 정상 데이터세트에 대해서는 높은 탐지 성능을 보였지만, 모델 학습과 추론 과정에서 연산 비용이 매우 크다는 한계가 있다. 더 나아가 성능 검증 시 사용된 적대적 예제가 평가 과정과 적용된 동일한 기법으로 생성된 것이기 때문에, 실제 환경에서 새롭게 등장하는 공격 유형에 대해서는 검증 방식이 제한적이라는 한계가 존재한다.
이에 비해 본 논문에서 제안한 접근방법은 PGD와 DF 기법을 이용해 적대적 예제를 생성하고, DP-SGD 기반 차등 프라이버시 최적화 기법을 적대적 전이학습에 통합하여 침입탐지 모델을 구성함으로써 데이터 프라이버시 및 적대적 강건성을 보장함은 물론 경량화도 달성하였다. 또한, 본 연구는 강건성이 강화된 모델을 ZOO 공격을 통해 생성한 적대적 데이터뿐만 아니라 정상적인 원본 평가 데이터세트를 대상으로 평가를 수행하여 모든 데이터세트에서 일관되게 높은 정확도와 강건성을 달성함을 입증하였다.
6. 결론
본 연구에서는 M-IoT 환경에서 활용 가능한 적대적 강건성 및 데이터 프라이버시가 강화된 경량 침입 탐지 모델을 제안하였다. 이를 위해 먼저 MLP 기반 Shadow 모델을 Adam과 DP-SGD로 학습한 뒤, 각 모델에 대해 PGD와 DeepFool 공격을 적용해 적대적 예제를 생성하였다. 이렇게 생성한 적대적 데이터는 원본 학습 데이터세트와 결합한 후 침입탐지 모델의 재학습에 활용하였다. 재학습이 완료된 이후에는 각 모델의 성능을 원본 평가 데이터세트와 적대적 평가 데이터세트를 통해 비교 평가함으로써, 제안하는 모델의 정상 데이터에 대한 일반화 능력과 적대적 환경에서의 탐지 성능 간 균형을 정량적으로 검증하였다.
실험 결과, 이진분류 모델에서는 DP-SGD 기반의 적대적 전이학습 구조가 Adam 기반 모델과 비교해 적대적 데이터세트에서 분류 정확도와 F1-Score를 3%p 이상 개선하면서도 정상 데이터세트에 대해서는 분류 성능 저하를 최소화하였다. 다중분류 모델에서는 모든 방법이 99% 이상의 정확도를 달성하였으나, DP-SGD 기반 모델이 가장 안정적인 성능을 확보하였다.
그리고 제안된 모델은 블랙박스 공격(ZOO)뿐만 아니라 정상 데이터세트에 대해서도 경쟁력있는 성능을 유지하였다. 이러한 결과는 Shadow 모델 학습 단계에서의 DP-SGD 기반 최적화와 적대적 전이학습이 상호 보완적으로 작용하며, 제안된 접근방법이 적대적 취약점에 대한 저항성과 학습 데이터 프라이버시를 동시에 보장할 수 있음을 확인시켜 준다.
향후에는 MQTT 프로토콜에 더해 실제 IoT 환경에서 발생 가능한 다양한 패킷 교란 양상과 적대적 공격 기법을 반영하여 제안된 기법의 일반적인 적용성을 확장할 예정이다. 또한, 본 연구는 실험 환경의 제약으로 인해 학습 및 추론 시간을 절대적 기준으로 비교하지 못하고 상대적 지표만을 제시하였기에, 향후에는 보다 다양한 연산 자원을 활용한 환경에서 성능 검증을 수행할 필요가 있다.
마지막으로 본 연구는 ZOO 기반 블랙박스 공격에 초점을 맞추고 있으며, Boundary나 HopSkipJump와 같은 결정 기반 블랙박스 공격은 고려하지 못하였다. 이 공격들은 반복적인 라벨 질의에 기반하여 고비용 연산을 요구하지만, 최소한의 사전 지식만을 전제로 하기 때문에 현실적인 위협 시나리오로서의 의미가 크다. 따라서 향후에는 효율적인 질의 최적화 기법과 대규모 연산 자원을 활용하여, 결정 기반 블랙박스 환경에서 제안된 접근방법의 강건성을 검증할 필요가 있다.
References
- I. J. Goodfellow, J. Shlens and C. Szegedy, "Explaining and harnessing adversarial examples", arXiv:1412.6572, Dec. 2014.
- A. Madry, A. Makelov, L. Schmidt, D. Tsipras and A. Vladu, "Towards deep learning models resistant to adversarial attacks", Proceedings of the 6th International Conference on Learning Representations(ICLR 2018), Vancouver, Canada, pp. 1-28, Apr. 2018.
- B. Biggio, I. Corona, D. Maiorca, B. Nelson, N. Šrndić, P. Laskov, G. Giacinto and F. Roli, "Evasion attacks against machine learning at test time", Proceedings of the European Conference on Machine Learning and Knowledge Discovery in Databases (ECML PKDD 2013), Prague, Czech Republic, pp. 387-402, 2013.
- M. K. Roshan and A. Zafar, "Boosting robustness of network intrusion detection systems: A novel two- phase defense strategy against untargeted white-box optimization adversarial attack", Expert Systems with Applications, Vol. 249, p. 123567, Sep. 2024.
- S. Alkadi, S. Al-Ahmadi and M. M. Ben Ismail, "RobEns: Robust ensemble adversarial machine learning framework for securing IoT traffic", Sensors, Vol. 24, No. 8, p. 2626, 2024.
- S. Saha, W. Wang, Y. Kaya, S. Feizi and T. Dumitras, "DRSM: De-randomized smoothing on malware classifier providing certified robustness", arXiv:2303.13372, 2023.
- S. Alahmed, Q. Alasad, M. M. Hammood, J. S. Yuan and M. Alawad, "Mitigation of black-box attacks on intrusion detection systems-based ML", Computers, Vol. 11, No. 7, p. 115, Jul. 2022.
- R. Abou Khamis and A. Matrawy, "Evaluation of adversarial training on different types of neural networks in deep learning-based IDSs", Proceedings of the 2020 International Symposium on Networks, Computers and Communications (ISNCC), Montreal, QC, Canada, pp. 1-6, 2020.
- W. D. Xiong, K. L. Luo and R. Li, "AIDTF: Adversarial training framework for network intrusion detection", Computers & Security, Vol. 128, p. 103141, 2023.
- S. Sharma and Z. Chen, "A systematic study of adversarial attacks against network intrusion detection systems", Electronics, Vol. 13, No. 24, p. 5030, 2024.
- IIoT World, "Building IIoT Systems: Trends and Technology Adoption", IIoT World Survey Report, Oct. 2021.
- I. Vaccari, G. Chiola, M. Aiello, M. Mongelli and E. Cambiaso, "MQTTset: A new dataset for machine learning techniques on MQTT", Sensors, Vol. 20, No. 22, p. 6578, Nov. 2020.
- G. Ke, Q. Meng, T. Finley, T. Wang, W. Chen, W. Ma, Q. Ye and T. Y. Liu, "LightGBM: A highly efficient gradient boosting decision tree", Proceedings of the 30th International Conference on Neural Information Processing Systems (NIPS 2017), pp. 3149-3157, Dec. 2017.
- S. M. Moosavi-Dezfooli, A. Fawzi and P. Frossard, "DeepFool: A simple and accurate method to fool deep n eural networks", Proceedin gs of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2574-2582, Jun. 2016.
- M. Abadi, A. Chu, I. Goodfellow, H. B. McMahan, I. Mironov, K. Talwar and L. Zhang, "Deep learning with differential privacy", Proceedings of the 23rd ACM Conference on Computer and Communications Security (CCS 2016), New York, USA, pp. 308-318, Oct. 2016.
- P. Y. Chen, H. Zhang, Y. Sharma, J. Yi and C. J. Hsieh, "ZOO: Zeroth order optimization based black-box attacks to deep neural networks without training substitute models", Proceedings of the 10th ACM Workshop on Artificial Intelligence and Security, Texas, USA, pp. 15-26, Nov. 2017.
- I. Debicha, T. Debatty, J. M. Dricot and W. Mees, "Adversarial training for deep learning-based intrusion detection systems", Proceedings of the 16th International Conference on Systems (ICONS 2021), Porto, Portugal, pp. 308-318, Apr. 2021.
- M. A. Ferrag, O. Friha, L. Maglaras, H. Janicke and L. Shu, "Federated deep learning for cyber security in the Internet of Things: Concepts, applications, and experimental analysis", IEEE Access, Vol. 9, pp. 138509-138542, 2021.
- J. G. Lee and S. J. Lee, "Attack detection and classification method using PCA and LightGBM in MQTT-based IoT environment", Convergence Security Journal, Vol. 22, No. 4, pp. 17-24, Oct. 2022.
- A. Alzahrani and T. H. Aldhyani, "Artificial intelligence algorithms for detecting and classifying MQTT protocol Internet of Things attacks", Electronics, Vol. 11, No. 22, p. 3837, Nov. 2022.
- J. G. Kim, H. S. Kim and S. J. Lee, "Intrusion detection model for the enhancement of cybersecurity in defense IoT", Journal of Defense and Security, vol. 5, no. 2, pp. 11-43, Dec. 2023.
- M. I. Nicolae, M. Sinn, M. N. Tran, B. Buesser, A. Rawat, M. Wistuba, V. Zantedeschi, N. Baracaldo, B. Chen, H. Ludwig, et al., "Adversarial robustness toolbox v1.0.0", arXiv:1807.01069, 2018.