디지털 헬스케어 환경을 위한 머신러닝 기반 네트워크 이상행위 탐지 모델 비교 연구

Comparative Study of Machine Learning-based Network Anomaly Detection Models for Digital Healthcare Environments

Article information

J Appropr Technol. 2026;12(1):76-89
Publication date (electronic) : 2026 April 30
doi : https://doi.org/10.37675/jat.2026.00850
1HANPASS CO., Ltd., Seoul, Republic of Korea
2SECURE SYSTEMS Co., Ltd., Seoul, Republic of Korea
이도윤1,, 손주환2, 고덕연2
1한패스(주), 서울 04782, 대한민국
2(주)시큐어시스템즈, 서울 05203, 대한민국
To whom correspondence should be addressed. E-mail: venipe@gmail.com
Received 2026 February 21; Revised 2026 April 20; Accepted 2026 April 24.

Abstract

디지털 헬스케어 환경에서는 의료 정보시스템과 네트워크 기반 의료기기의 확산으로 인해 사이버 공격 위험이 지속적으로 증가하고 있다. 기존의 시그니처 기반 및 규칙 기반 보안 기술은 알려진 공격에는 효과적이나, 새로운 공격이나 변종 공격을 탐지하는 데 한계가 있다. 본 연구에서는 의료 환경을 고려한 네트워크 이상행위 탐지를 목적으로, 전통적인 개념 학습 기반 알고리즘(Find-S, Version Space, Candidate Elimination)의 적용 가능성을 분석하고, 이들의 한계를 극복하기 위한 머신러닝 기반 탐지 모델(K-means Clustering, Random Forest, LightGBM)을 제안한다. CIC-IDS2017 정상 데이터와 Emerging Threats Rules 및 실제 보안관제 환경에서 수집한 악성 데이터를 활용하여 약 20만 건의 데이터셋을 구성하였으며, Precision, Recall, F1-score를 기반으로 모델 성능을 비교 분석하였다. 실험 결과, Random Forest와 LightGBM 모델이 높은 탐지 성능을 보였으며, 특히 Random Forest가 전반적인 정확도와 안정성 측면에서 가장 우수한 결과를 나타냈다. 본 연구 결과는 의료 환경에서의 AI 기반 네트워크 이상행위 탐지 모델 설계에 실질적인 시사점을 제공한다.

Trans Abstract

In the digital healthcare environment, the risk of cyberattacks is continuously increasing due to the proliferation of medical information systems and network-based medical devices. While traditional signature-based and rule-based security technologies are effective against known attacks, they have limitations in detecting new or variant attacks. This study analyzes the applicability of traditional concept learning-based algorithms (Find-S, Version Space, Candidate Elimination) for network anomaly detection in medical environments and proposes machine learning-based detection models (K-means Clustering, Random Forest, LightGBM) to overcome their limitations. We constructed a dataset of approximately 200,000 records using CIC-IDS2017 for normal traffic and a combination of Emerging Threats Rules and real-world security operation data for malicious traffic. The models were evaluated based on Precision, Recall, and F1-score. The experimental results showed that Random Forest and LightGBM achieved high detection performance. In particular, Random Forest demonstrated the most superior results in terms of overall accuracy and stability. These findings provide practical implications for designing AI-based network anomaly detection models suitable for medical environments.

서론

4차 산업혁명과 함께 디지털 헬스케어는 의료 서비스에 정보통신기술(ICT), 사물인터넷(IoT), 클라우드 및 데이터 분석 기술이 결합되며 빠르게 확산되고 있다(과학기술정보 통신부 & KISA, 2021). 의료기기와 의료정보시스템은 과거 병원 폐쇄망 내부에서 제한적으로 운영되던 형태에서 벗어나, 유·무선 네트워크를 통해 환자의 생체신호와 진료 데이터를 실시간으로 전송·저장·분석하는 구조로 진화하였다. 이러한 연결성의 확대는 진료 효율성과 서비스 품질을 향상시키는 반면, 네트워크 노출면(attack surface)을 증가시켜 의료 환경을 사이버 공격의 주요 표적으로 만들고 있다.

의료 네트워크의 보안을 위해 전통적으로 시그니처(Signature) 기반 또는 규칙(Rule) 기반 탐지 체계가 널리 활용되어 왔다(Roesch, 1999). 그러나 이러한 방식은 사전에 정의된 공격 패턴에 대한 탐지에는 효과적일 수 있으나, 공격 기법이 지속적으로 변형·은닉되는 현실 환경에서 변종 공격, 신규 공격, 제로데이(Zero-day) 공격에 대한 탐지 한계를 가진다(Axelsson, 2000). 또한 실제 의료 현장에서는 패치 관리가 어려운 구형 OS 기반의 PACS(의료영상저장전송시스템)와 최신 무선 인터넷에 연결된 스마트 수액 펌프(Infusion Pump), 환자 모니터링 기기 등 이기종 장비가 혼재되어 운영된다. 특히 원격 모니터링 기기(Home IoMT)가 공용 인터넷을 통해 병원 네트워크로 연결되는 과정에서 불안정한 통신으로 인한 노이즈와 결측 데이터가 일상적으로 발생하며, 이는 랜섬웨어나 스캐닝 공격의 주요 취약점이 되고 있다(Yaacoub et al., 2020). 이러한 복잡성으로 인해 정상 트래픽 자체의 변동성이 크기 때문에 단순 룰 확장만으로는 오탐(False Positive)과 미탐(False Negative)을 동시에 억제하기 어렵다. 따라서 네트워크 트래픽의 특성을 데이터 기반으로 학습하여 정상과 비정상을 구분하고, 알려지지 않은 위협까지 식별할 수 있는 머신러닝 기반 이상행위 탐지(Anomaly Detection) 기술의 필요성이 대두되고 있다(Patcha & Park, 2007).

한편 이상행위 탐지 모델을 설계할 때는 단순히 알고리즘의 이론적 우수성만으로 선택하기 어렵고, (1) 대규모 트래픽 처리 가능성, (2) 노이즈 및 불완전 데이터에 대한 강건성, (3) 실시간 적용 가능성, (4) 다양한 공격 유형에 대한 일반화 성능, (5) 운영 및 설명 가능성(interpretability) 등 실제 의료 정보시스템 운영 환경의 요구사항을 종합적으로 고려해야 한다. 특히 개도국이나 중소규모 의료기관은 고비용의 보안관제센터(SOC) 인력이나 고성능 GPU 서버를 도입·유지하기 어려운 전형적인 ‘저자원 환경’에 놓여 있다(Sun et al., 2024). 따라서 대규모 연산 자원이 필수적인 딥러닝 방식보다는, 로컬 서버나 저사양 장비에서도 효율적으로 동작하며 시스템 관리자에게 탐지 결과에 대한 설명 가능성을 제공할 수 있는 경량화된 머신러닝 모델의 도입이 ‘적정기술(Appropriate Technology)’ 관점에서 강력히 요구된다.

이에 본 연구는 의료 네트워크 환경에서 활용 가능한 이상행위 탐지 모델을 도출하기 위해, 먼저 개념 학습 기반 알고리즘(Find-S, Version Space, Candidate Elimination)의 적용 한계를 요구사항 기준으로 체계적으로 분석하고, 이를 대체할 수 있는 머신러닝 기반 탐지 모델(K-means Clustering, Random Forest, LightGBM)을 설계·비교한다. 또한 모델 간 공정한 성능 비교를 위해 공개 침입탐지 데이터셋(CICIDS2017)에서 정상 트래픽을 추출하고, Emerging Threats 규칙 기반 데이터 및 실제 보안관제 환경에서 확보한 악성 트래픽을 결합하여 정상·악성 약 20만 건 규모의 학습 및 평가 데이터셋을 구성하였다. 제안 모델의 성능은 Accuracy 뿐 아니라 Precision, Recall, F1-score 등 분류 성능 지표를 기반으로 정량 평가하여, 의료 환경에서의 적용 가능성을 논의한다.

본 논문의 주요 기여는 다음과 같다. (1) 의료 네트워크 이상행위 탐지 관점에서 개념 학습 기반 알고리즘의 한계를 요구사항 기준으로 정리하였다. (2) 공개 데이터와 최신 위협 정보를 결합한 정상·악성 데이터셋 구성 및 전처리 절차를 제시하였다. (3) K-means Clustering, Random Forest, LightGBM 모델을 동일 조건에서 비교 평가하여, 의료 환경에서의 실무 적용 관점에서 유의미한 선택 근거를 제공하였다.

본 논문의 구성은 다음과 같다. 2장에서는 관련 연구 동향을 살피고 개념 학습 기반 알고리즘의 한계점을 분석한다. 3장에서는 이를 보완하기 위한 머신러닝 기반 탐지 모델을 제안한다. 4장에서는 데이터셋 구성과 전처리 과정을 설명하며, 5장에서는 실험 결과와 성능에 대한 비교 분석을 제시한다. 마지막으로 6장에서는 결론과 향후 연구 방향을 제시한다.

이론적 배경

본 장에서는 의료 네트워크 환경에서의 이상행위 탐지와 관련된 선행 연구를 분석하고, 본 연구의 이론적 배경이 되는 이상행위 탐지 접근 방법과 주요 알고리즘 흐름을 정리한다. 이를 통해 기존 연구의 한계를 도출하고, 본 연구의 차별성과 연구 필요성을 명확히 한다.

1. 의료 네트워크 보안 및 이상행위 탐지 연구 동향

의료 정보시스템과 네트워크 기반 의료기기의 확산에 따라, 의료 환경을 대상으로 한 사이버 보안 연구가 지속적으로 수행되어 왔다. 초기 연구들은 의료 정보 보호를 위해 방화벽, 침입 탐지 시스템(IDS), 침입 방지 시스템(IPS)과 같은 전통적인 네트워크 보안 장비의 적용 가능성을 중심으로 논의하였다. 그러나 의료 환경은 일반 기업 네트워크와 달리 다양한 프로토콜과 장비가 혼재되어 있으며, 실시간성과 안정성이 특히 중요하다는 점에서 기존 보안 체계의 한계가 지적되어 왔다.

최근 연구들은 이러한 한계를 극복하기 위해 네트워크 트래픽의 통계적 특성이나 행위 패턴을 학습하는 이상행위 탐지(Anomaly Detection) 기법에 주목하고 있다. 이상행위 탐지는 정상 행위의 범위를 학습한 후, 이와 유의미하게 다른 패턴을 이상으로 판단하는 방식으로, 알려지지 않은 공격이나 변종 공격 탐지에 유리하다는 장점을 가진다. 의료 네트워크를 대상으로 한 선행 연구들 또한 트래픽 흐름 기반 특징(Flow-based Feature)을 활용하여 정상과 비정상을 구분하려는 시도가 다수 보고되고 있다.

디지털 헬스케어는 고소득 국가뿐 아니라 개도국 및 저자원 환경에서도 원격진료, 모바일 헬스(mHealth), 원격 모니터링 등을 통해 의료 접근성을 향상시키는 핵심 수단으로 부상하고 있다. 그러나 이러한 환경에서는 전용 보안 인프라와 인력이 부족하고, 노후 네트워크 장비와 불안정한 전력·통신 환경 등으로 인해 사이버 공격에 더욱 취약하다는 연구 결과가 보고되고 있다. 따라서 고성능 클라우드 인프라나 복잡한 딥러닝 모델에 대한 의존도를 낮추면서도, 제한된 자원 내에서 운영 가능한 경량 네트워크 이상행위 탐지 체계가 중요하다. 본 연구에서 제안하는 머신러닝 기반 탐지 모델은 이러한 자원 제약 환경에서도 비교적 낮은 하드웨어 요구사항과 해석 가능성을 바탕으로 적정기술적 관점에서 활용 가능성이 있다.

2. 규칙 기반 및 시그니처 기반 탐지의 한계

규칙 기반 및 시그니처 기반 탐지 방식은 네트워크 보안 분야에서 오랜 기간 활용되어 온 검증된 기술이다. 이 방식은 공격 패턴이 명확히 정의된 경우 높은 정확도를 보이며, 탐지 결과에 대한 해석이 용이하다는 장점이 있다. 그러나 선행 연구들에 따르면 이러한 방식은 사전에 정의되지 않은 공격이나 환경 변화에 따른 트래픽 변동을 정상적으로 반영하지 못해 오탐과 미탐이 증가하는 문제가 있다.

특히 의료 네트워크 환경에서는 정상 트래픽 자체가 시간대, 진료 유형, 의료기기 동작 상태에 따라 크게 변동될 수 있기 때문에, 고정된 규칙이나 시그니처만으로 이상행위를 판단하는 데 구조적인 한계가 존재한다. 이에 따라 최근 연구들은 규칙 기반 탐지를 보조하거나 대체할 수 있는 데이터 기반 탐지 기법의 필요성을 강조하고 있다.

3. 개념 학습 기반 알고리즘에 관한 선행 연구

개념 학습(Concept Learning)은 데이터로부터 특정 개념을 규칙 형태로 학습하는 접근 방식으로, Find-S, Version Space, Candidate Elimination 알고리즘이 대표적이다(Mitchell, 1997). 선행 연구들에서는 이러한 알고리즘이 명확한 규칙을 도출할 수 있다는 점에서 해석 가능성이 높다는 장점을 가진다고 보고하였다. 특히 소규모 데이터셋이나 노이즈가 적은 환경에서는 비교적 효율적인 학습이 가능하다는 평가를 받고 있다.

그러나 다수의 연구에서 개념 학습 기반 알고리즘은 노이즈에 민감하고, 대규모 데이터셋이나 불완전한 데이터 환경에서는 가설 공간 관리로 인한 계산 복잡도가 급격히 증가한다는 한계가 지적되었다. 또한 실시간 데이터가 지속적으로 유입되는 네트워크 환경에서는 모델을 점진적으로 업 데이트하기 어렵다는 점에서 실제 보안 운영 환경에 적용하기에는 제약이 존재한다. 이러한 개념 학습 기반 알고리즘들의 주요 특성과 의료 네트워크 환경에서의 부적합 사유를 Table 1에 상세히 비교하여 정리하였다.

Comparison of Concept Learning-based Algorithms.

4. 머신러닝 기반 이상행위 탐지 연구

이러한 한계를 보완하기 위해 최근 연구들은 머신러닝 기반 이상행위 탐지 기법을 적극적으로 활용하고 있다. 비지도 학습 기반의 군집화 기법(K-means, DBSCAN 등)은 사전 라벨 정보가 부족한 환경에서도 이상 패턴을 탐지할 수 있어 네트워크 이상 탐지 분야에서 널리 연구되고 있다. 다만 군집 수 설정의 어려움과 노이즈에 대한 민감성 문제는 지속적인 개선 과제로 지적되고 있다.

지도 학습 기반 모델인 Random Forest와 Gradient Boosting 계열 모델은 다양한 특징을 동시에 고려할 수 있으며, 노이즈에 대한 강건성과 높은 예측 성능을 제공한다. 특히 Random Forest는 다수의 의사결정 트리를 결합하여 과적합을 완화하면서도 특징 중요도 분석을 통해 탐지 결과의 해석 가능성을 제공한다. LightGBM은 leaf-wise 분할 방식을 기반으로 대규모 데이터 환경에서도 빠른 학습과 예측이 가능하다는 장점으로 실시간 탐지 연구에 활용되고 있다.

특히 2020년대 이후 의료 사물인터넷(IoMT, Internet of Medical Things)의 급격한 확산과 함께, 최근 연구들은 이 기종 기기가 혼재된 의료 네트워크의 복잡성을 해결하기 위해 머신러닝 기반 앙상블 기법 및 특징 선택 알고리즘을 적극적으로 도입하고 있다. 대표적으로 Chandekar 등(2025)은 최신 IoMT 트래픽 데이터셋(CICIoMT2024)을 활용하여 앙상블 모델이 다양한 통신 프로토콜 환경에서 발생하는 이상행위를 실시간으로 탐지하는 데 효과적임을 보였다. 또한 Alani 등(2024)은 의료 네트워크 환경에서 규제 및 감사 대응을 위해 설명 가능성(Explainable AI)을 갖춘 이상탐지 체계의 중요성을 강조하며 데이터 기반 보안 모델의 핵심 요건을 제시하였다. 한편, 자원이 제한적인 스마트 헬스케어 기기 및 중소규모 의료기관 환경에서는 복잡한 딥러닝 아키텍처 대신 Random Forest나 LightGBM과 같은 경량 트리 기반 앙상블 모델이 실용적인 대안으로 제시되고 있으며, 이는 탐지 속도 향상 및 오탐률 감소 측면에서 장점을 보인다. 이러한 최근 연구 흐름은 본 연구가 Random Forest 및 LightGBM을 핵심 탐지 모델로 선정한 접근 방식과 일관된 방향성을 가지며, 모델 선정의 타당성을 강력히 뒷받침한다. 최근에는 의료 사물인터넷(IoMT) 환경의 복잡성을 해결하기 위해 심층 신경망을 활용한 이상 탐지 연구도 활발히 진행되고 있다(Kumar and Alqahtani, 2023).

5. 선행 연구 분석 및 본 연구의 차별성

선행 연구를 종합하면, 의료 네트워크 이상행위 탐지를 위해 머신러닝 기반 접근이 효과적이라는 점에는 공감대가 형성되어 있으나, 알고리즘 선택과 데이터 구성 방식에 따라 성능 편차가 크게 발생함을 확인할 수 있다. 또한 일부 연구는 특정 알고리즘의 성능 검증에 집중하여, 서로 다른 유형의 머신러닝 모델을 동일 조건에서 비교·분석한 연구는 상대적으로 제한적이다.

이에 본 연구는 의료 네트워크 환경을 가정한 데이터셋을 구성하고, 비지도 학습(K-means)과 지도 학습(Random Forest, LightGBM) 모델을 동일한 데이터셋과 평가 지표로 비교 분석함으로써, 실제 의료 보안 환경에서 적용 가능한 이상행위 탐지 모델 선택에 대한 실증적 근거를 제시한다는 점에서 기존 연구와 차별성을 가진다.

머신러닝 기반 네트워크 이상행위 탐지 모델

본 장에서는 2장에서 분석한 선행 연구 및 기존 접근 방법의 한계를 바탕으로, 의료 네트워크 환경에 적용 가능한 머신러닝 기반 이상행위 탐지 모델을 제안한다. 의료 환경은 대규모 트래픽, 다양한 프로토콜, 노이즈 및 불완전 데이터가 혼재된 특성을 가지므로, 본 연구에서는 실환경 적용성을 중심으로 알고리즘을 선정하였다. 구체적으로 비지도 학습 기반 모델 1종(K-means Clustering)과 지도 학습 기반 모델 2종(Random Forest, LightGBM)을 대상으로 탐지 구조와 적용 방식을 설계하였다.

1. 모델 선정 기준

본 연구에서 이상행위 탐지 모델을 선정하기 위해 다음과 같은 기준을 설정하였다.

첫째, 대규모 데이터 처리 가능성이다. 의료 네트워크 트래픽은 지속적으로 대량 생성되므로, 학습 및 예측 단계에서 계산 효율성이 확보되어야 한다.

둘째, 노이즈 및 데이터 불완전성에 대한 강건성이다. 의료 환경에서는 정상 트래픽의 변동성이 크고, 일부 데이터 누락이나 비정형 데이터가 존재할 수 있으므로 이에 대한 대응 능력이 요구된다.

셋째, 실시간 또는 준실시간 적용 가능성이다. 탐지 지연은 의료 서비스의 안정성에 직접적인 영향을 미칠 수 있으므로, 빠른 예측 속도가 중요하다.

넷째, 다양한 공격 유형에 대한 일반화 성능이다. 특정 공격 패턴에 과적합되지 않고, 새로운 형태의 이상행위를 탐지할 수 있는 능력이 요구된다.

다섯째, 운영 및 해석 가능성이다. 의료 보안 환경에서는 탐지 결과에 대한 설명 가능성이 중요하므로, 모델의 판단 근거를 일정 수준 이상 해석할 수 있어야 한다.

이러한 기준을 바탕으로 본 연구는 K-means Clustering, Random Forest, LightGBM을 비교 대상으로 선정하였다.

한편 이상행위 탐지 분야에서는 딥러닝 기반 모델(예: LSTM, CNN, Autoencoder, Graph Neural Network 등)도 활발히 연구되고 있다. 그러나 본 연구에서는 다음과 같은 이유로 딥러닝 모델을 직접 비교 대상에 포함하지 않았다. 첫째, 본 연구에서 구성한 데이터셋은 약 20만 건 규모로, 심층 신경망의 표현력을 충분히 활용하기 위해 요구되는 초대 규모 데이터셋에 비해 상대적으로 제한적이다. 둘째, 딥러닝 모델은 일반적으로 GPU와 같은 고성능 연산 자원, 복잡한 하이퍼파라미터 튜닝, 지속적인 재학습 파이프라인이 필요하여, 중소규모 의료기관이나 개도국 의료 환경에서 장기 운영·유지보수가 어렵다. 셋째, 의료 환경에서는 탐지 결과에 대한 설명 가능성과 규제·감사 대응이 중요하므로, 특징 중요도 분석 등 해석 가능성을 제공하는 트리 기반 앙상블 모델이 실무적 ‘적정기술’ 관점에서 보다 합리적인 선택이다.

2. K-means Clustering 기반 이상행위 탐지

K-means Clustering은 비지도 학습 기반 군집화 알고리즘으로, 사전 라벨 정보 없이 데이터의 유사성을 기준으로 여러 군집으로 분할한다. 네트워크 이상행위 탐지에서는 정상 트래픽이 특정 군집에 밀집되는 반면, 이상 트래픽은 군집 간 경계에 위치하거나 독립적인 군집을 형성하는 특성을 활용할 수 있다(MacQueen, 1967).

본 연구에서는 네트워크 트래픽의 흐름 기반 특징을 입력으로 하여 K-means Clustering을 수행하고, 각 데이터 포인트와 군집 중심 간의 거리 정보를 기반으로 이상 여부를 판단하였다. 해당 접근 방식은 라벨 확보가 어려운 초기 환경이나 신규 시스템 도입 단계에서 활용 가능성이 높다는 장점을 가진다.

그러나 K-means Clustering은 군집 수(K) 설정에 따라 성능 편차가 발생할 수 있으며, 노이즈 데이터에 민감하다는 한계를 가진다. 이에 따라 본 연구에서는 K-means 모델을 기준선(Baseline) 모델로 활용하고, 지도 학습 기반 모델과의 성능 비교를 수행하였다.

3. Random Forest 기반 이상행위 탐지

Random Forest는 다수의 결정 트리를 결합한 앙상블 학습 모델로, 각 트리가 서로 다른 데이터 부분 집합과 특징 공간을 학습함으로써 과적합을 완화하고 일반화 성능을 향상시킨다(Breiman, 2001). 네트워크 이상행위 탐지에서는 다차원 특징 간의 비선형 관계를 효과적으로 학습할 수 있다는 장점이 있다.

본 연구에서는 정상 및 악성 트래픽으로 라벨링된 데이터셋을 기반으로 Random Forest 분류 모델을 학습하였다. 학습된 모델은 입력 트래픽에 대해 정상 또는 악성으로 분류하며, 다수 트리의 투표 결과를 통해 최종 판단을 수행한다. 또한 Random Forest는 특징 중요도(feature importance)를 제공하여, 이상행위 판단에 기여한 주요 특징을 분석할 수 있다는 점에서 운영 및 분석 측면의 장점을 가진다.

그러나 다수의 연구에서 개념 학습 기반 알고리즘은 노이즈에 민감하고, 대규모 데이터셋이나 불완전한 데이터 환경에서는 가설 공간 관리로 인한 계산 복잡도가 급격히 증가한다는 한계가 지적되었다. 또한 실시간 데이터가 지속적으로 유입되는 네트워크 환경에서는 모델을 점진적으로 업데이트하기 어렵다는 점에서 실제 보안 운영 환경에 적용하기에는 제약이 존재한다. 본 연구에서는 이러한 한계를 의료 네트워크 환경의 요구사항(대규모 트래픽 처리, 노이즈·결측치 존재, 실시간성, 다양한 공격 유형에 대한 일반화, 운영 및 설명 가능성) 관점에서 재정리하고, 5장에서 제시하는 머신러닝 기반 모델(Random Forest, LightGBM)의 실험 결과와 비교함으로써 개념 학습 기반 알고리즘의 한계를 정량적으로 검증한다.

4. LightGBM 기반 이상행위 탐지

LightGBM은 Gradient Boosting Decision Tree(GBDT) 계열의 모델로, 히스토그램 기반 분할 방식을 통해 대규모 데이터셋에서도 빠른 학습과 예측이 가능하도록 설계되었다(Ke et al., 2017). 기존 부스팅 모델 대비 메모리 사용량이 적고 계산 효율성이 높아, 실시간 또는 준실시간 이상행위 탐지 환경에 적합하다.

본 연구에서는 Random Forest와 동일한 지도 학습 데이터셋을 활용하여 LightGBM 분류 모델을 학습하였다. LightGBM은 반복적으로 이전 모델의 오류를 보완하는 방식으로 학습되므로, 복잡한 트래픽 패턴과 미세한 이상 행위를 효과적으로 탐지할 수 있다. 또한 결측치 처리에 유연하여 실제 의료 네트워크 데이터의 특성을 반영하기 용이하다.

5. 모델 비교 및 연구 적용 방향

본 연구에서 제안한 세 가지 모델은 학습 방식과 특성이 상이하므로, 의료 네트워크 환경에서의 적용 목적에 따라 상호 보완적으로 활용될 수 있다. K-means Clustering은 라벨 정보가 부족한 환경에서 초기 이상 징후 탐지에 활용 가능하며, Random Forest와 LightGBM은 충분한 학습 데이터가 확보된 환경에서 높은 탐지 정확도를 제공한다. 본 연구에서 선정한 세 가지 머신러닝 모델의 데이터 처리 능력 및 강건성 비교 결과는 Table 2와 같다.

Comparison of Machine Learning Models Used in This Study.

이러한 모델 비교를 통해 본 연구는 단일 알고리즘의 우수성을 주장하기보다, 의료 환경의 요구사항에 부합하는 이상행위 탐지 모델 선택에 대한 실증적 근거를 제시하고자 한다. 다음 장에서는 제안 모델의 성능 검증을 위해 사용된 데이터셋 구성과 전처리 과정을 상세히 설명한다.

데이터셋 구성 및 전처리

본 장에서는 3장에서 제안한 머신러닝 기반 이상행위 탐지 모델의 성능을 검증하기 위해 사용한 데이터셋의 구성과 전처리 과정을 설명한다. 의료 네트워크 환경에서의 실제 적용 가능성을 고려하여, 본 연구는 정상 트래픽과 악성 트래픽을 균형 있게 구성한 데이터셋을 활용하였다. 이를 통해 각 모델의 탐지 성능을 공정하고 객관적으로 비교하고자 하였다.

1. 데이터셋 구성 개요

이상행위 탐지 모델의 성능은 학습 데이터의 품질과 구성에 크게 의존한다. 본 연구에서는 정상 및 악성 트래픽을 명확히 구분한 지도 학습 기반 데이터셋을 구성함으로써, 모델의 분류 성능을 정량적으로 평가할 수 있도록 설계하였다. 이러한 구성은 오탐(False Positive)과 미탐(False Negative)을 동시에 분석할 수 있다는 장점을 가진다.

데이터셋은 공개 침입 탐지 데이터와 실제 보안 운영 환경에서 확보한 데이터를 결합하여 구성하였다. 이를 통해 연구 결과가 특정 데이터셋에 종속되지 않고, 실제 의료 네트워크 환경에도 적용 가능하도록 하였다.

2. 악성 데이터 구성

악성 데이터는 두 가지 출처를 기반으로 수집하였다. 첫째, Emerging Threats(ET)에서 제공하는 공개 규칙 기반 데이터이다(Proofpoint, 2024).

ET 규칙은 SNORT 및 SURICATA와 같은 네트워크 침입 탐지 시스템에서 널리 사용되며, 최신 위협 정보를 지속적으로 반영한다. 이 규칙들은 네트워크 트래픽을 분석하여 다양한 위협, 공격, 악성 코드 활동을 탐지하고 차단할 수 있도록 설계되어 있다. ET-rules는 오픈 소스 커뮤니티에서 적극적으로 개발 및 유지 관리되며, 최신 위협에 대한 규칙이 지속적으로 업데이트된다. SNORT는 오픈 소스 네트워크 침입 탐지 시스템(NIDS)으로, 실시간 트래픽 분석 및 패킷 로깅을 통해 다양한 형태의 네트워크 공격을 탐지한다. 규칙 기반 탐지 방식을 사용하여 악성 트래픽을 식별하며, DoS, 버퍼 오버플로우, 포트 스캐닝과 같은 여러 유형의 공격을 효과적으로 방어한다. · SURICATA는 고성능 네트워크 침입 탐지 및 방지 시스템(NIDS/NIPS)으로, 멀티스레딩을 지원해 높은 처리 성능을 제공한다. SNORT와 호환되는 규칙 외에도, 파일 추출, HTTP, TLS, DNS 분석 등 고급 기능을 제공한다. 두 시스템의 성능 및 기능적 차이는 Table 3을 통해 확인할 수 있다.

Comparison of SNORT and SURICATA.

본 연구를 위하여 Emerging Threats Rules을 제공하고 있는 Proofpoint Emerging Threats Rules을 활용하였다. Proofpoint는 사이버 위협 인텔리전스를 기반으로 최신 위협과 공격에 대한 규칙을 제공하고 있으며, 이는 커뮤니티를 통하여 지속적으로 업데이트되고 있어 최신 공격을 파악하는데 매우 유용하다. 본 연구에서는 ET Open Ruleset 중 최신 규칙을 기반으로 약 5만 건의 악성 트래픽 데이터를 확보하였다.

둘째, 실제 보안관제 환경에서 수집된 악성 트래픽 데이터이다. 해당 데이터는 악성코드 통신, 웹 쉘(web shell), SQL Injection 등 다양한 공격 유형을 포함하고 있으며, 실제 운영 환경에서 발생 가능한 위협을 반영한다. 존의 공개 데이터셋은 최신 공격 트렌드를 반영하지 못하거나 시뮬레이션 환경에 국한된다는 한계가 있다. 이를 보완하고 모델의 실효성을 검증하기 위해, 본 연구에서는 국내 일선 보안 관제 센터(Security Operations Center)의 실제 운영 환경에서 수집된 비식별화된(de-identified) 악성 트래픽 로그 50,000건을 추가로 활용하였다. 해당 데이터셋은 실제 공격자가 시도한 Malware, Web Shell, SQL Injection 등의 최신 실전 공격 패킷을 포함하고 있으며, 개인정보 등 민감한 데이터는 제거(sanitization) 과정을 거쳤다. 이와 같은 내부 데이터를 약 5만 건 추가로 확보하여, 총 10만 건 규모의 악성 데이터 풀(pool)을 구성하였다. 악성 트래픽 수집의 기초가 된 Emerging Threats(ET) Rules의 데이터 구조는 Figure 1에 예시로 제시하였다.

Figure 1.

Malicious Data Based on Emerging Threats (ET) Rules.

<출처 : https://rules.emergingthreats.net/open/>

확보된 악성 데이터에 대해서는 중복 제거 및 불필요한 속성 제거 작업을 수행하였다. 유사한 패턴이 반복되는 데이터는 모델의 편향을 유발할 수 있으므로, 특징 값 기준 정렬 및 중복 제거 과정을 거쳐 최종적으로 98,259건의 악성 데이터셋을 확정하였다.

3. 정상 데이터 구성

정상 데이터는 캐나다 뉴브런즈윅 대학교(University of New Brunswick)의 Canadian Institute for Cybersecurity(CIC)에서 공개한 CIC-IDS2017 데이터셋을 활용하였다. CIC-IDS2017은 실제 네트워크 환경과 유사한 조건에서 수집된 대표적인 침입 탐지 평가용 데이터셋으로, 다양한 정상 트래픽과 공격 트래픽을 포함하고 있다(Sharafaldin et al., 2018).

CIC-IDS2017 데이터셋의 수집 기간은 2017년 7월 3일부터 7월 7일까지 5일간으로, 요일별로 서로 다른 공격 시나리오와 정상 트래픽이 구성되어 있다. 본 연구에서는 공격 시나리오가 포함되지 않은 순수 정상 트래픽을 확보하기 위해, CIC-IDS2017 데이터셋 중 월요일(Monday) 세트만을 활용하였다. Monday 데이터는 FTP, TCP, UDP, DNS, HTTP, LDAP, Kerberos 등 다양한 프로토콜을 포함하면서도 공격 트래픽이 포함되어 있지 않기 때문에, 정상 트래픽의 대표 표본으로 적합하다. 이 중 약 10만 건의 정상 트래픽 데이터를 추출하여, 악성 데이터와 유사한 규모가 되도록 조정한 후 전처리 과정을 거쳐 최종적으로 98,773건의 정상 데이터셋을 구성하였다.

Fig. 3은 본 연구에서 정상 데이터의 표본으로 활용한 CIC-IDS2017 데이터셋 (Monday-WorkingHours.pcap)의 트래픽을 Wireshark 패킷 분석 도구를 통해 확인한 화면이다. 해당 캡처 화면은 악성 공격이 배제된 상태에서 발생하는 ARP, IGMPv3, LLMNR 등 전형적인 내부 네트워크 통신 흐름을 보여준다.

Figure 3.

Snapshot of normal network traffic analysis using Wireshark (CIC-IDS2017 Monday-WorkingHours.pcap).

일례로 화면에 선택된 67번 패킷을 살펴보면, 출발지 IP(192.168.10.9)에서 멀티캐스트 주소(224.0.0.252)를 향해 UDP 포트 5355를 통해 전송된 LLMNR 표준 질의(Standard query) 패킷의 헤더 및 페이로드 구조를 확인할 수 있다. 본 연구에서 제안하는 머신러닝 모델들은 이와 같은 정상 트래픽의 고유한 프로토콜 및 페이로드 특성을 학습하여 정상 행위의 기준선(Baseline)을 구축하며, 이를 바탕으로 변종 공격 및 이상 트래픽을 효과적으로 식별하게 된다.

4. 데이터 전처리 과정

본 연구를 위하여 기초데이터로 악성데이터 10만개(ETrules 5만개, 자체 보유 악성데이터 5만개)와 정상데이터 10만개(CIC-IDS2017)를 기반으로 데이터셋을 구성하였다.

머신러닝 모델 학습을 위해 정상 및 악성 데이터에 대해 공통적인 전처리 과정을 적용하였다. 먼저 네트워크 흐름 기반 특징 중 모델 학습에 직접적인 영향을 미치지 않는 식별자 정보(IP 주소, 포트 번호 등)는 제거하였다. 이후 결측치 처리 및 이상치 확인을 통해 데이터 품질을 개선하였다.

특히 원시 패킷 데이터 내부에는 트래픽의 실질적인 행위적 특성을 반영하지 못하는 무의미한 데이터가 다수 포함되어 있다. Fig. 4는 정상 데이터셋에 포함되어 있던 불필요한 데이터의 예시를 보여준다. 붉은색 박스로 표시된 바와 같이, 페이로드 정보 없이 단순히 0000, 000000 등 의미 없는 0(Zero) 값으로만 채워진 Null 패딩 데이터들은 모델의 학습 효율성을 저하시키고 왜곡을 유발할 수 있으므로 전처리 과정에서 모두 식별하여 삭제 조치하였다.

Figure 4.

Example of unnecessary data (highlighted in red) removed from the normal dataset during preprocessing.

또한, 모델의 학습 편향을 방지하기 위해 원시 데이터에서 중복된 트래픽 기록을 제거하는 고유값 필터링(Uniqueness filtering) 작업을 수행하였다. 수집된 대규모 패킷의 특징 값 중 동일한 패턴이 반복해서 학습될 경우, 모델이 특정 패턴에 과적합(Overfitting)되어 일반화 성능이 저하될 우려가 있다. Fig. 5는 텍스트 정제 도구를 활용해 중복 라인을 제거하고 고유한 데이터만을 추출 및 정렬(Sort lines: unique ascending)하는 과정을 보여준다. 화면 좌측 하단의 최종 라인 수에서 확인할 수 있듯, 이러한 무의미한 데이터(Fig. 4) 제거 및 중복 정제 과정을 거쳐 최종적으로 98,773건의 고유한 정상 데이터셋을 확정하였다(악성 데이터 역시 이와 동일한 전처리 과정을 거쳐 98,259건으로 정제되었다).

Figure 5.

Data preprocessing phase for normal traffic records.

결과적으로 정상과 악성 데이터의 클래스 불균형을 최소화하기 위해 이처럼 유사한 규모로 데이터 수를 조정하였으며, 전체 데이터셋은 학습 데이터와 평가 데이터로 분할하여 사용하였다. 이러한 체계적인 전처리 과정은 모델이 특정 클래스에 편향되지 않고 높은 일반화 성능을 확보하는 데 기여한다.

실험 결과 및 분석

본 장에서는 4장에서 구성한 데이터셋을 기반으로, 3장에서 제안한 머신러닝 기반 이상행위 탐지 모델(K-means Clustering, Random Forest, LightGBM)의 성능을 평가하고 그 결과를 비교·분석한다. 모든 모델은 동일한 데이터셋과 평가 지표를 사용하여 학습 및 검증을 수행함으로써, 모델 간 성능 비교의 공정성을 확보하였다.

1. 평가 지표 및 실험 환경

이상행위 탐지 모델의 성능 평가는 분류 문제에서 널리 사용되는 Accuracy, Precision, Recall, F1-score를 중심으로 수행하였다. Accuracy는 전체 예측 중 올바르게 분류된 비율을 의미하며, Precision은 모델이 악성으로 판단한 트래픽 중 실제 악성 트래픽의 비율을 나타낸다. Recall은 실제 악성 트래픽 중 모델이 탐지한 비율을 의미하며, F1-score는 Precision과 Recall의 조화 평균으로 두 지표 간 균형을 평가한다.

본 연구에서는 정상 데이터 98,773건과 악성 데이터 98,259건을 활용하였으며, 모델 학습 및 평가는 동일한 데이터 분할 조건에서 수행하였다. 이를 통해 데이터 편향이나 학습 조건 차이에 따른 성능 왜곡을 최소화하였다.

2. K-means Clustering 기반 탐지 결과

K-means Clustering 모델은 비지도 학습 기반 이상행위 탐지 모델로서, 정상 및 악성 트래픽을 군집화한 후 군집 특성을 기반으로 이상 여부를 판단하였다. 실험 결과 K-means Clustering 모델의 전체 정확도(Accuracy)는 0.7504로 나타났다.

악성 트래픽에 대한 Recall은 0.9631로 비교적 높게 나타났으나, Precision은 0.6763으로 낮은 값을 보였다. 이는 다수의 악성 트래픽을 탐지할 수 있으나, 정상 트래픽을 악성으로 오탐하는 비율이 상대적으로 높음을 의미한다. 반면 정상 트래픽에 대한 Precision은 0.9353으로 높게 나타났으나, Recall은 0.5367로 낮아 정상 트래픽을 충분히 재현하지 못하는 한계를 보였다.

이러한 결과는 K-means Clustering이 초기 이상 징후를 포착하는 데는 유용할 수 있으나, 의료 네트워크 환경과 같이 오탐에 민감한 환경에서는 단독 적용에 한계가 있음을 시사한다.

· Model Accuracy: 0.7504364773234804

3. Random Forest 기반 탐지 결과

Random Forest 모델은 지도 학습 기반 분류 모델로서, 정상 및 악성 트래픽 간의 복잡한 비선형 관계를 학습하도록 설계되었다. 실험 결과 Random Forest 모델의 전체 정확도는 0.9414로, K-means Clustering 대비 현저히 향상된 성능을 보였다.

악성 트래픽에 대한 Precision과 Recall은 각각 0.9828과 0.9021로 나타났으며, F1-score는 0.9407로 높은 균형 성능을 보였다. 정상 트래픽에 대해서도 Recall 0.9845, F1-score 0.9463으로 매우 우수한 결과를 나타냈다. 이는 Random Forest 모델이 악성 트래픽 탐지뿐 아니라 정상 트래픽 식별에서도 안정적인 성능을 제공함을 의미한다.

· Model Accuracy: 0.9413804770766367

특히 Random Forest는 다양한 특징을 종합적으로 고려함으로써 특정 공격 유형에 과적합되지 않고, 의료 네트워크 환경에서 요구되는 일반화 성능을 효과적으로 확보한 것으로 분석된다.

4. LightGBM 기반 탐지 결과

LightGBM 모델은 Gradient Boosting 기반의 고속 학습 모델로, 대규모 데이터 환경에서의 효율성과 정확도를 동시에 고려하여 설계되었다. 실험 결과 LightGBM 모델의 전체 정확도는 0.9413으로 Random Forest와 유사한 수준의 성능을 보였다

악성 트래픽에 대한 Precision은 0.9535, Recall은 0.9273으로 나타났으며, F1-score는 0.9403으로 균형 잡힌 성능을 확인하였다. 정상 트래픽에 대해서도 Precision 0.9297, Recall 0.9551을 기록하여 안정적인 분류 성능을 보였다.

LightGBM은 Random Forest 대비 학습 및 예측 속도가 빠르다는 장점을 가지며, 대규모 의료 네트워크 트래픽을 실시간 또는 준실시간으로 처리해야 하는 환경에서 실무적 활용 가능성이 높다.

5. 모델 간 성능 비교 및 분석

세 가지 모델의 성능을 종합적으로 비교한 결과, Random Forest와 LightGBM은 K-means Clustering 대비 전반적으로 우수한 탐지 성능을 보였다. 특히 두 지도 학습 모델은 Accuracy, Precision, Recall, F1-score 전반에서 유사한 수준의 높은 성능을 기록하였다. Table 7에서 K, R, L은 각각 K-means Clustering, Random Forest, LightGBM 모델을 의미한다.

Integrated Performance Comparison of Models (K-means, Random Forest, LightGBM).

Random Forest는 전체 정확도와 정상 트래픽 재현율 측면에서 가장 우수한 결과를 보였으며, 탐지 결과에 대한 해석 가능성 또한 제공한다는 장점을 가진다. 반면 LightGBM은 Random Forest와 유사한 탐지 성능을 유지하면서도, 학습 및 예측 속도 측면에서 효율성이 높아 대규모 환경에 적합한 특성을 보였다.

K-means Clustering은 상대적으로 낮은 정확도를 보였으나, 라벨 정보가 부족한 환경에서 초기 이상 탐지 또는 보조적 탐지 수단으로 활용 가능성이 있다. 이러한 결과는 의료 네트워크 환경에서 단일 알고리즘에 의존하기보다는, 운영 환경과 목적에 따라 적절한 모델을 선택하거나 복합적으로 활용하는 전략이 필요함을 시사한다.

본 장의 실험 결과를 통해 제안한 머신러닝 기반 이상행위 탐지 모델의 유효성을 검증하였으며, 다음 장에서는 연구의 결론과 향후 연구 방향을 제시한다.

결론

본 연구에서는 의료 네트워크 환경에서의 이상행위 탐지를 효과적으로 수행하기 위한 머신러닝 기반 탐지 모델을 제안하고, 그 성능을 실증적으로 비교·분석하였다. 의료 환경은 다양한 프로토콜과 장비가 혼재되고 트래픽 변동성이 큰 특성을 가지므로, 기존 시그니처 및 규칙 기반 탐지 방식만으로는 변종 공격이나 신규 위협에 대한 대응에 한계가 있다. 이러한 문제의식에 기반하여 본 연구는 개념 학습 기반 알고리즘의 적용 한계를 분석하고, 실환경 적용성을 고려한 머신러닝 기반 접근을 중심으로 연구를 수행하였다.

연구 결과, 비지도 학습 기반의 K-means Clustering은 라벨 정보가 부족한 환경에서 초기 이상 징후를 탐지하는 데 활용 가능성이 있으나, 오탐률이 상대적으로 높아 단독 적용에는 한계가 있음을 확인하였다. 반면 지도 학습 기반의 Random Forest와 LightGBM 모델은 약 94% 수준의 높은 정확도와 균형 잡힌 Precision 및 Recall 성능을 보이며, 의료 네트워크 환경에서 요구되는 안정성과 일반화 성능을 충족하는 것으로 나타났다. 특히 Random Forest는 전반적인 탐지 정확도와 해석 가능성 측면에서 우수한 결과를 보였으며, LightGBM은 유사한 탐지 성능을 유지하면서도 학습 및 예측 속도 측면에서 효율성이 높아 대규모 트래픽 환경에 적합한 특성을 보였다.

본 연구의 의의는 단일 알고리즘의 우수성을 주장하는 데 있지 않고, 의료 환경의 운영 요구사항을 기준으로 서로 다른 머신러닝 모델을 동일한 데이터셋과 평가 지표 하에서 비교·검증함으로써, 실무적으로 적용 가능한 이상행위 탐지 모델 선택에 대한 근거를 제시했다는 점에 있다. 또한 공개 데이터셋과 실제 보안관제 환경에서 수집한 악성 데이터를 결합하여 데이터셋을 구성함으로써, 연구 결과의 현실 적용 가능성을 높였다.

본 연구의 실험 결과, Random Forest와 LightGBM은 약 20만 건의 트래픽과 노이즈가 포함된 환경에서도 94% 이상의 높은 탐지 정확도(Accuracy)와 안정적인 분류 성능을 달성하였다. 이는 단일 구체적 가설만을 탐색하거나 노이즈에 매우 취약하여 가설 공간이 폭발(Hypothesis Space Explosion)해버리는 전통적인 개념 학습 알고리즘(Find-S, Version Space 등)의 구조적 한계를 정량적으로 크게 상회하는 결과이다. 개념 학습 알고리즘은 데이터가 완벽하게 라벨링된 소규모 통제 환경에서만 제한적으로 유효했던 반면, 본 연구에서 적용한 앙상블 머신러닝 기법은 대규모 스트리밍 트래픽과 불완전한 데이터가 혼재하는 실제 의료 네트워크 환경에서 실질적인 탐지 및 일반화가 가능함을 입증하였다.

향후 연구에서는 실시간 스트리밍 트래픽 환경에서의 모델 성능 검증과 함께, 탐지 결과를 보안 운영에 효과적으로 연계하기 위한 경보 우선순위 설정 및 대응 자동화 방안에 대한 연구가 필요하다. 또한 의료 환경 특성을 반영한 특징 엔지니어링 고도화와 모델 간 앙상블 적용을 통해 탐지 정확도와 안정성을 추가적으로 향상시킬 수 있을 것으로 기대된다.

본 연구 결과는 의료 네트워크 환경에서의 이상행위 탐지 체계 설계 및 운영에 있어 실질적인 참고 자료로 활용될 수 있으며, 향후 의료 보안 분야에서의 데이터 기반 보안 기술 발전에 기여할 것으로 기대된다.

본 연구는 차의과학대학교 의학전문대학원 정보의학 연구소의 “AIM: AI 기반 차세대 보안 정보관리기법 적용 Cognitive Intelligence 및 Secure-오픈 프레임워크(S-OFW) 기술 개발” 과제로부터 위탁을 받아 수행되었다.

Figure 2.

CIC-IDC2017 Dataset Overview.

< 출처 :https://www.unb.ca/cic/datasets/ids-2017.html>

Figure 6.

Evaluation Model Implementation for Performance Assessment.

Figure 7.

Evaluation Model Based on K-means Clustering.

Figure 8.

Analysis Results of the K-means Clustering Model.

Figure 9.

Evaluation Model Based on Random Forest.

Figure 10.

Analysis Results of the Random Forest Model.

Figure 11.

Evaluation Model Based on LightGBM.

Figure 12.

Analysis Results of the LightGBM Model.

Performance Results of the K-means Clustering Model.

Performance Results of the Random Forest Model.

Performance Results of the LightGBM Model.

References

Alani M. M., Mashatan A., Miri A.. 2024. XMeDNN: An explainable deep neural network system for intrusion detection in Internet of Medical Things. In : Proceedings of the 10th International Conference on Information Systems Security and Privacy. 143–151.
Axelsson S.. 2000. Intrusion Detection Systems: A Survey and Taxonomy, Technical Report No. 99-15 Chalmers University of Technology.
Breiman L.. 2001;Random forests. Machine Learning 45(1):5–32. https://doi.org/10.1023/A:1010933404324.
Chandekar P., Mehta M., Chandan S.. 2025. Enhanced anomaly detection in IoMT networks using ensemble AI models on the CICIoMT2024 dataset. arXiv preprint arXiv:2502.11854.
Ke G., Meng Q., Finley T., Wang T., Chen W., Ma W., Ye Q., Liu T.. 2017;LightGBM: A highly efficient gradient boosting decision tree. Advances in Neural Information Processing Systems 30:3146–3154.
Korea Internet & Security Agency (KISA). 2021. Digital Healthcare Security Guidelines Korea Internet & Security Agency. [Korean Literature].
Korea Internet & Security Agency (KISA). 2023. Digital Healthcare Security Model Manual and Case Studies Korea Internet & Security Agency. [Korean Literature].
Kumar G., Alqahtani H.. 2023;Deep learning-based intrusion detection system for cloud-based medical IoT networks, Computers. Materials & Continua 141(3):5849–5867. https://doi.org/10.32604/cmc.2023.044138.
MacQueen J.. 1967;Some methods for classification and analysis of multivariate observations. Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability 1:281–297.
Ministry of Science and ICT (MSIT). 2021. Implementation of Digital Healthcare Security Enhancement Project Ministry of Science and ICT. [Korean Literature].
Mitchell T. M.. 1997. Machine Learning McGraw-Hill.
Patcha A., Park J.-M.. 2007;An overview of anomaly detection techniques: Existing solutions and latest technological trends. Computer Networks 51(12):3448–3470. https://doi.org/10.1016/j.comnet.2007.02.001.
Proofpoint. 2024. Emerging Threats Open Ruleset https://rules.emergingthreats.net/ (accessed Apr. 2026).
Roesch M.. 1999. Snort: Lightweight intrusion detection for networks. In : Proceedings of the 13th USENIX Conference on System Administration. 229–238.
Sharafaldin I., Lashkari A. H., Ghorbani A. A.. 2018. Toward generating a new intrusion detection dataset and intrusion traffic characterization. In : Proceedings of the 4th International Conference on Information Systems Security and Privacy. 108–116. https://doi.org/10.5220/0006639801080116.
Sun R., et al. 2024;Cybersecurity in healthcare: A systematic review of frameworks, metrics, and risk assessment methodologies. International Journal of Medical Informatics 185:105370. https://doi.org/10.1016/j.ijmedinf.2024.105370.
Yaacoub J. P. A., et al. 2020;Securing internet of medical things systems: Limitations, issues and recommendations. Future Generation Computer Systems 105:581–606. https://doi.org/10.1016/j.future.2019.12.001.

Article information Continued

Figure 3.

Snapshot of normal network traffic analysis using Wireshark (CIC-IDS2017 Monday-WorkingHours.pcap).

Figure 4.

Example of unnecessary data (highlighted in red) removed from the normal dataset during preprocessing.

Figure 5.

Data preprocessing phase for normal traffic records.

Figure 6.

Evaluation Model Implementation for Performance Assessment.

Figure 7.

Evaluation Model Based on K-means Clustering.

Figure 8.

Analysis Results of the K-means Clustering Model.

Figure 9.

Evaluation Model Based on Random Forest.

Figure 10.

Analysis Results of the Random Forest Model.

Figure 11.

Evaluation Model Based on LightGBM.

Figure 12.

Analysis Results of the LightGBM Model.

Table 1.

Comparison of Concept Learning-based Algorithms.

알고리즘 대규모 데이터 분석 노이즈 처리 실시간 데이터 처리 다양한 이상 탐지 불완전한 데이터 처리 적합 여부
Find-S 알고리즘 - 대규모 데이터를 다루기 어려움. - 노이즈에 민감하여 데이터 변동이나 이상치에 적응하기 어려움 - 단일 예시만으로 구체적 가설을 찾기 때문에 실시간 데이터 적응이 어려움 - (일반화 능력 부족) 단일 구체적 가설만 찾기 때문에 다양한 이상 탐지가 불가능 - 불완전한 데이터에서 잘못된 결론을 도출하기 쉬움 부적합
- 구체적 가설만 찾음으로 계산량은 적으나 일반화 부족
Version Space 알고리즘 - 모든 가설을 유지하며 탐색하므로 계산 복잡성이 매우 큼 - 노이즈에 매우 취약하여 잘못된 데이터로 가설 공간이 비거나 잘못 형성됨 - 실시간으로 가설 공간을 좁히는 것이 비효율적이고 느림 - 다양한 공격 패턴에 적응 어려움: 가설 공간이 너무 크거나 좁아짐 - 불완전한 데이터에서 가설 경계가 잘못 형성되거나 비어버릴 수 있음 부적합
Candidate Elimination 알고리즘 - S와 G 경계를 유지하면서 매번 업데이트해야 하므로 비효율적 - 노이즈에 민감해 잘못된 데이터가 가설 경계를 파괴할 수 있음 - 매번 가설 경계를 업데이트하는 방식으로 실시간 처리에 부적합 - 새로운 형태의 공격이나 변종 공격을 탐지하는 데 한계가 있음 - 모든 데이터가 완벽하게 라벨링되어야 함. 불완전한 데이터 처리에 약함 부적합

Table 2.

Comparison of Machine Learning Models Used in This Study.

모델/특성 대규모 데이터 분석 노이즈 처리 실시간 데이터 처리 다양한 이상 탐지 불완전한 데이터 처리
K-means Clustering - 대규모 데이터셋에서 빠르게 군집화 가능 - 노이즈에 민감하여 이상치가 결과에 영향을 줄 수 있음 - 실시간 처리에 적합하지 않지만 반복 업데이트 가능 - 군집화로 이상 탐지가 가능하나 사전 정의된 클러스터 수에 의존 - 결측치에 민감하여 적절한 전처리가 필요
Random Forest - 고차원 데이터를 효율적으로 처리 - 앙상블 방식으로 노이즈에 대한 내성이 높음 - 빠른 예측 속도로 실시간 데이터 스트리밍에 적합 - 다양한 특성을 고려한 다차원적 분석으로 여러 유형의 이상 탐지 가능 - 결측치에 대한 유연성이 높아 결측치가 포함된 데이터에서도 작동
LGBM (LightGBM) - 대규모 데이터에 최적화되어 빠른 학습 및 예측 성능을 제공 - 노이즈에 강하며, 데이터의 변동성에 잘 대응 - 빠른 학습 및 예측 속도로 실시간 처리에 매우 적합 - 복잡한 관계를 학습하여 다양한 형태의 이상 탐지 가능 - 결측치 처리에 유연하며, 다양한 데이터 형식에 잘 적응

Table 3.

Comparison of SNORT and SURICATA.

기능 SNORT SURICATA
성능 상대적으로 낮음 높음
확장성 높음 매우높음
커뮤니티 크고 활발 작지만성장중
규칙 호환성 자체 규칙 SNORT 규칙호환
관리 편의성 상대적으로 복잡 비교적 간단

Table 4.

Performance Results of the K-means Clustering Model.

Precision Recall F1-score Support
malicious 0.6763 0.9630 0.7946 98773
normal 0.9353 0.5366 0.6820 98259
macro avg 0.8058 0.7498 0.7383 197032
weighted avg 0.8054 0.7504 0.7384 197032

Table 5.

Performance Results of the Random Forest Model.

Precision Recall F1-score Support
malicious 0.9827 0.9020 0.9407 29304
normal 0.9109 0.9844 0.9462 29806
macro avg 0.9468 0.9432 0.9434 59110
weighted avg 0.9465 0.9436 0.9435 59110

Table 6.

Performance Results of the LightGBM Model.

Precision Recall F1-score Support
malicious 0.9535 0.9273 0.9402 29464
normal 0.9297 0.9551 0.9422 29646
macro avg 0.9416 0.9412 0.9412 59110
weighted avg 0.9415 0.9412 0.9412 59110

Table 7.

Integrated Performance Comparison of Models (K-means, Random Forest, LightGBM).

Precision
Recall
F1-score
Support
K R L K R L K R L K R L
malicious 0.6763 0.9827 0.9535 0.9630 0.9020 0.9273 0.7946 0.9407 0.9402 98773 29304 29464
normal 0.9353 0.9109 0.9297 0.5366 0.9844 0.9551 0.6820 0.9462 0.9422 98259 29806 29646
macro avg 0.8058 0.9468 0.9416 0.7498 0.9432 0.9412 0.7383 0.9434 0.9412 197032 59110 59110
weighted avg 0.8054 0.9465 0.9415 0.7504 0.9436 0.9412 0.7384 0.9435 0.9412 197032 59110 59110