악성코드 탐지, 그래프 뉴럴 네트워크로 개선하기
기업의 시스템에 알 수 없는 이상 행동이 감지됩니다. 파일도 없고, 로그도 거의 남지 않은 상태에서 내부 정보가 외부로 유출됩니다.
하지만, 기존에 알려진 악성코드의 시그니처 패턴이 감지된 것은 없었습니다.
※ 시그니처: 각 악성코드가 가지는 고유 특성으로, 해당 악성코드가 사용하는 특정 명령어 시퀀스, 특정 패턴 등을 의미
파일을 남기지 않는 '파일리스(Fileless)' 악성코드는 이제 단순한 예외가 아니라, 기존 보안 체계가 놓치기 쉬운 새로운 위협의 전형이 되어가고 있습니다.
악성코드를 ‘그래프'로 접근해보면 어떨까요?
그래프 머신러닝(GNN)과 악성코드 간 네트워크를 활용해 풀어낸 악성코드 탐지 연구 사례[1]를 소개합니다.
시퀀스 기반 악성코드의 유사도를 그래프 구조로 모델링함으로써,
기존보다 높은 정확도와 탐지 효율을 확인할 수 있었습니다
배경
새로운 악성코드 대응의 어려움
점차 파일을 남기지 않는 Fileless Malware가 증가하면서, 시그니처를 기반으로 악성코드를 탐지하는 방식이 한계를 드러내고 있습니다.
특히 PowerShell과 같은 스크립트 언어를 활용한 악성코드는 흔적을 거의 남기지 않아 정적 탐지 기법의 포렌식 분석이 매우 어렵죠.
이러한 변종 악성코드에 대응하기 위해서는, 기존의 정형화된 시그니처가 아닌 다른 접근이 필요합니다.
주요 아이디어
스크립트 간 유사성 기반 그래프로 악성코드 탐지
이 연구는 PowerShell 스크립트를 구성하는 명령어 시퀀스(로그, 코드 등)가 얼마나 비슷한지를 비교하여, 스크립트 간 네트워크를 구성하였습니다.
그리고 각 스크립트가 악성인지 여부를 예측하기 위해, 시퀀스 유사도를 기반으로 생성한 스크립트 네트워크 구조를 그래프 뉴럴 네트워크(Graph Neural Network)로 학습시켰습니다.
그래프 신경망(GNN, Graph Neural Network)은 각 개체의 속성뿐만 아니라, 해당 개체와 연결된 이웃 노드의 정보와 관계 구조까지 함께 학습하는 모델입니다.
즉, “나의 특성은 나 자신뿐 아니라, 나와 연결된 이웃들로부터 영향을 받는다”는 전제를 바탕으로 작동합니다.
솔루션
1단계. 스크립트 간 네트워크 구조화
PowerShell 악성코드 스크립트에서 시퀀스를 추출합니다.
참고로, 아래는 스크립트와 시퀀스 간의 네트워크를 시각적으로 구성해 본 그림입니다.
한 시퀀스가 여러 스크립트에 사용될 수 있으므로, 이 시퀀스가 어느 정도 중복되는지(Jaccard Coefficient)에 따라 스크립트 간 유사도 네트워크를 구성할 수 있습니다.
예를 들어, 그림에서 스크립트 1과 스크립트 2는 시퀀스 A,D 두 개의 시퀀스를 동시에 가지고 있기 때문에 유사한 관계로 정의합니다.
2단계. 그래프 뉴럴 네트워크 모델 학습
이 연구에서는 각 스크립트의 특성(시퀀스 구성)과 어떤 악성 스크립트와 연결되어 있는지를 함께 고려하기 위하여 그래프 뉴럴 네트워크를 활용했습니다.
즉, 기존 축적된 정보가 전혀 없는 새로운 형태의 악성코드라도, 시퀀스가 유사한 기존 악성코드와의 연결을 통해 악성코드 여부를 탐지할 수 있는 분류 모델을 구축하였습니다.
모델 성능 비교를 위해, 대조군으로 스크립트 특성만 학습한 모델(CNN)과 스크립트 간 단위 행렬(Identity Matrix)를 학습한 모델(GCN(Identity Matrix))를 추가로 생성하였습니다.
결론
그래프 구조로 악성코드 탐지 정확도를 향상
결론적으로, 대조군 대비 그래프 뉴럴 네트워크 모델의 탐지 성공율이 더욱 높게 나타났습니다.
디지털 인프라가 정교해지고, 악성코드는 파일도 남기지 않는 ‘파일리스’ 형태로 진화하면서, 기존의 시그니처 기반의 보안 시스템으로는 점차 위협을 포착하기 어려워지고 있습니다.
악성 스크립트 간의 관계를 그래프로 분석하는 방식은, 변화하는 공격 패턴에 적응할 수 있는 유연성을 제공하며, 탐지 사각지대를 줄이고 보안 운영의 효율성을 높이는 데 기여합니다.
이는 보안 체계 전반의 전략적 경쟁력을 강화하는 핵심 요소로 작용할 수 있습니다.
(주) 사이람
1660-4230 | netminer@cyram.com
References
[1] Park, Y.-H., Kim, B.-H., & Choi, S. (2021).
A Study for Detecting Malware Using GCN. Annual Conference of KIPS, 213–216. https://doi.org/10.3745/PKIPS.Y2021M11A.213

