여기서는 사이버 위협 인텔리전스 보고서의 파일 경로, 레지스트리 키, 명령줄 표시자를 보안 정보 및 이벤트 관리(SIEM) 탐지 규칙을 위한 검증된 정규 표현식으로 변환하는 프로토콜을 제시합니다. 이는 대형 언어 모델(LLM)과 그래프 지원 컴포넌트 라벨링을 이용한 앙상블 추출입니다.
방법 논문
여기서는 사이버 위협 인텔리전스 보고서의 파일 경로, 레지스트리 키, 명령줄 표시자를 보안 정보 및 이벤트 관리(SIEM) 탐지 규칙을 위한 검증된 정규 표현식으로 변환하는 프로토콜을 제시합니다. 이는 대형 언어 모델(LLM)과 그래프 지원 컴포넌트 라벨링을 이용한 앙상블 추출입니다.
보안 운영 센터(SOC)는 정기적으로 사이버 위협 인텔리전스(CTI) 보고서를 운영 탐지 콘텐츠로 전환합니다. 이 워크플로우에서 지속적인 병목 현상은 추출된 침해 지표(IOC), 특히 파일 경로, 레지스트리 키, 명령줄 문자열을 보안 정보 및 이벤트 관리(SIEM) 상관관계 규칙에 삽입하기 적합한 배포 가능한 정규 표현식(regexe)으로 변환하는 것입니다. 이전 연구들이 자동화된 인디케이터 오브 컴필레이션(IOC) 추출을 개선했지만, 추출된 문자열을 검증된 정규 표현 패턴으로 변환하는 것은 여전히 대부분 수작업이며 전문 지식이 필요하고 오류가 발생하기 쉽습니다. 이 프로토콜의 목표는 IOC에서 정규 표현식으로의 변환을 위한 표준화되고 재현 가능한 절차를 제공하는 것입니다. 워크플로우는 다섯 단계로 구성됩니다: (1) 이기종적인 CTI 보고서를 통합된 Markdown 표현으로 파싱; (2) 합의 투표를 통한 다중 대형 언어 모델(LLM)을 이용한 IOC 추출; (3) 추출된 IOC의 규칙 기반 정규화, 분류 및 중복 제거; (4) IOC 구성 요소의 그래프 지원 라벨링(keep-group) 또는 discard(non-capture-group)로 분류; 그리고 (5) 원래 IOC 문자열에 대한 진단 검증을 포함한 반복적 정규 표현 생성. 유용성 평가를 위해 워크플로우는 3,156개의 CTI 보고서에 적용되었고, 결과 정규 식은 10개의 MITRE 대적 전술, 기법, 공통 지식(ATT&CK) 평가 시나리오에서 독립적으로 수집된 2,400개 이상의 진실 문자열과 비교하여 평균 명중률 99.1%, IOC 간 평균 불일치율 0.8%를 기록했습니다. 따라서 프로토콜은 IOC에서 정규 표현식으로의 변환을 재현 가능한 구현체로 문서화하며, 현재 범위, 운영 가정, 알려진 실패 사례를 명확히 명확히 설명합니다.
사이버 범죄는 공공 및 민간 부문 조직에 상당한 운영 및 재정적 부담을 계속 가하고 있습니다. 2023년 미국 내 사이버 범죄로 인한 손실은 125억 달러를 초과했으며, 이는 악성 활동의 규모와 지속성을 보여줍니다. 이러한 환경 속에서 보안 운영 센터(SOC)는 위협을 실시간으로 탐지, 분석, 대응하는 주요 작전 단위 역할을 합니다.
많은 SOC 워크플로우에서 감지 논리는 보안 정보 및 이벤트 관리(SIEM) 플랫폼 내의 규칙 기반 메커니즘을 통해 구현되며, 이는 해석 가능하고 결정적이며 기존 SOC 워크플로우와 호환되기 때문에 널리 사용됩니다. 다양한 규칙 유형 중에서, 상관관계 기반 SIEM 규칙은 여러 이벤트, 호스트, 시간 창에 걸친 공격 행동을 식별하는 데 특히 중요합니다. 이 규칙들 내에서 정규 표현식(regexe)은 재사용 가능한 탐색 원시 함수로 기능하며, 분석가들은 이를 자기 완성형 탐지기로 배포하는 대신 필드 제약 조건, 플랫폼별 필터, 이벤트 상관관계 논리를 추가하는 더 넓은 탐지 규칙 안에 내장시킵니다.
실제로 SOC 분석가는 보안 공급업체, 독립 연구자, MITRE Adversarial Tactics, Techniques, and Common Knowledge(ATT&CK)와 같은 공개 지식 기반에서 발행된 사이버 위협 인텔리전스(CTI) 보고서에서 도출된 침해 지표(IOC)로 규칙 개발을 시작하는 경우가 많습니다. 이 IOC 문자열에는 파일 경로, 명령줄 조각, 레지스트리 키 또는 공격 중 관찰된 기타 구조화된 아티팩트가 포함될 수있습니다. 이러한 문자열을 SIEM 상관관계 규칙에 적합한 정규 표현 패턴으로 변환하는 작업은 규칙 작성 워크플로우에서 반복되는 작업입니다.
이 번역 단계는 실용적인 운영 병목 현상입니다. 의미 있는 변이를 포착할 만큼 일반적이면서도 의도치 않은 일치를 피할 만큼 정밀한 정규식 패턴을 작성하려면 전문 지식이 필요합니다; 작은 구문 오류나 어떤 구성 요소를 보존하거나 일반화할지 잘못된 결정으로 인해 유용한 탐지 규칙이 효과가 없어질 수 있습니다. 이 작업은 수작업이고 반복적이며 세부적인 작업이기 때문에 신흥 위협에 대한 탐지 배치가 지연될 수 있고, 더 경험 많은 분석가의 검토가 필요하며, 운영 SOC 4,5 환경에서 분석가의 업무량을 증가시킬 수 있습니다.
IOC에서 정규 표현식으로의 번역에서 핵심 과제는 IOC의 어떤 부분이 안정적이고 공격자와 관련된 동작을 인코딩하여 보존해야 하는지, 그리고 어떤 부분이 환경이나 호스트에 따른 변동성을 반영하여 일반화되어야 하는지 결정하는 것입니다. 예를 들어, HKEY_CLASSES_ROOT\CLSID와 같은 표준 레지스트리 루트, System32와 같은 시스템 디렉터리, rundll32.exe와 같은 알려진 실행 파일은 일반적으로 명시적으로 유지해야 하며, 사용자 프로필 경로, 호스트별 보안 식별자(SID), 전역 고유 식별자(GUID)는 일반적으로 추상화되어야 합니다. 이질적인 IOC 유형 간에 일관되게 이 작업을 수행하는 것이 번역 작업을 결코 간단하지 않게 만듭니다. 이 프로토콜 전반에 걸쳐 전자는 보존 또는 포획 그룹 구성 요소로, 후자는 추상적 또는 비포획 그룹 구성 요소로 부릅니다.
이전 연구에서는 자연어 처리와 엔터티 추출 기법을 이용해 비정형 텍스트에서 위협 인텔리전스를 자동 추출하는 연구가 있었다 6,7. 최근에는 대형 언어 모델(LLM)을 이용해 CTI 보고서에서 직접 탐지 규칙을 생성하는 연구가 여러 연구로 진행되었습니다. 이러한 접근법은 규칙 작성 워크플로우의 일부가 언어 모델의 도움을 받을 수 있음을 보여주지만, 캡처 그룹 의미를 보존하고 하위 SIEM 배포에 적합한 정규 표현식 패턴을 생성하는 구체적인 운영 문제에 일반적으로 집중하지 않습니다. 상호 보완적인 작업들은 TINKER9와 같은 지식 그래프 기반 표현과 ThreatRaptor 10과 같은 CTI 기반 로그 헌팅 쿼리 생성 등 다양한 방식으로 CTI 콘텐츠를 구조화하여 하위 사용을 위해 구조화한 작업을 제공했습니다. ThreatRaptor10은 비구조화된 CTI를 정규 표현 패턴 대신 정규 표현 패턴으로 변환하는 방식입니다.
동시에 이전 연구들은 예제 기반 방법, 신경 번역, 생성 및 복구 방식을 이용한 자동 정규 표현 합성을 탐구해 왔습니다 11,12,13,14,15,16. 하지만 이러한 방법들은 일반적으로 IOC 기반 탐지 맥락보다는 대표적인 예시나 자연어 설명을 대량으로 사용하는 환경에 맞게 설계되었습니다. SOC 워크플로우에서 IOC 문자열은 종종 희소하고 구조적으로 이기종적이며 운영 의미론과 밀접하게 연관되어 있습니다. 이러한 불일치는 기존 정규 표현식 생성 방법이 전반적으로 부족하다는 주장보다는 IOC에서 정규 표현식 변환에 맞춘 워크플로우를 촉진합니다.
여기서 제시된 프로토콜은 SOC 감지 워크플로우의 IOC에서 정규형체로의 변환 단계에 초점을 맞추고 있습니다. IOC 추출은 수동 분석, 자동화 도구 또는 이 두 가지의 조합에서 비롯된 상류 입력으로 취급됩니다; 프로토콜은 완전한 SIEM 규칙을 생성하려고 시도하지 않습니다. 대신, IOC 문자열을 문법적으로 유효하고 의미적으로 해석 가능하며 운영 배포에 적합한 정규 표현식 패턴으로 변환하는 체계적인 절차를 제공합니다. 현재 IOC 범위는 의도적입니다: 파일 경로, 레지스트리 키, 명령줄 표시기는 안정적이고 가변적인 구조 구성 요소를 모두 포함하며, 이는 정규 표현식 일반화의 이점을 얻는 반면, IP 주소, 도메인, 해시와 같은 원자 표시기는 정확히 일치 조건이나 평판 스타일 조회를 통해 더 자연스럽게 작동화되어 주 범위 밖에 위치합니다. 이러한 범위 내에서 프로토콜은 유사한 입력 형식과 도구 전제 조건을 공유하는 SOC 환경 간에 이식 가능하도록 설계되었습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
다음 5단계 워크플로우를 사용하여 CTI 보고서를 검증된 정규 표현식 패턴과 추적 가능한 중간 출력으로 변환합니다(개요는 그림 1 참조).
1. 시스템 설정
2. 1단계: 문서 구문 분석
3. 2단계: IOC 추출
4. 3단계: IOC 분석 및 분류
5. 4단계: Neo4j 보조 IOC 정상화
6. 5단계: 정규 표현식 생성 및 점수 매기기
7. 분석 및 검증
8. 수출 결과
9. 문제 해결
10. 최종 프로토콜 출력 확인.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 절에서는 IOC-정규 표현 프로토콜이 만들어낸 대표적인 결과를 제시하고, 그 운영 적용 가능성을 평가하는 데 사용된 참고 평가를 요약합니다. 참고 평가는 MITRE ATT&CK 기법과 관련된 3,156건의 CTI 보고서를 처리하고, 230,000개 이상의 문장을 분석했으며, 63,000개 이상의 IOC 후보를 추출하고, 10개의 MITRE ATT&CK 평가 시나리오에서 독립적으로 수집된 2,400개 이상의 진실 문자열에 대해 생성된 정규 식을 평가했습니다. 이 현장 진실 문자열은 MITRE AT&CK 평가 과정에서 사이버보안 벤더가 독립적으로 보고한 전문가가 선별한 공격 산출물로, 인간 분석가와 벤더가 실제로 문서화하는 구조적 패턴을 반영합니다. 아래 결과는 작업 흐름 동작, 구조적 정확성, 그리고 운영 로그 분석 및 탐지 워크플로우와 관련된 평가 결과에 초점을 맞추고 있습니다.
엔드 투 엔드 파이프라인에 대한 개요...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
비구조화된 CTI 보고서를 실행 가능한 탐지 로직으로 변환하는 작업은 운영 보안 워크플로우에서 여전히 시간이 많이 걸리고 오류가 잦은 작업입니다. 이전에는 IOC 추출 수준이나 고수준 규칙 생성 수준에서 자동화를 탐구한 바 있지만, 실무자들은 추출된 IOC 문자열을 구조적으로 올바르고 의미적으로 정밀하며 하위 SIEM 사용에 적합한 정규 식으로 변환하는 데 여전히 상당한 도전에 직면해 있습니다. 여기서 제시된 프로토콜은 각 단계별 워크플로우를 통해 명확한 중간 산출물을 생성하고 다음 단계로 결과를 전달하기 전에 명시적 검증을 적용하는 과정을 통해 그 공백을 해결합니다. 그림 14 는 이러한 사례 중 하나로, 디팽(deanged)되고 여백이 섞인 파일 경로를 식별, 수정, 정규화하여 컴파일용 정규식으로 변환하는 사례를 기록합니다; 프로토콜의 노이지 입력 처리와 현재 범위는 아래에 열거된 제한사항들과 함께 논의됩니다.<...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 공개할 것이 없습니다.
이 연구는 NSF CNS-2019340과 NSF ECCS-2140175의 일부 지원을 받았습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
```html
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| 컴퓨터 (CPU) | — | ≥ 4 코어 권장 | GPU 불필요 |
| LangChain | LangChain | ≥ 0.1.x | LLM 오케스트레이션 프레임워크 |
| LLM (IOC 추출, 단일 모델) | OpenAI | gpt-5.1 | 앙상블 투표가 비활성화된 경우 IOC 추출(2단계)에 사용됨. 온도 = 0.0; max_workers = 5. 접근: 2025-12-15. |
| LLM (정규식 생성) | OpenAI | gpt-5.1 | 정규식 생성(5단계)에 사용됨. 다운스트림 검증 전 온도 = 0.3. 접근: 2025-12-15. |
| LLM (확장성 특성화) | OpenAI | gpt-5.1 | 대표적인 결과에 보고된 6,000-IOC 확장성 실행에 사용됨. 접근: 2025-12-15. |
| 메모리 (RAM) | — | ≥ 16 GB 권장 | 문서 처리에 필요 |
| Neo4j | Neo4j, Inc. | ≥ 5.x | IOC 정규화를 위한 그래프 데이터베이스 |
| Neo4j Python 드라이버 | Neo4j, Inc. | ≥ 5.x | Neo4j에 대한 Python 인터페이스 |
| 운영 체제 | Microsoft / Apple / Linux | Windows, macOS, 또는 Linux | 크로스 플랫폼 지원 |
| PDF 파싱 — 기본 백엔드 | Microsoft | MarkItDown ≥ 0.0.x | 1단계 백엔드; PDF/DOCX/HTML/TXT 입력을 마크다운으로 변환. 파싱된 출력은 LLM 처리 전에 4,000 문자 단위로 청크화됨. 접근: 2025-12-15. https://github.com/microsoft/markitdown |
| 파이프라인 구성(2단계 — IOC 추출) | — | 참조 기본값 | 단일 LLM 모드: 온도 = 0.0, max_workers = 5. 앙상블 투표 모드 기본값: 구성된 모델당 반복 = 1, 최소 투표 = 2. |
| 파이프라인 구성(5단계 — 정규식 생성) | — | 참조 기본값 | 생성 온도 = 0.3. 검증: IOC당 5개의 결정론적 부정 샘플의 overgen_random_tests. 반복 제한: max_iterations = 10, debug_loop_cap = 5, discard_validation_cap = 5. |
| Python | Python Software Foundation | ≥ 3.8 | 필요한 런타임 환경 |
| 정규식 엔진 | Python 표준 라이브러리 | re 모듈 | 정규식 검증 및 테스트에 사용 |
| Streamlit | Streamlit Inc. | ≥ 1.25 | 웹 기반 사용자 인터페이스 |
| 참조 구현 소스 코드 | 저자 / GitHub | GitHub 저장소 | Streamlit 인터페이스, LangChain 파이프라인, Neo4j 보조 정규화, 정규식 생성, 유효성 검사 유틸리티 및 예제 구성 파일에 대한 소스 코드. https://github.com/SOCautomatic/cti-ioc-regex-pipeline에서 사용 가능. 접근: 2026년 6월 11일. |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청