TL;DR
CTI 문장에서 MITRE ATT&CK 공격 기법을 찾는 기존 방식은 수백 개 label과 다중 기법 문장 때문에 class imbalance와 누락 문제를 겪고, LLM 방식도 token-level 생성 목표에 머물러 예측 집합의 정확성과 완전성을 직접 학습하기 어려웠습니다. TTP-R1은 hybrid retriever로 후보 기법을 줄인 뒤 Fine-tuning한 LLM이 기법을 선택하고, Group Relative Policy Optimization과 precision·recall·출력 형식별 verifiable reward로 집합 예측을 조정합니다. 네 개 CTI benchmark에서 평균 F1 최고 성능을 기록했으며, sub-technique-level F1은 retrieval augmentation을 적용한 Claude Sonnet 4.5보다 7.4 percentage points 높았습니다. 8B-parameter 모델을 단일 GPU에서 서비스할 때 28× 빠른 실행 속도도 기록해 정확성과 처리 효율을 함께 확보했습니다.
빠른 이해
새로운 점
공격 기법을 순차적으로 생성하는 대신 검색 후보 집합과 precision·recall·형식 보상을 결합해 집합 예측으로 최적화한 점입니다.
핵심 메커니즘
CTI 텍스트를 hybrid retriever에 입력해 MITRE ATT&CK 후보 기법 집합을 만들고, Fine-tuning한 LLM이 후보를 선택한 뒤 Group Relative Policy Optimization으로 precision·recall·output format을 평가합니다. 검색은 큰 label space를 줄이고, 분해된 verifiable reward는 최종 기법 집합의 정확성과 완전성을 직접 조정합니다.
핵심 수치
- 평균 F1: 네 개 CTI benchmark에서 최고 성능- TTP-R1 결과
- Sub-technique-level F1: Claude Sonnet 4.5 with retrieval augmentation 대비 +7.4 percentage points- 본문의 비교 기준
- 실행 속도: 28× faster- 8B-parameter 모델을 단일 GPU에서 서비스한 조건
섹션별 상세
CTI 공격 기법 추출의 한계
검색과 강화학습을 결합한 TTP-R1
벤치마크 성능과 추론 속도
용어 해설
- 사이버 위협 인텔리전스(Cyber Threat Intelligence)
- — 사이버 공격과 관련된 보고서, 관측 결과, 침해 사례 등의 정보를 수집하고 구조화한 데이터입니다. 이 글에서는 CTI 문장에서 공격자의 행동과 사용한 공격 기법을 찾아 MITRE ATT&CK taxonomy의 항목으로 변환하는 입력 자료를 뜻합니다.
- MITRE ATT&CK
- — 공격자의 전술과 기법을 체계적으로 분류한 보안 지식 체계입니다. CTI 문장에 나타난 행동을 정해진 공격 기법 식별자와 연결하므로, 비정형 위협 보고서를 비교 가능한 구조화 데이터로 바꾸는 기준으로 활용됩니다.
- 검색 증강 생성(Retrieval-Augmented Generation)
- — 모델이 입력만으로 답을 생성하지 않고 외부 자료를 먼저 검색한 뒤 검색 결과를 문맥으로 활용하는 방식입니다. 이 연구에서는 거대한 공격 기법 label space를 후보 집합으로 좁혀 LLM이 선택할 대상을 줄이는 역할을 합니다.
- 검증 가능한 보상 기반 강화학습(Reinforcement Learning with Verifiable Rewards)
- — 모델 출력의 정답 여부를 자동으로 판정할 수 있는 보상 함수를 사용해 정책을 조정하는 강화학습 방식입니다. TTP-R1은 예측 집합의 precision, recall, 출력 형식을 각각 보상에 반영해 기법 목록의 정확성과 완전성을 직접 학습시킵니다.
- 그룹 상대 정책 최적화(Group Relative Policy Optimization)
- — 여러 후보 출력의 상대적인 보상 차이를 이용해 언어 모델의 정책을 업데이트하는 강화학습 최적화 방식입니다. 이 글에서는 분해된 보상으로 여러 공격 기법 집합을 비교하고, precision·recall·형식 조건을 만족하는 출력을 선호하도록 TTP-R1을 조정합니다.
기술
- TTP-R1
- MITRE ATT&CK
- retrieval-augmented supervised fine-tuning (SFT)
- reinforcement learning with verifiable rewards (RLVR)
- Group Relative Policy Optimization
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.