본문으로 건너뛰기

CTI 공격 기법 추출을 정밀화한 TTP-R1

TTP-R1이 검색 후보와 집합 단위 강화학습으로 CTI의 MITRE ATT&CK 기법 추출 정확도와 속도를 함께 높였습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

CTI 문장에서 MITRE ATT&CK 공격 기법을 찾는 기존 방식은 수백 개 label과 다중 기법 문장 때문에 class imbalance와 누락 문제를 겪고, LLM 방식도 token-level 생성 목표에 머물러 예측 집합의 정확성과 완전성을 직접 학습하기 어려웠습니다. TTP-R1은 hybrid retriever로 후보 기법을 줄인 뒤 Fine-tuning한 LLM이 기법을 선택하고, Group Relative Policy Optimization과 precision·recall·출력 형식별 verifiable reward로 집합 예측을 조정합니다. 네 개 CTI benchmark에서 평균 F1 최고 성능을 기록했으며, sub-technique-level F1은 retrieval augmentation을 적용한 Claude Sonnet 4.5보다 7.4 percentage points 높았습니다. 8B-parameter 모델을 단일 GPU에서 서비스할 때 28× 빠른 실행 속도도 기록해 정확성과 처리 효율을 함께 확보했습니다.

빠른 이해

새로운 점

공격 기법을 순차적으로 생성하는 대신 검색 후보 집합과 precision·recall·형식 보상을 결합해 집합 예측으로 최적화한 점입니다.

핵심 메커니즘

CTI 텍스트를 hybrid retriever에 입력해 MITRE ATT&CK 후보 기법 집합을 만들고, Fine-tuning한 LLM이 후보를 선택한 뒤 Group Relative Policy Optimization으로 precision·recall·output format을 평가합니다. 검색은 큰 label space를 줄이고, 분해된 verifiable reward는 최종 기법 집합의 정확성과 완전성을 직접 조정합니다.

핵심 수치

  • 평균 F1: 네 개 CTI benchmark에서 최고 성능- TTP-R1 결과
  • Sub-technique-level F1: Claude Sonnet 4.5 with retrieval augmentation 대비 +7.4 percentage points- 본문의 비교 기준
  • 실행 속도: 28× faster- 8B-parameter 모델을 단일 GPU에서 서비스한 조건

섹션별 상세

01

CTI 공격 기법 추출의 한계

CTI 문장을 MITRE ATT&CK 기법으로 매핑하면 위협 정보를 구조화할 수 있지만, 수작업 annotation은 비용이 높아 대규모 처리에 맞지 않습니다. ATT&CK taxonomy에는 수백 개의 공격 기법이 있고 한 문단에 여러 기법이 함께 나타날 수 있어, 가능한 label 수가 크고 정답 집합이 여러 항목으로 구성됩니다. 기존 multi-label classifier는 심한 class imbalance와 넓은 label space 때문에 불리하며, retrieval pipeline과 Fine-tuning generator를 포함한 LLM 방식은 token-level objective를 최적화합니다. 이 방식은 문장을 순서대로 생성하는 데 초점을 두기 때문에 예측한 기법 집합이 정확하고 완전한지 직접 감독하기 어렵습니다.
02

검색과 강화학습을 결합한 TTP-R1

TTP-R1은 retrieval-augmented supervised fine-tuning과 verifiable reward를 사용하는 reinforcement learning을 두 단계로 결합합니다. 먼저 hybrid retriever가 수백 개에 이르는 후보 label space를 검색해 가능한 공격 기법 집합을 좁히고, Fine-tuning한 LLM이 그 후보 중 CTI 문장에 맞는 기법을 선택합니다. 이후 Group Relative Policy Optimization을 적용하면서 예측 집합의 precision, recall, output format을 분리한 reward로 계산합니다. 따라서 입력 CTI 텍스트가 후보 검색을 거쳐 기법 집합으로 변환되고, 강화학습 단계에서 정확성·완전성·형식 준수 여부가 함께 조정됩니다.
03

벤치마크 성능과 추론 속도

TTP-R1은 네 개의 CTI benchmark에서 평균 F1 기준 최고 성능을 기록했습니다. 특히 sub-technique-level F1은 retrieval augmentation을 적용한 Claude Sonnet 4.5보다 7.4 percentage points 높았습니다. 또한 8B-parameter 모델을 단일 GPU에서 서비스할 때 Claude Sonnet 4.5 기반 비교 방식보다 28× 빠르게 실행됐습니다. 후보 검색으로 선택 공간을 줄이고 집합 단위 reward를 사용한 구성이 공격 기법 누락과 오선택을 함께 평가하면서도 실제 처리 속도를 높이는 근거가 됩니다.

용어 해설

사이버 위협 인텔리전스(Cyber Threat Intelligence)
사이버 공격과 관련된 보고서, 관측 결과, 침해 사례 등의 정보를 수집하고 구조화한 데이터입니다. 이 글에서는 CTI 문장에서 공격자의 행동과 사용한 공격 기법을 찾아 MITRE ATT&CK taxonomy의 항목으로 변환하는 입력 자료를 뜻합니다.
MITRE ATT&CK
공격자의 전술과 기법을 체계적으로 분류한 보안 지식 체계입니다. CTI 문장에 나타난 행동을 정해진 공격 기법 식별자와 연결하므로, 비정형 위협 보고서를 비교 가능한 구조화 데이터로 바꾸는 기준으로 활용됩니다.
검색 증강 생성(Retrieval-Augmented Generation)
모델이 입력만으로 답을 생성하지 않고 외부 자료를 먼저 검색한 뒤 검색 결과를 문맥으로 활용하는 방식입니다. 이 연구에서는 거대한 공격 기법 label space를 후보 집합으로 좁혀 LLM이 선택할 대상을 줄이는 역할을 합니다.
검증 가능한 보상 기반 강화학습(Reinforcement Learning with Verifiable Rewards)
모델 출력의 정답 여부를 자동으로 판정할 수 있는 보상 함수를 사용해 정책을 조정하는 강화학습 방식입니다. TTP-R1은 예측 집합의 precision, recall, 출력 형식을 각각 보상에 반영해 기법 목록의 정확성과 완전성을 직접 학습시킵니다.
그룹 상대 정책 최적화(Group Relative Policy Optimization)
여러 후보 출력의 상대적인 보상 차이를 이용해 언어 모델의 정책을 업데이트하는 강화학습 최적화 방식입니다. 이 글에서는 분해된 보상으로 여러 공격 기법 집합을 비교하고, precision·recall·형식 조건을 만족하는 출력을 선호하도록 TTP-R1을 조정합니다.

기술

  • TTP-R1
  • MITRE ATT&CK
  • retrieval-augmented supervised fine-tuning (SFT)
  • reinforcement learning with verifiable rewards (RLVR)
  • Group Relative Policy Optimization
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 15.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.